Technický PRŮVODCE

KServe a modelování na Kubernetes

KServe je standardizovaná, nativní platforma Kubernetes pro poskytování modelů strojového učení ve velkém měřítku.

2 minuty čteníNaposledy aktualizováno

Přehled

It gives teams a single, declarative way to deploy models with autoscaling, canary rollouts, and scale-to-zero, abstracting away most of the Kubernetes plumbing.

Hluboký ponor

KServe, dříve známý jako KFServing a zrozený z projektu Kubeflow, definuje vlastní zdroj InferenceService. Napíšete krátký soubor YAML ukazující na model uložený v úložišti objektů (S3, GCS, Azure Blob) a KServe se postará o zbytek. Podporuje jak prediktivní vyvozování, tak stále více generativní poskytování LLM. KServe dodává předpřipravené „obslužné běhy“ pro běžné rámce (TensorFlow Serving, TorchServe, Triton, scikit-learn, XGBoost, Hugging Face) a podporuje vlastní kontejnery. Je postaven na Knative Serving a síťové vrstvě (Istio nebo podobná) a poskytuje automatické škálování na základě požadavků včetně skutečného škálování na nulu, takže nečinné modely nespotřebovávají žádné výpočty. Také standardizuje predikční API kolem protokolu Open Inference, takže klienti mluví s každým modelem stejným způsobem bez ohledu na rámec.

Technický přehled

Automatické škálování KServe se opírá o Knative, který škáluje počet replik na základě souběžnosti nebo požadavků za sekundu a může klesnout na nulu replik, když se provoz zastaví, a poté na vyžádání spustit studený. InferenceService abstrahuje úplný inferenční kanál do komponent prediktor, transformátor (před/po zpracování) a vysvětlující komponenty. Modely se načítají z úložiště objektů pomocí „inicializátorů úložiště“, které při spuštění vtahují artefakty do modulu a oddělují úložiště modelu od obrazu obslužného kontejneru.

Strategický dopad

Cena a rozpočet

Rozhodnutí o architektuře zvyšují výkon a provozní náklady po mnoho let.

Jasnější rozhodnutí

Technické vzdělání pomáhá týmům vybrat ten správný stack, nejen ten nejnovější.

Kontrola kvality

Lepší konstrukční volby snižují výskyt problémů se spolehlivostí ve výrobě.

Budoucnost KServe a model Serve na Kubernetes

KServe se rychle vyvíjí směrem ke generativní AI a přidává stopu zaměřenou na LLM s funkcemi, jako je směrování s podporou KV-cache, mezipaměť modelu a rozčleněné předvyplnění/dekódování pro velké jazykové modely. Očekávejte hlubší integraci s inferenčními enginy, jako je vLLM, lepší víceuzlové poskytování pro modely příliš velké pro jeden GPU a směrování na úrovni brány pro vyrovnávání zátěže na základě tokenů. Jako projekt inkubující CNCF se stává de facto otevřeným standardem pro vkládání modelů za Kubernetes, čímž se zužuje propast mezi výzkumnými artefakty a odolnými produkčními koncovými body.

Real-World Implementace

Banka nasazuje model hodnocení úvěrů napsáním 10řádkového InferenceService YAML ukazujícího na model v S3, přičemž KServe zpracovává automatické škálování a ingress.

Tým elektronického obchodu používá zavedení KServe canary k odeslání 10 procent provozu na nový model doporučení a poté, co metriky vypadají dobře, se zvýší na 100 procent.

Výzkumná laboratoř slouží desítkám zřídka používaných modelů s měřítkem na nulu, takže každý model se roztočí pouze tehdy, když přijde požadavek a během nečinnosti nespotřebovává žádný GPU.

Tým MLOps používá komponent transformátoru KServe ke spuštění změny velikosti a normalizace obrazu předtím, než prediktor spustí model vidění servírovaný Tritonem.

Rizika a zábradlí

Optimalizace jednoho benchmarku může skrýt širší systémové slabiny.

Náklady na infrastrukturu a údržbu jsou často podceňovány.

Mezery v zabezpečení a pozorovatelnosti se mohou zvětšovat, jak se systémy stávají složitějšími.

Plán implementace

1

Před implementací definujte cíle latence, kvality a nákladů.

2

Benchmark za realistických podmínek zatížení a dat.

3

Monitorování chyb, posunu a dopadu na uživatele.

4

Před škálováním připravte cesty vrácení zpět a reakce na incidenty.

Pokračujte v objevování

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the KServe and Model Serving on Kubernetes quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Spustit kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Další průvodce

Spekulativní úpravy pro modely kódu

Často kladené otázky

What is KServe and Model Serving on Kubernetes?

KServe je standardizovaná, nativní platforma Kubernetes pro poskytování modelů strojového učení ve velkém měřítku. Poskytuje týmům jediný, deklarativní způsob, jak nasadit modely s automatickým škálováním, zavedením canary a škálováním na nulu, čímž se odstraní většina potrubí Kubernetes.

Jaké bylo předchozí jméno KServe, než se stalo samostatným projektem?

KServe vznikl jako KFServing v rámci projektu Kubeflow, než se stal nezávislou platformou.

Jaký je primární vlastní zdroj Kubernetes, který definujete pro nasazení modelu s KServe?

Pro nasazení a konfiguraci obsluhovaného modelu deklarujete vlastní prostředek InferenceService, obvykle v YAML.

Která funkce umožňuje nečinným modelům KServe spotřebovávat nulový výpočet, dokud nepřijde požadavek?

KServe, postavený na Knative, podporuje škálování na nulu, spouštění replik na nulu, když není provoz, a studené starty na vyžádání.

Který základní projekt poskytuje automatické škálování KServeru řízené požadavky?

KServe staví na Knative Serving, které škáluje repliky na základě souběžnosti nebo rychlosti požadavků a umožňuje škálování na nulu.

Jak KServe obvykle dostává artefakty modelu do obslužného modulu při spuštění?

Inicializátory úložiště stahují artefakty modelu z úložiště objektů (jako S3 nebo GCS) do modulu a oddělují modely od obrazu.