KServe a modelování na Kubernetes
KServe je standardizovaná, nativní platforma Kubernetes pro poskytování modelů strojového učení ve velkém měřítku.
Přehled
It gives teams a single, declarative way to deploy models with autoscaling, canary rollouts, and scale-to-zero, abstracting away most of the Kubernetes plumbing.
Hluboký ponor
KServe, dříve známý jako KFServing a zrozený z projektu Kubeflow, definuje vlastní zdroj InferenceService. Napíšete krátký soubor YAML ukazující na model uložený v úložišti objektů (S3, GCS, Azure Blob) a KServe se postará o zbytek. Podporuje jak prediktivní vyvozování, tak stále více generativní poskytování LLM. KServe dodává předpřipravené „obslužné běhy“ pro běžné rámce (TensorFlow Serving, TorchServe, Triton, scikit-learn, XGBoost, Hugging Face) a podporuje vlastní kontejnery. Je postaven na Knative Serving a síťové vrstvě (Istio nebo podobná) a poskytuje automatické škálování na základě požadavků včetně skutečného škálování na nulu, takže nečinné modely nespotřebovávají žádné výpočty. Také standardizuje predikční API kolem protokolu Open Inference, takže klienti mluví s každým modelem stejným způsobem bez ohledu na rámec.
Technický přehled
Automatické škálování KServe se opírá o Knative, který škáluje počet replik na základě souběžnosti nebo požadavků za sekundu a může klesnout na nulu replik, když se provoz zastaví, a poté na vyžádání spustit studený. InferenceService abstrahuje úplný inferenční kanál do komponent prediktor, transformátor (před/po zpracování) a vysvětlující komponenty. Modely se načítají z úložiště objektů pomocí „inicializátorů úložiště“, které při spuštění vtahují artefakty do modulu a oddělují úložiště modelu od obrazu obslužného kontejneru.
Strategický dopad
Cena a rozpočet
Rozhodnutí o architektuře zvyšují výkon a provozní náklady po mnoho let.
Jasnější rozhodnutí
Technické vzdělání pomáhá týmům vybrat ten správný stack, nejen ten nejnovější.
Kontrola kvality
Lepší konstrukční volby snižují výskyt problémů se spolehlivostí ve výrobě.
Budoucnost KServe a model Serve na Kubernetes
KServe se rychle vyvíjí směrem ke generativní AI a přidává stopu zaměřenou na LLM s funkcemi, jako je směrování s podporou KV-cache, mezipaměť modelu a rozčleněné předvyplnění/dekódování pro velké jazykové modely. Očekávejte hlubší integraci s inferenčními enginy, jako je vLLM, lepší víceuzlové poskytování pro modely příliš velké pro jeden GPU a směrování na úrovni brány pro vyrovnávání zátěže na základě tokenů. Jako projekt inkubující CNCF se stává de facto otevřeným standardem pro vkládání modelů za Kubernetes, čímž se zužuje propast mezi výzkumnými artefakty a odolnými produkčními koncovými body.
Real-World Implementace
Banka nasazuje model hodnocení úvěrů napsáním 10řádkového InferenceService YAML ukazujícího na model v S3, přičemž KServe zpracovává automatické škálování a ingress.
Tým elektronického obchodu používá zavedení KServe canary k odeslání 10 procent provozu na nový model doporučení a poté, co metriky vypadají dobře, se zvýší na 100 procent.
Výzkumná laboratoř slouží desítkám zřídka používaných modelů s měřítkem na nulu, takže každý model se roztočí pouze tehdy, když přijde požadavek a během nečinnosti nespotřebovává žádný GPU.
Tým MLOps používá komponent transformátoru KServe ke spuštění změny velikosti a normalizace obrazu předtím, než prediktor spustí model vidění servírovaný Tritonem.
Rizika a zábradlí
Optimalizace jednoho benchmarku může skrýt širší systémové slabiny.
Náklady na infrastrukturu a údržbu jsou často podceňovány.
Mezery v zabezpečení a pozorovatelnosti se mohou zvětšovat, jak se systémy stávají složitějšími.
Plán implementace
Před implementací definujte cíle latence, kvality a nákladů.
Benchmark za realistických podmínek zatížení a dat.
Monitorování chyb, posunu a dopadu na uživatele.
Před škálováním připravte cesty vrácení zpět a reakce na incidenty.
Pokračujte v objevování
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the KServe and Model Serving on Kubernetes quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Další průvodce
Spekulativní úpravy pro modely kódu
Často kladené otázky
What is KServe and Model Serving on Kubernetes?
KServe je standardizovaná, nativní platforma Kubernetes pro poskytování modelů strojového učení ve velkém měřítku. Poskytuje týmům jediný, deklarativní způsob, jak nasadit modely s automatickým škálováním, zavedením canary a škálováním na nulu, čímž se odstraní většina potrubí Kubernetes.
Jaké bylo předchozí jméno KServe, než se stalo samostatným projektem?
KServe vznikl jako KFServing v rámci projektu Kubeflow, než se stal nezávislou platformou.
Jaký je primární vlastní zdroj Kubernetes, který definujete pro nasazení modelu s KServe?
Pro nasazení a konfiguraci obsluhovaného modelu deklarujete vlastní prostředek InferenceService, obvykle v YAML.
Která funkce umožňuje nečinným modelům KServe spotřebovávat nulový výpočet, dokud nepřijde požadavek?
KServe, postavený na Knative, podporuje škálování na nulu, spouštění replik na nulu, když není provoz, a studené starty na vyžádání.
Který základní projekt poskytuje automatické škálování KServeru řízené požadavky?
KServe staví na Knative Serving, které škáluje repliky na základě souběžnosti nebo rychlosti požadavků a umožňuje škálování na nulu.
Jak KServe obvykle dostává artefakty modelu do obslužného modulu při spuštění?
Inicializátory úložiště stahují artefakty modelu z úložiště objektů (jako S3 nebo GCS) do modulu a oddělují modely od obrazu.