KServe en Model Serving op Kubernetes
KServe is een gestandaardiseerd Kubernetes-native platform voor het op schaal aanbieden van machine learning-modellen.
Overzicht
It gives teams a single, declarative way to deploy models with autoscaling, canary rollouts, and scale-to-zero, abstracting away most of the Kubernetes plumbing.
Diepe duik
KServe, voorheen bekend als KFServing en voortgekomen uit het Kubeflow-project, definieert een aangepaste InferenceService-bron. U schrijft een kort YAML-bestand dat verwijst naar een model dat is opgeslagen in objectopslag (S3, GCS, Azure Blob), en KServe handelt de rest af. Het ondersteunt zowel voorspellende gevolgtrekkingen als, in toenemende mate, generatieve LLM-services. KServe levert vooraf gebouwde 'serving runtimes' voor algemene raamwerken (TensorFlow Serving, TorchServe, Triton, scikit-learn, XGBoost, Hugging Face) en ondersteunt aangepaste containers. Het is gebouwd bovenop Knative Serving en een netwerklaag (Istio of vergelijkbaar) en biedt verzoekgestuurde automatische schaling, inclusief echte schaal-naar-nul, zodat inactieve modellen geen rekenkracht verbruiken. Het standaardiseert ook de voorspellings-API rond het Open Inference Protocol, zodat klanten op dezelfde manier met elk model praten, ongeacht het raamwerk.
Technisch inzicht
De automatische schaling van KServe leunt op Knative, dat het aantal replica's schaalt op basis van gelijktijdigheid of verzoeken per seconde en kan terugvallen naar nul replica's wanneer het verkeer stopt, en vervolgens op verzoek koud starten. De InferenceService abstraheert een volledige inferentiepijplijn in voorspeller-, transformator- (pre-/post-verwerking) en uitlegcomponenten. Modellen worden vanuit objectopslag geladen via 'storage initializers' die bij het opstarten artefacten naar de pod halen, waardoor de modelopslag wordt losgekoppeld van de dienende containerimage.
Strategische impact
Cost and budget
Architectuurbeslissingen bepalen jarenlang de prestaties en bedrijfskosten.
Clearer decisions
Technisch onderwijs helpt teams bij het kiezen van de juiste stapel, niet alleen de nieuwste.
Quality control
Betere technische keuzes verminderen het aantal betrouwbaarheidsincidenten in de productie.
De toekomst van KServe en Model Serving op Kubernetes
KServe evolueert snel in de richting van generatieve AI, en voegt een LLM-gerichte track toe met functies zoals KV-cache-aware routing, model caching en gedesaggregeerde prefill/decode-serving voor grote taalmodellen. Verwacht een diepere integratie met inferentie-engines zoals vLLM, betere multi-node-service voor modellen die te groot zijn voor één GPU, en routering op gateway-niveau voor op tokens gebaseerde taakverdeling. Als een CNCF-incubatieproject wordt het de de facto open standaard voor het plaatsen van modellen achter Kubernetes, waardoor de kloof tussen onderzoeksartefacten en veerkrachtige productie-eindpunten wordt verkleind.
Implementatie in de echte wereld
Een bank implementeert een kredietscoremodel door een InferenceService YAML van 10 regels te schrijven die naar het model in S3 verwijst, waarbij KServe automatische schaling en inkomend verkeer afhandelt.
Een e-commerceteam gebruikt KServe-kanarie-implementaties om 10 procent van het verkeer naar een nieuw aanbevelingsmodel te sturen, en stijgt vervolgens naar 100 procent zodra de statistieken er gezond uitzien.
Een onderzoekslaboratorium bedient tientallen zelden gebruikte modellen met schaal-naar-nul, zodat elk model alleen draait als er een verzoek binnenkomt en geen GPU verbruikt als het niet actief is.
Een MLOps-team gebruikt een KServe-transformatorcomponent om het formaat en de normalisatie van afbeeldingen uit te voeren voordat de voorspeller een door Triton geserveerd visiemodel uitvoert.
Risico's en vangrails
Het optimaliseren van één benchmark kan bredere systeemzwakheden verbergen.
Infrastructuur- en onderhoudskosten worden vaak onderschat.
De lacunes op het gebied van beveiliging en waarneembaarheid kunnen groter worden naarmate systemen complexer worden.
Implementatie routekaart
Definieer latentie-, kwaliteits- en kostendoelen vóór implementatie.
Benchmark onder realistische belasting- en gegevensomstandigheden.
Instrumentbewaking op fouten, drift en gebruikersimpact.
Bereid rollback- en incidentresponspaden voor voordat u gaat schalen.
Blijf verkennen
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the KServe and Model Serving on Kubernetes quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Speculatieve bewerkingen voor codemodellen
Frequently asked questions
What is KServe and Model Serving on Kubernetes?
KServe is een gestandaardiseerd Kubernetes-native platform voor het op schaal aanbieden van machine learning-modellen. Het geeft teams één enkele, declaratieve manier om modellen te implementeren met automatische schaling, canarische uitrol en opschalen naar nul, waardoor het grootste deel van het Kubernetes-loodgieterswerk wordt weggenomen.
Wat was de vorige naam van KServe voordat het een op zichzelf staand project werd?
KServe is ontstaan als KFServing binnen het Kubeflow-project voordat het een onafhankelijk platform werd.
Wat is de primaire aangepaste Kubernetes-bron die u definieert om een model met KServe te implementeren?
U declareert een aangepaste InferenceService-resource, meestal in YAML, om een weergegeven model te implementeren en te configureren.
Welke mogelijkheid zorgt ervoor dat inactieve KServe-modellen geen rekenkracht verbruiken totdat er een verzoek binnenkomt?
KServe is gebouwd op Knative en ondersteunt schaal-naar-nul, waarbij replica's naar nul worden teruggezet als er geen verkeer is en op verzoek een koude start wordt uitgevoerd.
Welk onderliggend project biedt de verzoekgestuurde automatische schaling van KServe?
KServe bouwt voort op Knative Serving, dat replica's schaalt op basis van gelijktijdigheid of verzoeksnelheid en schaal-naar-nul mogelijk maakt.
Hoe krijgt KServe normaal gesproken modelartefacten in een serveerpod bij het opstarten?
Opslaginitialisatoren downloaden modelartefacten van objectopslag (zoals S3 of GCS) naar de pod, waardoor modellen worden losgekoppeld van de afbeelding.