GUIDA TECNICA

Kserve e Model Serving su Kubernetes

KServe è una piattaforma standardizzata e nativa di Kubernetes per servire modelli di machine learning su larga scala.

2 minuti di letturaUltimo aggiornamento

Panoramica

It gives teams a single, declarative way to deploy models with autoscaling, canary rollouts, and scale-to-zero, abstracting away most of the Kubernetes plumbing.

Immersione profonda

Precedentemente noto come KFServing e nato dal progetto Kubeflow, KServe definisce una risorsa personalizzata InferenceService. Scrivi un breve file YAML che punta a un modello archiviato nell'archiviazione di oggetti (S3, GCS, BLOB di Azure) e Kserve gestisce il resto. Supporta sia l'inferenza predittiva che, sempre più, il servizio LLM generativo. KServe fornisce "runtime di servizio" precostruiti per framework comuni (TensorFlow Serving, TorchServe, Triton, scikit-learn, XGBoost, Hugging Face) e supporta contenitori personalizzati. Basato su Knative Serving e su un livello di rete (Istio o simile), fornisce la scalabilità automatica basata sulle richieste, incluso il reale ridimensionamento a zero, quindi i modelli inattivi non consumano alcun calcolo. Standardizza inoltre l'API di previsione attorno al protocollo Open Inference, in modo che i client comunichino a ogni modello allo stesso modo indipendentemente dal framework.

Approfondimento tecnico

La scalabilità automatica di KServe si basa su Knative, che ridimensiona il conteggio delle repliche in base alla concorrenza o alle richieste al secondo e può scendere a zero repliche quando il traffico si interrompe, quindi riavviarsi a freddo su richiesta. InferenceService astrae una pipeline di inferenza completa in componenti predittore, trasformatore (pre/post-elaborazione) ed esplicativo. I modelli vengono caricati dall'archiviazione di oggetti tramite "inizializzatori di archiviazione" che inseriscono gli artefatti nel pod all'avvio, disaccoppiando l'archiviazione dei modelli dall'immagine del contenitore di servizio.

Impatto strategico

Costo e budget

Le decisioni relative all'architettura determinano prestazioni e costi operativi per anni.

Decisioni più chiare

La formazione tecnica aiuta i team a scegliere lo stack giusto, non solo quello più nuovo.

Controllo di qualità

Migliori scelte ingegneristiche riducono gli incidenti legati all’affidabilità nella produzione.

Il futuro di Kserve e il modelserving su Kubernetes

KServe si sta rapidamente evolvendo verso l'intelligenza artificiale generativa, aggiungendo un percorso incentrato sul LLM con funzionalità come routing KV-cache-aware, memorizzazione nella cache dei modelli e servizi di precompilazione/decodifica disaggregati per modelli linguistici di grandi dimensioni. Aspettatevi un'integrazione più profonda con motori di inferenza come vLLM, una migliore offerta multinodo per modelli troppo grandi per una GPU e routing a livello di gateway per il bilanciamento del carico basato su token. Essendo un progetto di incubazione del CNCF, sta diventando di fatto lo standard aperto per mettere modelli dietro Kubernetes, riducendo il divario tra artefatti di ricerca ed endpoint di produzione resilienti.

Implementazione nel mondo reale

Una banca distribuisce un modello di credit scoring scrivendo un YAML InferenceService di 10 righe che punta al modello in S3, con KServe che gestisce la scalabilità automatica e l'ingresso.

Un team di e-commerce utilizza le implementazioni canary di Kserve per inviare il 10% del traffico a un nuovo modello di consigli, quindi aumenta al 100% una volta che le metriche sembrano integre.

Un laboratorio di ricerca serve dozzine di modelli usati raramente con scalabilità fino a zero, quindi ogni modello si avvia solo quando arriva una richiesta e non consuma GPU mentre è inattivo.

Un team MLOps utilizza un componente trasformatore KServe per eseguire il ridimensionamento e la normalizzazione delle immagini prima che il predittore esegua un modello di visione servito da Triton.

Rischi e guardrail

L'ottimizzazione di un benchmark può nascondere debolezze di sistema più ampie.

I costi delle infrastrutture e della manutenzione sono spesso sottostimati.

Le lacune in termini di sicurezza e osservabilità possono aumentare man mano che i sistemi diventano più complessi.

Tabella di marcia per l'implementazione

1

Definire obiettivi di latenza, qualità e costi prima dell'implementazione.

2

Benchmark in condizioni di carico e dati realistiche.

3

Monitoraggio dello strumento per errori, deriva e impatto sull'utente.

4

Preparare percorsi di rollback e risposta agli incidenti prima della scalabilità.

Continua a esplorare

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the KServe and Model Serving on Kubernetes quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Inizia il quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Prossima guida

Modifiche speculative per modelli di codice

Domande frequenti

What is KServe and Model Serving on Kubernetes?

KServe è una piattaforma standardizzata e nativa di Kubernetes per servire modelli di machine learning su larga scala. Offre ai team un unico modo dichiarativo per distribuire modelli con scalabilità automatica, implementazioni canary e scalabilità a zero, eliminando la maggior parte delle strutture idrauliche di Kubernetes.

Qual era il nome precedente di Kserve prima che diventasse un progetto autonomo?

KServe è nato come KFServing all'interno del progetto Kubeflow prima di diventare una piattaforma indipendente.

Qual è la risorsa personalizzata Kubernetes primaria che definisci per distribuire un modello con Kserve?

Dichiari una risorsa personalizzata InferenceService, in genere in YAML, per distribuire e configurare un modello servito.

Quale funzionalità consente ai modelli Kserve inattivi di consumare zero calcoli fino all'arrivo di una richiesta?

Basato su Knative, Kserve supporta la scalabilità fino a zero, riducendo le repliche a zero quando non c'è traffico e l'avvio a freddo su richiesta.

Quale progetto sottostante fornisce la scalabilità automatica basata sulle richieste di Kserve?

KServe si basa su Knative Serving, che ridimensiona le repliche in base alla concorrenza o al tasso di richieste e consente la scalabilità fino a zero.

In che modo Kserve in genere inserisce gli artefatti del modello in un pod di servizio all'avvio?

Gli inizializzatori di archiviazione scaricano gli artefatti del modello dall'archiviazione di oggetti (come S3 o GCS) nel pod, disaccoppiando i modelli dall'immagine.