GUIDE Technique

KServe et Model Serving sur Kubernetes

KServe est une plateforme standardisée et native de Kubernetes permettant de servir des modèles d'apprentissage automatique à grande échelle.

2 minutes de lectureDernière mise à jour

Aperçu

It gives teams a single, declarative way to deploy models with autoscaling, canary rollouts, and scale-to-zero, abstracting away most of the Kubernetes plumbing.

Plongée profonde

Formerly known as KFServing and born from the Kubeflow project, KServe defines an InferenceService custom resource. You write a short YAML file pointing at a model stored in object storage (S3, GCS, Azure Blob), and KServe handles the rest. It supports both predictive inference and, increasingly, generative LLM serving. KServe fournit des « environnements d'exécution de service » prédéfinis pour les frameworks courants (TensorFlow Serving, TorchServe, Triton, scikit-learn, XGBoost, Hugging Face) et prend en charge les conteneurs personnalisés. Construit sur Knative Serving et une couche réseau (Istio ou similaire), il fournit une mise à l'échelle automatique basée sur les requêtes, y compris une véritable mise à l'échelle jusqu'à zéro, de sorte que les modèles inactifs ne consomment aucun calcul. It also standardizes the prediction API around the Open Inference Protocol, so clients talk to every model the same way regardless of framework.

Aperçu technique

La mise à l'échelle automatique de KServe s'appuie sur Knative, qui adapte le nombre de répliques en fonction de la concurrence ou du nombre de requêtes par seconde et peut tomber à zéro réplique lorsque le trafic s'arrête, puis démarrer à froid à la demande. The InferenceService abstracts a full inference pipeline into predictor, transformer (pre/post-processing), and explainer components. Les modèles se chargent à partir du stockage d'objets via des « initialiseurs de stockage » qui extraient les artefacts dans le pod au démarrage, dissociant ainsi le stockage du modèle de l'image du conteneur de service.

Impact stratégique

Coût et budget

Les décisions en matière d'architecture déterminent les performances et les coûts d'exploitation pendant des années.

Décisions plus claires

La formation technique aide les équipes à choisir la bonne pile, pas seulement la plus récente.

Contrôle qualité

De meilleurs choix d’ingénierie réduisent les incidents de fiabilité en production.

L'avenir de KServe et du Model Serving sur Kubernetes

KServe évolue rapidement vers l'IA générative, en ajoutant une piste axée sur le LLM avec des fonctionnalités telles que le routage prenant en compte le cache KV, la mise en cache des modèles et le service de pré-remplissage/décodage désagrégé pour les grands modèles de langage. Attendez-vous à une intégration plus approfondie avec des moteurs d'inférence tels que vLLM, à un meilleur service multi-nœuds pour les modèles trop volumineux pour un seul GPU et à un routage au niveau de la passerelle pour l'équilibrage de charge basé sur des jetons. En tant que projet incubateur du CNCF, il devient de facto le standard ouvert pour mettre des modèles derrière Kubernetes, réduisant ainsi l'écart entre les artefacts de recherche et les points finaux de production résilients.

Mise en œuvre dans le monde réel

Une banque déploie un modèle de notation de crédit en écrivant un YAML InferenceService de 10 lignes pointant vers le modèle dans S3, avec KServe gérant la mise à l'échelle automatique et l'entrée.

Une équipe de commerce électronique utilise les déploiements KServe Canary pour envoyer 10 % du trafic vers un nouveau modèle de recommandation, puis passe à 100 % une fois que les mesures semblent saines.

Un laboratoire de recherche gère des dizaines de modèles rarement utilisés avec une mise à l'échelle jusqu'à zéro, de sorte que chaque modèle ne démarre que lorsqu'une demande arrive et ne consomme aucun GPU lorsqu'il est inactif.

Une équipe MLOps utilise un composant de transformateur KServe pour exécuter le redimensionnement et la normalisation de l'image avant que le prédicteur n'exécute un modèle de vision servi par Triton.

Risques et garde-fous

L’optimisation d’un benchmark peut masquer des faiblesses plus larges du système.

Les coûts d’infrastructure et de maintenance sont souvent sous-estimés.

Les lacunes en matière de sécurité et d’observabilité peuvent se creuser à mesure que les systèmes deviennent plus complexes.

Feuille de route de mise en œuvre

1

Définissez les objectifs de latence, de qualité et de coût avant la mise en œuvre.

2

Benchmark dans des conditions de charge et de données réalistes.

3

Surveillance des instruments pour détecter les erreurs, la dérive et l'impact sur l'utilisateur.

4

Préparez les chemins de restauration et de réponse aux incidents avant la mise à l’échelle.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the KServe and Model Serving on Kubernetes quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Modifications spéculatives pour les modèles de code

Questions fréquemment posées

What is KServe and Model Serving on Kubernetes?

KServe is a standardized, Kubernetes-native platform for serving machine learning models at scale. Il offre aux équipes un moyen unique et déclaratif de déployer des modèles avec mise à l'échelle automatique, déploiements Canary et mise à l'échelle jusqu'à zéro, éliminant ainsi la majeure partie de la plomberie Kubernetes.

Quel était l'ancien nom de KServe avant qu'il ne devienne un projet autonome ?

KServe est né sous le nom de KFServing au sein du projet Kubeflow avant de devenir une plateforme indépendante.

Quelle est la principale ressource personnalisée Kubernetes que vous définissez pour déployer un modèle avec KServe ?

Vous déclarez une ressource personnalisée InferenceService, généralement en YAML, pour déployer et configurer un modèle servi.

Quelle fonctionnalité permet aux modèles KServe inactifs de consommer zéro calcul jusqu'à l'arrivée d'une requête ?

Construit sur Knative, KServe prend en charge la mise à l'échelle jusqu'à zéro, en ramenant les répliques à zéro lorsqu'il n'y a pas de trafic et en démarrant à froid à la demande.

Quel projet sous-jacent fournit la mise à l'échelle automatique basée sur les requêtes de KServe ?

KServe s'appuie sur Knative Serving, qui met à l'échelle les réplicas en fonction de la concurrence ou du taux de requêtes et permet une mise à l'échelle jusqu'à zéro.

Comment KServe obtient-il généralement les artefacts de modèle dans un pod de service au démarrage ?

Les initialiseurs de stockage téléchargent les artefacts de modèle depuis le stockage d'objets (comme S3 ou GCS) dans le pod, dissociant ainsi les modèles de l'image.