Orchestration de pipelines Kubeflow et ML
Kubeflow est une boîte à outils open source qui exécute des workflows d'apprentissage automatique sur Kubernetes, transformant la formation et le déploiement de modèles en pipelines conteneurisés reproductibles.
Aperçu
It matters because it lets teams scale ML the same way they scale modern cloud software.
Plongée profonde
Kubeflow a débuté le Google comme moyen d'exécuter TensorFlow sur Kubernetes, puis est devenu une plate-forme plus large. Son idée principale est que chaque étape d'un flux de travail ML, telle que la préparation des données, la formation, l'évaluation et la diffusion, s'exécute en tant que composant conteneurisé dans un pod Kubernetes. Kubeflow Pipelines (KFP) vous permet d'exprimer ces étapes sous forme de graphe acyclique dirigé (DAG) : chaque nœud est un conteneur autonome et les bords définissent les dépendances des données. Étant donné que Kubernetes gère la planification, la mise à l'échelle et l'allocation des ressources, un pipeline peut demander des GPU pour la formation et les publier ensuite. Les autres composants incluent Katib pour le réglage des hyperparamètres, KServe pour la diffusion de modèles et des serveurs de notebooks. Les avantages sont la reproductibilité, la portabilité entre les cloud et la possibilité d'adapter les étapes individuelles de manière indépendante.
Aperçu technique
Un pipeline Kubeflow compile un DSL Python dans une spécification YAML Argo Workflows. Chaque composant devient un conteneur qui lit les entrées et écrit les sorties sous forme d'artefacts, transmis entre les étapes via un magasin d'objets partagé comme MinIO ou S3. Kubernetes planifie chaque pod, en attachant des ressources GPU ou CPU selon la demande du composant. Le plan de contrôle met en cache les sorties des étapes, de sorte que les étapes inchangées sont ignorées lors des réexécutions, économisant ainsi le calcul et rendant les grands DAG efficaces.
Impact stratégique
Coût et budget
Les décisions en matière d'architecture déterminent les performances et les coûts d'exploitation pendant des années.
Décisions plus claires
La formation technique aide les équipes à choisir la bonne pile, pas seulement la plus récente.
Contrôle qualité
De meilleurs choix d’ingénierie réduisent les incidents de fiabilité en production.
L'avenir de Kubeflow et de l'orchestration de pipelines ML
Kubeflow se consolide autour de KFP v2 et d'une intégration plus étroite avec KServe pour le service et Katib pour le réglage, ainsi qu'une meilleure prise en charge de la formation distribuée de grands modèles sur de nombreux GPU. Attendez-vous à des connexions plus approfondies avec les magasins de fonctionnalités, les registres de modèles et les flux de travail de réglage fin du LLM. À mesure que le projet mûrit dans le cadre du CNCF, la tendance est à une installation plus simple, à une mutualisation pour les équipes et à des définitions de pipeline standardisées qui se portent proprement entre les fournisseurs de cloud sur site et les principaux fournisseurs de cloud.
Mise en œuvre dans le monde réel
Un détaillant planifie un pipeline Kubeflow nocturne qui ingère les données de vente, recycle un modèle de prévision de la demande et le transmet à KServe pour inférence.
Un laboratoire de recherche utilise Katib pour exécuter des centaines d'essais d'hyperparamètres parallèles sur un cluster GPU, en sélectionnant automatiquement la meilleure configuration.
Une banque construit un pipeline de détection de fraude reproductible dans lequel chaque audit de conformité peut réexécuter les étapes de formation exactes à partir des artefacts mis en cache.
Une startup utilise des serveurs de notebooks sur Kubeflow afin que les data scientists prototypent des modèles qui passent directement aux pipelines de production sans réécrire le code.
Risques et garde-fous
L’optimisation d’un benchmark peut masquer des faiblesses plus larges du système.
Les coûts d’infrastructure et de maintenance sont souvent sous-estimés.
Les lacunes en matière de sécurité et d’observabilité peuvent se creuser à mesure que les systèmes deviennent plus complexes.
Feuille de route de mise en œuvre
Définissez les objectifs de latence, de qualité et de coût avant la mise en œuvre.
Benchmark dans des conditions de charge et de données réalistes.
Surveillance des instruments pour détecter les erreurs, la dérive et l'impact sur l'utilisateur.
Préparez les chemins de restauration et de réponse aux incidents avant la mise à l’échelle.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Kubeflow and ML Pipeline Orchestration quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
Planification GPU et orchestration de cluster
Questions fréquemment posées
What is Kubeflow and ML Pipeline Orchestration?
Kubeflow est une boîte à outils open source qui exécute des workflows d'apprentissage automatique sur Kubernetes, transformant la formation et le déploiement de modèles en pipelines conteneurisés reproductibles. C’est important car cela permet aux équipes de faire évoluer le ML de la même manière qu’elles font évoluer les logiciels cloud modernes.
Sur quelle plate-forme sous-jacente Kubeflow exécute-t-il les workflows de machine learning ?
Kubeflow est spécialement conçu pour exécuter des workflows ML sur Kubernetes, à l'aide de ses fonctionnalités de planification et de mise à l'échelle.
Dans Kubeflow Pipelines, comment chaque étape d'un workflow est-elle généralement conditionnée ?
Chaque étape du pipeline est un conteneur autonome qui s'exécute dans un pod Kubernetes, avec des entrées et des sorties transmises sous forme d'artefacts.
Quelle structure un pipeline Kubeflow utilise-t-il pour exprimer l'ordre et les dépendances des étapes ?
Les pipelines sont exprimés sous forme de DAG, où les nœuds sont des composants et les arêtes représentent les dépendances de données entre eux.
Quel composant Kubeflow est dédié au réglage automatisé des hyperparamètres ?
Katib est le composant de Kubeflow pour l'optimisation des hyperparamètres et la recherche d'architecture neuronale, exécutant de nombreux essais en parallèle.
Pourquoi un pipeline Kubeflow peut-il sauter efficacement certaines étapes lors d'une réexécution ?
Le plan de contrôle met en cache les sorties, de sorte que les étapes dont les entrées n'ont pas changé sont ignorées, économisant ainsi le calcul lors des réexécutions.