Als nächstesNächster Leitfaden
A/B-Tests für ML-Modelle
Technisch
Technischer Leitfaden
Kubernetes ist ein Open-Source-System, das Containerprogramme automatisch auf einem Cluster von Maschinen plant, skaliert und neu startet.
For machine learning, it lets teams pack GPU-hungry training jobs and latency-sensitive model servers onto shared hardware without babysitting individual servers.
Ursprünglich bei Google entwickelt, um Webdienste auszuführen, behandelt Kubernetes Ihren Cluster als einen großen Pool aus CPU, Speicher und GPUs und entscheidet dann, auf welcher Maschine die einzelnen Container ausgeführt werden. ML-Teams stützen sich darauf, weil die Arbeitslasten hoch und teuer sind: Für einen Trainingslauf sind möglicherweise acht GPUs für sechs Stunden erforderlich, dann nichts. Kubernetes plant diesen Pod auf einem Knoten mit freien GPUs und gibt die Hardware frei, wenn der Job abgeschlossen ist. Außerdem hält es Inferenzserver am Leben, startet abgestürzte Container neu und verteilt Replikate aus Gründen der Ausfallsicherheit auf mehrere Maschinen. Darauf aufbauende Tools wie Kubeflow, Ray und KServe fügen ML-spezifische Teile wie verteilte Trainingsoperatoren, Hyperparameter-Tuning und Autoscaling-Modellendpunkte hinzu, sodass Datenwissenschaftler mit Abstraktionen auf höherer Ebene statt mit rohem YAML arbeiten.
Architekturentscheidungen beeinflussen über Jahre hinweg die Leistung und die Betriebskosten.
Technische Schulungen helfen Teams dabei, den richtigen Stack auszuwählen, nicht nur den neuesten.
Bessere technische Entscheidungen reduzieren Zuverlässigkeitsvorfälle in der Produktion.
Erwarten Sie eine engere ML-Integration: Gruppenplanung, die alle verteilten Trainings-Pods auf einmal oder gar keine startet, teilweise und zeitgeteilte GPU-Freigabe, sodass sich mehrere leichte Aufgaben eine Karte teilen, und topologiebewusste Platzierung, die schnelle NVLink-Verbindungen berücksichtigt. Die serverlose Inferenz auf Kubernetes, bei der Endpunkte zwischen Anfragen auf Null skaliert werden, ist ausgereift. Während sich die Modelle aufblähen, koordinieren sich Planer zunehmend über mehrere Cluster und Clouds hinweg, und warteschlangenbasierte Fair-Sharing-Systeme wie Kueue und Volcano werden zum Standard für die Verwaltung knapper GPU-Kapazität.
Ein Forschungslabor verwendet den Kubeflow Training Operator, um einen verteilten 32-GPU-PyTorch-Trainingsjob über vier Knoten zu starten und dann bei der Konvergenz automatisch die GPUs freizugeben.
Ein E-Commerce-Unternehmen bietet sein Empfehlungsmodell mit KServe an, das Replikate während eines Flash-Sales automatisch hochskaliert und über Nacht wieder herunterskaliert.
Eine Bank führt nächtliche Batch-Scoring-Jobs als Kubernetes CronJobs aus und stellt sie auf Ersatz-CPU-Knoten in die Warteschlange, damit sie nicht mit dem tagsüber bereitgestellten Datenverkehr konkurrieren.
Ein Startup nutzt Ray auf Kubernetes, um parallele Hyperparameter-Sweeps durchzuführen und dabei Dutzende kurzlebige Test-Pods auf Spot-Instanzen hochzufahren, um die Kosten zu senken.
Die Optimierung eines Benchmarks kann umfassendere Systemschwächen verbergen.
Infrastruktur- und Wartungskosten werden oft unterschätzt.
Sicherheits- und Beobachtbarkeitslücken können größer werden, wenn die Systeme komplexer werden.
Definieren Sie vor der Implementierung Latenz-, Qualitäts- und Kostenziele.
Benchmark unter realistischen Last- und Datenbedingungen.
Instrumentenüberwachung auf Fehler, Drift und Benutzereinflüsse.
Bereiten Sie vor der Skalierung Rollback- und Incident-Response-Pfade vor.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Kubernetes ist ein Open-Source-System, das Containerprogramme automatisch auf einem Cluster von Maschinen plant, skaliert und neu startet. Beim maschinellen Lernen können Teams GPU-hungrige Trainingsjobs und latenzempfindliche Modellserver auf gemeinsam genutzte Hardware packen, ohne einzelne Server zu betreuen.
Der Scheduler gleicht die Ressourcenanforderungen eines Pods (CPU, Speicher, GPUs) mit den verfügbaren Knoten ab und platziert den Pod dort, wo er passt. Der Modellcode oder die Daten werden nicht berührt.
Geräte-Plugins stellen GPUs als planbare Ressource zur Verfügung (z. B. nvidia.com/gpu), sodass Pods sie anfordern und der Planer die Verfügbarkeit verfolgen kann.
Ein Makel stößt Schoten von einem Knoten ab; Dort können nur Schoten mit entsprechender Toleranz landen. Dadurch werden knappe GPU-Knoten für Aufgaben reserviert, die tatsächlich GPUs benötigen.
Kubeflow überlagert ML-Workflows auf Kubernetes, einschließlich der Schulung von Bedienern, Pipelines und Optimierungen, sodass Teams die handschriftliche Low-Level-Clusterkonfiguration vermeiden müssen.
Das Training ist spitzenmäßig: kurzzeitig viele GPUs, dann keine. Kubernetes platziert den Job, wenn Ressourcen frei sind, und gibt sie nach Abschluss frei, wodurch die Auslastung verbessert wird.
Lerne weiter
Weitere Leitfäden zu diesem Thema ausgewählt
Als nächstesNächster Leitfaden
A/B-Tests für ML-Modelle
Technisch