Als nächstesNächster Leitfaden
Kubernetes für ML-Workloads
Technisch
Technischer Leitfaden
Apache Airflow ist eine Open-Source-Plattform zum Erstellen, Planen und Überwachen von Workflows als Code.
In machine learning it acts as the conductor that triggers data pipelines, retraining jobs, and batch predictions on a reliable schedule.
Airflow wurde 2014 bei Airbnb erstellt und ist heute ein Apache-Projekt. Seine zentrale Abstraktion ist der DAG: ein gerichteter azyklischer Graph von in Python definierten Aufgaben, bei dem Kanten die Ausführungsreihenfolge und Abhängigkeiten festlegen. Ein Planer analysiert diese DAGs, entscheidet, welche Aufgaben bereit sind, und verteilt sie an Ausführende und Arbeiter. Eine Web-Benutzeroberfläche zeigt den Ausführungsverlauf, Protokolle und den Aufgabenstatus an. Für ML wird Airflow häufig als Orchestrator und nicht als Rechenmaschine verwendet: Es trainiert keine Modelle selbst, sondern löst Schritte wie das Extrahieren von Daten, deren Validierung, das Starten eines Trainingsjobs auf Spark oder einem Kubernetes-Pod und die Bereitstellung des Ergebnisses aus. Mithilfe von Operatoren und Sensoren können Aufgaben externe Systeme aufrufen, auf Dateien warten oder Container ausführen. Seine Stärke liegt in der zuverlässigen Planung, Wiederholungsversuchen, Auffüllungen und klaren Einblicken in komplexe, zeitbasierte Pipelines.
Architekturentscheidungen beeinflussen über Jahre hinweg die Leistung und die Betriebskosten.
Technische Schulungen helfen Teams dabei, den richtigen Stack auszuwählen, nicht nur den neuesten.
Bessere technische Entscheidungen reduzieren Zuverlässigkeitsvorfälle in der Produktion.
Airflow 2.x und 3.x legen Wert auf einen schnelleren Scheduler, die TaskFlow-API für sauberere Python-Pipelines und eine datenbewusste Planung, bei der DAGs bei Datensatzaktualisierungen statt bei festen Uhren ausgelöst werden. Erwarten Sie für ML eine engere Kopplung mit Feature-Stores und ereignisgesteuerter Umschulung. Airflow positioniert sich zunehmend als Orchestrierungsschicht, die spezialisierte Tools wie dbt, Spark und Kubeflow koordiniert, anstatt mit ihnen zu konkurrieren, und festigt so seine Rolle als Planungsrückgrat moderner Daten- und ML-Stacks.
Ein Medienunternehmen führt täglich einen Airflow DAG aus, der Benutzerinteraktionsprotokolle abruft, ein Empfehlungsmodell neu trainiert und den Bereitstellungscache aktualisiert.
Ein E-Commerce-Team wartet mithilfe von Sensoren darauf, dass die Datendatei eines Anbieters im Cloud-Speicher landet, bevor es eine nachgelagerte Prognoseaufgabe startet.
Ein Fintech-Unternehmen plant stündlich Batch-Scoring-Jobs, bei denen Airflow ein Containermodell auslöst, um verdächtige Transaktionen zu kennzeichnen.
Ein Datenteam verwendet Airflow-Backfills, um nach einer Logikänderung monatelange historische Daten über eine neue Feature-Engineering-Pipeline erneut zu verarbeiten.
Die Optimierung eines Benchmarks kann umfassendere Systemschwächen verbergen.
Infrastruktur- und Wartungskosten werden oft unterschätzt.
Sicherheits- und Beobachtbarkeitslücken können größer werden, wenn die Systeme komplexer werden.
Definieren Sie vor der Implementierung Latenz-, Qualitäts- und Kostenziele.
Benchmark unter realistischen Last- und Datenbedingungen.
Instrumentenüberwachung auf Fehler, Drift und Benutzereinflüsse.
Bereiten Sie vor der Skalierung Rollback- und Incident-Response-Pfade vor.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Apache Airflow ist eine Open-Source-Plattform zum Erstellen, Planen und Überwachen von Workflows als Code. Beim maschinellen Lernen fungiert es als Leiter, der Datenpipelines, Umschulungsjobs und Batch-Vorhersagen nach einem zuverlässigen Zeitplan auslöst.
Airflow-Workflows werden in Python als DAGs definiert, wobei Aufgaben Knoten sind und Kanten die Ausführungsreihenfolge definieren.
Airflow ist ein Orchestrator: Es löst und koordiniert Schritte wie Datenextraktion und Schulungsaufgaben, anstatt selbst die schwere Rechenleistung zu übernehmen.
Sensoren sind spezielle Operatoren, die einen Arbeitsablauf anhalten, bis eine Bedingung erfüllt ist, etwa das Landen einer Datei oder das Erscheinen einer Partition.
Beim Backfilling wird ein DAG über vergangene Intervalle hinweg ausgeführt, was für die erneute Verarbeitung des Verlaufs nach einer Änderung der Pipeline-Logik hilfreich ist.
Der Scheduler analysiert DAGs, überprüft Zeitplanintervalle und Abhängigkeiten und stellt Aufgaben in die Warteschlange, deren Upstream-Schritte erfolgreich waren.
Lerne weiter
Weitere Leitfäden zu diesem Thema ausgewählt
Als nächstesNächster Leitfaden
Kubernetes für ML-Workloads
Technisch