Als nächstesNächster Leitfaden
Gruppenrelative Richtlinienoptimierung
Technisch
Technischer Leitfaden
Die Optimierung zweiter Ordnung nutzt Krümmungsinformationen (die Hesse-Matrix der zweiten Ableitungen), um intelligentere Schritte in Richtung eines Minimums zu unternehmen, nicht nur die Steigung.
Es kann in deutlich weniger Iterationen konvergieren als ein einfacher Gradientenabstieg, aber die Kosten für die Berechnung der Krümmung erschweren die Skalierung.
Der Gradientenabstieg kennt nur die Steigung an Ihrem aktuellen Punkt, daher wählt er eine feste oder handabgestimmte Schrittgröße und hofft auf das Beste. Newtons Methode geht noch weiter: Sie untersucht auch, wie sich die Steigung (die Krümmung) ändert, erfasst durch die Hesse-Matrix, eine Matrix aller zweiten partiellen Ableitungen. Das Update multipliziert den inversen Hesse-Wert mit dem Gradienten, wodurch jede Richtung automatisch neu skaliert wird und in der Nähe des Minimums einer lokalen quadratischen Näherung landet. Für eine perfekt quadratische Schüssel erreicht Newtons Methode den Boden in einem einzigen Schritt. Der Haken ist brutal: Ein Modell mit N Parametern hat eine N-mal-N-Hesse-Funktion, daher kostet das Speichern und Invertieren ungefähr N-Quadrat-Speicher und N-Würfel-Rechenleistung. Für Netzwerke mit Milliarden Parametern ist das unmöglich, weshalb Praktiker günstigere Näherungen verwenden.
Architekturentscheidungen beeinflussen über Jahre hinweg die Leistung und die Betriebskosten.
Technische Schulungen helfen Teams dabei, den richtigen Stack auszuwählen, nicht nur den neuesten.
Bessere technische Entscheidungen reduzieren Zuverlässigkeitsvorfälle in der Produktion.
Für riesige neuronale Netze bleiben vollständige Methoden zweiter Ordnung unpraktisch, aber Approximationen sind auf dem Vormarsch. Optimierer wie K-FAC und Shampoo approximieren die Krümmung mithilfe einer Blockdiagonal- oder Kronecker-Faktor-Struktur, und neuere Methoden wie Sophia und Muon verwenden kostengünstige Krümmungsschätzungen, um das Vortraining großer Sprachmodelle zu beschleunigen. Erwarten Sie anhaltende Anstrengungen zur Erfassung nützlicher Krümmungssignale zu Kosten nahezu erster Ordnung, wodurch die Lücke zwischen Adam- und echten Newton-Schritten verringert wird.
L-BFGS passt die logistische Regression und andere konvexe Modelle in Scikit-Learn an, wo es bei kleinen bis mittleren Datensätzen häufig den einfachen Gradientenabstieg übertrifft
Bündelanpassung bei 3D-Rekonstruktion und SLAM, wobei Gauss-Newton und Levenberg-Marquardt Kameraposen und Punktpositionen verfeinern
Training winziger, physikinformierter neuronaler Netze, bei denen L-BFGS eine Präzision erreicht, die Adam nur schwer erreichen kann
Shampoo und K-FAC beschleunigen groß angelegte Deep-Learning-Trainings durch Annäherung an die Hessian-Struktur
Die Optimierung eines Benchmarks kann umfassendere Systemschwächen verbergen.
Infrastruktur- und Wartungskosten werden oft unterschätzt.
Sicherheits- und Beobachtbarkeitslücken können größer werden, wenn die Systeme komplexer werden.
Definieren Sie vor der Implementierung Latenz-, Qualitäts- und Kostenziele.
Benchmark unter realistischen Last- und Datenbedingungen.
Instrumentenüberwachung auf Fehler, Drift und Benutzereinflüsse.
Bereiten Sie vor der Skalierung Rollback- und Incident-Response-Pfade vor.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Die Optimierung zweiter Ordnung nutzt Krümmungsinformationen (die Hesse-Matrix der zweiten Ableitungen), um intelligentere Schritte in Richtung eines Minimums zu unternehmen, nicht nur die Steigung. Es kann in deutlich weniger Iterationen konvergieren als ein einfacher Gradientenabstieg, aber die Kosten für die Berechnung der Krümmung erschweren die Skalierung.
Newtons Methode erweitert den Gradienten um eine Krümmung des Hessischen, wodurch die Richtungen neu skaliert und das lokale quadratische Minimum angenähert werden können.
Bei einer exakten quadratischen Funktion entspricht das lokale quadratische Modell der wahren Funktion, sodass ein Newton-Schritt direkt zum Minimum springt.
Mit N Parametern hat die Hesse-Funktion N-Quadrat-Einträge und invertiert skaliert sie wie N-Würfel, was bei Milliarden von Parametern nicht möglich ist.
BFGS aktualisiert iterativ eine Schätzung der inversen Hesse-Funktion unter Verwendung von Änderungen im Gradienten zwischen den Schritten und vermeidet so eine direkte Berechnung.
Das „L“ steht für „Limited-Memory“: L-BFGS behält nur eine Handvoll aktueller Vektoren und reduziert so den Speicher von N-Quadrat auf etwa ein kleines Vielfaches von N.
Lerne weiter
Weitere Leitfäden zu diesem Thema ausgewählt
Als nächstesNächster Leitfaden
Gruppenrelative Richtlinienoptimierung
Technisch