Als nächstesNächster Leitfaden
DenseNet und Dense Connectivity
Technisch
Technischer Leitfaden
Sharpness-Aware Minimization (SAM) ist eine Optimierungsmethode, die nicht nur einen geringen Verlust anstrebt, sondern einen geringen Verlust über eine ganze Nachbarschaft von Gewichtungen hinweg – ein flaches Minimum.
Flachere Minima lassen sich tendenziell besser verallgemeinern, sodass SAM häufig die Testgenauigkeit und -robustheit verbessert, ohne die Modellarchitektur zu ändern.
Standardtraining minimiert den Verlust an einem einzelnen Punkt im Gewichtsraum, aber zwei Lösungen mit dem gleichen Trainingsverlust können sich sehr unterschiedlich verhalten: Ein „scharfes“ Minimum liegt in einem engen Tal, in dem winzige Gewichtsschwankungen den Verlust in die Höhe treiben, während ein „flaches“ Minimum Störungen toleriert und normalerweise besser auf unsichtbare Daten verallgemeinert. SAM, das 2020 von Google-Forschern eingeführt wurde, macht dies deutlich. Bei jedem Schritt wird zunächst die nahe gelegene Gewichtsstörung (innerhalb eines kleinen Radius rho) gefunden, die den Verlust maximiert – der Nachbar im ungünstigsten Fall – und dann die ursprünglichen Gewichte aktualisiert, um den Verlust an diesem gestörten Punkt zu reduzieren. Dieses Min-Max-Ziel treibt die Optimierung in Richtung Bereiche, die einheitlich niedrig sind, was zu einer deutlich besseren Verallgemeinerung der Bildklassifizierung und darüber hinaus führt.
Architekturentscheidungen beeinflussen über Jahre hinweg die Leistung und die Betriebskosten.
Technische Schulungen helfen Teams dabei, den richtigen Stack auszuwählen, nicht nur den neuesten.
Bessere technische Entscheidungen reduzieren Zuverlässigkeitsvorfälle in der Produktion.
SAM hat eine Familie von Nachfolgern hervorgebracht, die auf seine größte Schwäche, die doppelte Rechenleistung, abzielen: effiziente Varianten wie ESAM, LookSAM und Methoden, die nur eine Teilmenge von Gewichten stören oder alle paar Schritte SAM anwenden. Adaptive SAM (ASAM) parametrisiert den Radius so, dass er skaleninvariant ist. Forscher diskutieren weiterhin genau, warum Flachheit hilfreich ist und wie man sie messen kann, und schärfebewusste Ideen breiten sich aus, um große Sprachmodelle zu verfeinern und die Robustheit gegenüber Verteilungsverschiebungen zu verbessern.
Steigerung der Vision Transformer- und ResNet-Genauigkeit auf ImageNet durch Training mit SAM statt einfachem SGD.
Verbesserung der Robustheit gegenüber Beschriftungsrauschen, da sich flache Minima weniger wahrscheinlich fehlerhafte Beschriftungen merken.
Feinabstimmung vorab trainierter Sprachmodelle mit SAM, um eine bessere Verallgemeinerung kleiner nachgelagerter Datensätze zu erreichen.
Verwendung von ESAM- oder LookSAM-Varianten, wenn die doppelten Rechenkosten von Vanilla SAM zu teuer sind.
Die Optimierung eines Benchmarks kann umfassendere Systemschwächen verbergen.
Infrastruktur- und Wartungskosten werden oft unterschätzt.
Sicherheits- und Beobachtbarkeitslücken können größer werden, wenn die Systeme komplexer werden.
Definieren Sie vor der Implementierung Latenz-, Qualitäts- und Kostenziele.
Benchmark unter realistischen Last- und Datenbedingungen.
Instrumentenüberwachung auf Fehler, Drift und Benutzereinflüsse.
Bereiten Sie vor der Skalierung Rollback- und Incident-Response-Pfade vor.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Sharpness-Aware Minimization (SAM) ist eine Optimierungsmethode, die nicht nur einen geringen Verlust anstrebt, sondern einen geringen Verlust über eine ganze Nachbarschaft von Gewichtungen hinweg – ein flaches Minimum. Flachere Minima lassen sich tendenziell besser verallgemeinern, sodass SAM häufig die Testgenauigkeit und -robustheit verbessert, ohne die Modellarchitektur zu ändern.
SAM strebt flache Minima an, da sich Verluste, die bei kleinen Gewichtsstörungen niedrig bleiben, tendenziell besser auf unsichtbare Daten übertragen lassen.
SAM berechnet einen Gradienten, um den ungünstigsten Punkt in der Nähe zu finden, und dann einen weiteren Gradienten, um ihn zu aktualisieren – etwa das Doppelte der üblichen Kosten.
Rho legt fest, wie weit sich der „Aufstiegs“-Schritt bewegt, um den Nachbarn im ungünstigsten Fall zu finden, und definiert, wie groß eine flache Region sein soll, die SAM anstrebt.
SAM stört zunächst die Gewichte innerhalb des Radius rho in der Richtung, die den Verlust maximiert, und senkt sich dann vom ursprünglichen Punkt ab, indem es den dort berechneten Gradienten verwendet.
Das Auswendiglernen verrauschter Beschriftungen erfordert typischerweise scharfe, schmale Minima; Durch die Bevorzugung flacher Regionen verhindert SAM diese Überanpassung.
Lerne weiter
Weitere Leitfäden zu diesem Thema ausgewählt
Als nächstesNächster Leitfaden
DenseNet und Dense Connectivity
Technisch