Gruppierte Belohnungsnormalisierung in RLHF
Die gruppierte Belohnungsnormalisierung standardisiert die Belohnungen eines Modells innerhalb einer Reihe von Antworten auf dieselbe Eingabeaufforderung und wandelt verrauschte Ergebnisse in ein stabiles Trainingssignal um.
Übersicht
It is the core trick behind GRPO, the algorithm that powers many modern reasoning models.
Tiefer Einblick
Beim verstärkenden Lernen aus menschlichem Feedback (RLHF) generiert ein Modell Antworten und ein Belohnungsmodell bewertet sie, aber die Rohbelohnungen sind verrauscht und variieren stark je nach Eingabeaufforderung. Die gruppierte Belohnungsnormalisierung behebt dieses Problem, indem eine Gruppe mehrerer Antworten auf dieselbe Eingabeaufforderung untersucht und anschließend jede Belohnung normalisiert wird, indem der Gruppenmittelwert subtrahiert und durch die Standardabweichung der Gruppe dividiert wird. Dieser Z-Score wird zum Vorteil. Der Ansatz ist von zentraler Bedeutung für die von DeepSeek eingeführte Group Relative Policy Optimization (GRPO), die bekanntermaßen die Argumentation von DeepSeek-R1 vorangetrieben hat. Entscheidend ist, dass GRPO das von PPO verwendete separate Wertnetzwerk (Kritiker) eliminiert, da der Gruppendurchschnitt als Basis dient. Dies macht das Training einfacher, kostengünstiger und speichereffizienter, während das Gradientensignal gut skaliert bleibt.
Technischer Einblick
Für eine Gruppe von Ausgaben mit Belohnungen r_1...r_G beträgt der Vorteil A_i = (r_i − mean(r)) / std(r). Antworten, die über dem Durchschnitt ihrer Gruppe liegen, erhalten einen positiven Vorteil und werden verstärkt; überdurchschnittlich schlechte werden nach unten gedrückt. Da der Vergleich innerhalb einer Eingabeaufforderung relativ ist, heben sich die absolute Belohnungsskala und die Schwierigkeit pro Eingabeaufforderung auf, wodurch die Varianz verringert wird. GRPO behält das abgeschnittene PPO-Ziel und die KL-Strafe gegenüber einer Referenzrichtlinie bei, um zu verhindern, dass das Modell zu weit abdriftet.
Strategische Auswirkungen
Klarere Entscheidungen
Es hilft Ihnen, klare technische Aussagen von der Marketingsprache zu trennen.
Kosten und Budget
Sie können bessere Fragen zur Implementierung stellen, bevor Sie Geld oder Zeit investieren.
Team und Arbeitsablauf
Teams mit gemeinsamem Verständnis treffen bessere Produkt-, Richtlinien- und Lernentscheidungen.
Die Zukunft der Normalisierung gruppierter Belohnungen in RLHF
Die gruppierte Normalisierung treibt den Boom der Argumentationsmodelle voran, bei dem Modelle aus überprüfbaren Belohnungen wie korrekten mathematischen Antworten ohne einen erfahrenen Kritiker lernen. Die Forschung verfeinert es: Debatten darüber, ob durch Standardabweichung dividiert werden soll, Umgang mit „Alles-richtig“- oder „Alles-falsch“-Gruppen, die keinen Vorteil bringen, und Skalierung der Gruppengröße. Es ist zu erwarten, dass sich gruppierte, kritikfreie Methoden auf die Verwendung von Agententools und die Codegenerierung ausweiten, wo automatische Verifizierer günstige, reichliche Belohnungssignale liefern.
Reale Umsetzung
Trainieren Sie ein mathematisches Argumentationsmodell, indem Sie 16 Lösungen pro Problem auswählen und diejenigen belohnen, die über der durchschnittlichen Richtigkeit der Gruppe liegen.
Feinabstimmung der Hilfsbereitschaft eines Chatbots durch Normalisierung der Belohnungsmodellbewertungen über mehrere Kandidatenantworten auf jede Benutzeraufforderung.
Verbesserung eines Codierungsassistenten, bei dem jede Stichprobenlösung danach bewertet wird, ob sie Unit-Tests besteht, und dann innerhalb der Gruppe normalisiert wird.
Reduzieren Sie den GPU-Speicher in einer RLHF-Pipeline, indem Sie das kritische PPO-Netzwerk entfernen und stattdessen den Gruppenmittelwert als Basis verwenden.
Risiken und Leitplanken
Unterschiedliche Teams verwenden denselben Begriff möglicherweise unterschiedlich. Definieren Sie daher frühzeitig den Geltungsbereich.
Benchmarks können stark aussehen, während die tatsächliche Leistung uneinheitlich ist.
Das Ignorieren von Datenqualität und Evaluierungsplänen führt oft zu fragilen Ergebnissen.
Implementierungs-Roadmap
Beginnen Sie mit einer klaren Definition des gewünschten Ergebnisses.
Wählen Sie vor dem Testen eine Erfolgsmetrik und eine Fehlerbedingung aus.
Führen Sie ein kleines Pilotprojekt mit repräsentativen Daten durch, nicht mit einem ausgefeilten Demoset.
Dokumentieren Sie, wo die Grouped Reward Normalization in RLHF hilft und wo einfachere Methoden besser sind.
Entdecken Sie weiter
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Grouped Reward Normalization in RLHF quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Nächster Leitfaden
Längennormalisierung in der Präferenzoptimierung
Häufig gestellte Fragen
What is Grouped Reward Normalization in RLHF?
Die gruppierte Belohnungsnormalisierung standardisiert die Belohnungen eines Modells innerhalb einer Reihe von Antworten auf dieselbe Eingabeaufforderung und wandelt verrauschte Ergebnisse in ein stabiles Trainingssignal um. Dies ist der Kerntrick hinter GRPO, dem Algorithmus, der vielen modernen Argumentationsmodellen zugrunde liegt.
Womit wird bei der gruppierten Belohnungsnormalisierung die Belohnung jeder Antwort verglichen?
Jede Belohnung wird anhand des Mittelwerts und der Standardabweichung der Gruppe von Antworten auf dieselbe Eingabeaufforderung in einen Z-Score umgewandelt.
Welcher Algorithmus ist am meisten mit der Normalisierung gruppierter Belohnungen verbunden?
GRPO, eingeführt von DeepSeek und verwendet in DeepSeek-R1, basiert auf der Normalisierung von Belohnungen innerhalb einer Gruppe.
Welche Komponente des Standard-PPO eliminiert GRPO insbesondere?
Durch die Verwendung des Gruppendurchschnitts als Basislinie eliminiert GRPO den erlernten Kritikpunkt und spart so Speicher und Rechenleistung.
Was passiert mit einer Antwort, deren Belohnung unter dem Mittelwert ihrer Gruppe liegt?
Durch Subtrahieren des Gruppenmittelwerts haben unterdurchschnittliche Antworten einen negativen Vorteil und verdrängen die Richtlinie von ihnen.
Warum verringert die Normalisierung innerhalb einer Gruppe die Trainingsvarianz?
Da Vergleiche innerhalb jeder Eingabeaufforderung relativ sind, verschwinden Unterschiede im absoluten Maßstab und in der Schwierigkeit der Eingabeaufforderungen.