Grundlagen-Leitfaden

Gruppierte Belohnungsnormalisierung in RLHF

Die gruppierte Belohnungsnormalisierung standardisiert die Belohnungen eines Modells innerhalb einer Reihe von Antworten auf dieselbe Eingabeaufforderung und wandelt verrauschte Ergebnisse in ein stabiles Trainingssignal um.

2 Minuten gelesenZuletzt aktualisiert

Übersicht

It is the core trick behind GRPO, the algorithm that powers many modern reasoning models.

Tiefer Einblick

Beim verstärkenden Lernen aus menschlichem Feedback (RLHF) generiert ein Modell Antworten und ein Belohnungsmodell bewertet sie, aber die Rohbelohnungen sind verrauscht und variieren stark je nach Eingabeaufforderung. Die gruppierte Belohnungsnormalisierung behebt dieses Problem, indem eine Gruppe mehrerer Antworten auf dieselbe Eingabeaufforderung untersucht und anschließend jede Belohnung normalisiert wird, indem der Gruppenmittelwert subtrahiert und durch die Standardabweichung der Gruppe dividiert wird. Dieser Z-Score wird zum Vorteil. Der Ansatz ist von zentraler Bedeutung für die von DeepSeek eingeführte Group Relative Policy Optimization (GRPO), die bekanntermaßen die Argumentation von DeepSeek-R1 vorangetrieben hat. Entscheidend ist, dass GRPO das von PPO verwendete separate Wertnetzwerk (Kritiker) eliminiert, da der Gruppendurchschnitt als Basis dient. Dies macht das Training einfacher, kostengünstiger und speichereffizienter, während das Gradientensignal gut skaliert bleibt.

Technischer Einblick

Für eine Gruppe von Ausgaben mit Belohnungen r_1...r_G beträgt der Vorteil A_i = (r_i − mean(r)) / std(r). Antworten, die über dem Durchschnitt ihrer Gruppe liegen, erhalten einen positiven Vorteil und werden verstärkt; überdurchschnittlich schlechte werden nach unten gedrückt. Da der Vergleich innerhalb einer Eingabeaufforderung relativ ist, heben sich die absolute Belohnungsskala und die Schwierigkeit pro Eingabeaufforderung auf, wodurch die Varianz verringert wird. GRPO behält das abgeschnittene PPO-Ziel und die KL-Strafe gegenüber einer Referenzrichtlinie bei, um zu verhindern, dass das Modell zu weit abdriftet.

Strategische Auswirkungen

Klarere Entscheidungen

Es hilft Ihnen, klare technische Aussagen von der Marketingsprache zu trennen.

Kosten und Budget

Sie können bessere Fragen zur Implementierung stellen, bevor Sie Geld oder Zeit investieren.

Team und Arbeitsablauf

Teams mit gemeinsamem Verständnis treffen bessere Produkt-, Richtlinien- und Lernentscheidungen.

Die Zukunft der Normalisierung gruppierter Belohnungen in RLHF

Die gruppierte Normalisierung treibt den Boom der Argumentationsmodelle voran, bei dem Modelle aus überprüfbaren Belohnungen wie korrekten mathematischen Antworten ohne einen erfahrenen Kritiker lernen. Die Forschung verfeinert es: Debatten darüber, ob durch Standardabweichung dividiert werden soll, Umgang mit „Alles-richtig“- oder „Alles-falsch“-Gruppen, die keinen Vorteil bringen, und Skalierung der Gruppengröße. Es ist zu erwarten, dass sich gruppierte, kritikfreie Methoden auf die Verwendung von Agententools und die Codegenerierung ausweiten, wo automatische Verifizierer günstige, reichliche Belohnungssignale liefern.

Reale Umsetzung

Trainieren Sie ein mathematisches Argumentationsmodell, indem Sie 16 Lösungen pro Problem auswählen und diejenigen belohnen, die über der durchschnittlichen Richtigkeit der Gruppe liegen.

Feinabstimmung der Hilfsbereitschaft eines Chatbots durch Normalisierung der Belohnungsmodellbewertungen über mehrere Kandidatenantworten auf jede Benutzeraufforderung.

Verbesserung eines Codierungsassistenten, bei dem jede Stichprobenlösung danach bewertet wird, ob sie Unit-Tests besteht, und dann innerhalb der Gruppe normalisiert wird.

Reduzieren Sie den GPU-Speicher in einer RLHF-Pipeline, indem Sie das kritische PPO-Netzwerk entfernen und stattdessen den Gruppenmittelwert als Basis verwenden.

Risiken und Leitplanken

Unterschiedliche Teams verwenden denselben Begriff möglicherweise unterschiedlich. Definieren Sie daher frühzeitig den Geltungsbereich.

Benchmarks können stark aussehen, während die tatsächliche Leistung uneinheitlich ist.

Das Ignorieren von Datenqualität und Evaluierungsplänen führt oft zu fragilen Ergebnissen.

Implementierungs-Roadmap

1

Beginnen Sie mit einer klaren Definition des gewünschten Ergebnisses.

2

Wählen Sie vor dem Testen eine Erfolgsmetrik und eine Fehlerbedingung aus.

3

Führen Sie ein kleines Pilotprojekt mit repräsentativen Daten durch, nicht mit einem ausgefeilten Demoset.

4

Dokumentieren Sie, wo die Grouped Reward Normalization in RLHF hilft und wo einfachere Methoden besser sind.

Entdecken Sie weiter

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Grouped Reward Normalization in RLHF quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz starten

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Nächster Leitfaden

Längennormalisierung in der Präferenzoptimierung

Häufig gestellte Fragen

What is Grouped Reward Normalization in RLHF?

Die gruppierte Belohnungsnormalisierung standardisiert die Belohnungen eines Modells innerhalb einer Reihe von Antworten auf dieselbe Eingabeaufforderung und wandelt verrauschte Ergebnisse in ein stabiles Trainingssignal um. Dies ist der Kerntrick hinter GRPO, dem Algorithmus, der vielen modernen Argumentationsmodellen zugrunde liegt.

Womit wird bei der gruppierten Belohnungsnormalisierung die Belohnung jeder Antwort verglichen?

Jede Belohnung wird anhand des Mittelwerts und der Standardabweichung der Gruppe von Antworten auf dieselbe Eingabeaufforderung in einen Z-Score umgewandelt.

Welcher Algorithmus ist am meisten mit der Normalisierung gruppierter Belohnungen verbunden?

GRPO, eingeführt von DeepSeek und verwendet in DeepSeek-R1, basiert auf der Normalisierung von Belohnungen innerhalb einer Gruppe.

Welche Komponente des Standard-PPO eliminiert GRPO insbesondere?

Durch die Verwendung des Gruppendurchschnitts als Basislinie eliminiert GRPO den erlernten Kritikpunkt und spart so Speicher und Rechenleistung.

Was passiert mit einer Antwort, deren Belohnung unter dem Mittelwert ihrer Gruppe liegt?

Durch Subtrahieren des Gruppenmittelwerts haben unterdurchschnittliche Antworten einen negativen Vorteil und verdrängen die Richtlinie von ihnen.

Warum verringert die Normalisierung innerhalb einer Gruppe die Trainingsvarianz?

Da Vergleiche innerhalb jeder Eingabeaufforderung relativ sind, verschwinden Unterschiede im absoluten Maßstab und in der Schwierigkeit der Eingabeaufforderungen.