Technischer Leitfaden

Gruppenrelative Richtlinienoptimierung

Group Relative Policy Optimization (GRPO) ist eine Methode des verstärkenden Lernens zur Feinabstimmung von Sprachmodellen, die jede Antwort anhand einer Gruppe von Geschwisterantworten auf dieselbe Eingabeaufforderung beurteilt und so das von PPO verwendete separate Wertnetzwerk eliminiert.

  • 2 Minuten gelesen
  • Zuletzt aktualisiert
Auf dieser Seite2 Minuten gelesen
  1. Übersicht
  2. Tiefer Einblick
  3. Strategische Auswirkungen
  4. Die Zukunft der gruppenbezogenen Richtlinienoptimierung
  5. Reale Umsetzung
  6. Risiken und Leitplanken
  7. Implementierungs-Roadmap
  8. Entdecken Sie weiter
  9. Häufig gestellte Fragen

Übersicht

It became famous as the core training trick behind DeepSeek's reasoning models.

Tiefer Einblick

GRPO ist eine Variante des Policy-Gradient-Reinforcement-Learnings, die darauf abzielt, die RL-Feinabstimmung großer Sprachmodelle kostengünstiger und stabiler zu machen. Standard-PPO benötigt einen erlernten „Kritiker“ (Wertmodell), der ungefähr so ​​groß ist wie die Richtlinie selbst, um abzuschätzen, wie gut jeder Token ist. GRPO entfernt diesen Kritikpunkt vollständig. Für jede Eingabeaufforderung wird eine Gruppe von Abschlüssen (z. B. 8–64) abgetastet, alle mit einem Belohnungssignal bewertet und dann der Vorteil jedes Abschlusses berechnet, indem die Belohnung mit dem Mittelwert und der Standardabweichung der Gruppe standardisiert wird. Überdurchschnittliche Antworten werden verstärkt und unterdurchschnittliche unterdrückt. Ein KL-Divergenzterm hält das Modell nahe an einer Referenzrichtlinie. Es wurde von DeepSeek eingeführt und basierte auf DeepSeekMath und den DeepSeek-R1-Argumentationsmodellen.

Strategische Auswirkungen

Kosten und Budget

Architekturentscheidungen beeinflussen über Jahre hinweg die Leistung und die Betriebskosten.

Klarere Entscheidungen

Technische Schulungen helfen Teams dabei, den richtigen Stack auszuwählen, nicht nur den neuesten.

Qualitätskontrolle

Bessere technische Entscheidungen reduzieren Zuverlässigkeitsvorfälle in der Produktion.

Die Zukunft der gruppenbezogenen Richtlinienoptimierung

GRPO hat sich schnell zu einem Standardrezept für das Training offener Argumentationsmodelle entwickelt, und Labore iterieren an seinen Schwachstellen. Forscher erforschen Korrekturen für Längen- und Schwierigkeitsverzerrungen (wie Dr. GRPO), eine Normalisierung auf Token- statt auf Sequenzebene sowie das Entfernen oder Umformen des KL-Begriffs. Erwarten Sie eine engere Integration mit überprüfbaren Belohnungen (Mathematik, Code, Tool-Nutzung), einen besseren Umgang mit spärlichen Signalen und Hybriden, die Gruppen-Baselines mit einfachen Kritikern für agentische, mehrstufige Aufgaben kombinieren.

Reale Umsetzung

Trainieren Sie DeepSeek-R1 und DeepSeekMath, um lange Gedankenketten mithilfe regelbasierter Korrektheitsbelohnungen bei mathematischen Problemen zu erstellen

Feinabstimmung von Codegenerierungsmodellen, bei denen jede Stichprobenlösung danach bewertet wird, ob sie Unit-Tests besteht, und die Gruppe normalisiert wird, um Gewinner auszuwählen

Open-Source-RLHF-Pipelines (z. B. in TRL- und Verl-Bibliotheken), die GRPO verwenden, um Chat-Modelle auszurichten, ohne für ein separates Wertnetzwerk zu bezahlen

Verbesserung der Befolgung von Anweisungen oder des Sicherheitsverhaltens durch Auswahl mehrerer Antworten pro Eingabeaufforderung und Belohnung derjenigen, die ein Belohnungsmodell im Vergleich zu ihren Mitbewerbern am höchsten bewertet

Risiken und Leitplanken

  • Die Optimierung eines Benchmarks kann umfassendere Systemschwächen verbergen.

  • Infrastruktur- und Wartungskosten werden oft unterschätzt.

  • Sicherheits- und Beobachtbarkeitslücken können größer werden, wenn die Systeme komplexer werden.

Implementierungs-Roadmap

  1. Definieren Sie vor der Implementierung Latenz-, Qualitäts- und Kostenziele.

  2. Benchmark unter realistischen Last- und Datenbedingungen.

  3. Instrumentenüberwachung auf Fehler, Drift und Benutzereinflüsse.

  4. Bereiten Sie vor der Skalierung Rollback- und Incident-Response-Pfade vor.

Entdecken Sie weiter

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Group Relative Policy Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz starten

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Häufig gestellte Fragen

What is Group Relative Policy Optimization?

Group Relative Policy Optimization (GRPO) ist eine Methode des verstärkenden Lernens zur Feinabstimmung von Sprachmodellen, die jede Antwort anhand einer Gruppe von Geschwisterantworten auf dieselbe Eingabeaufforderung beurteilt und so das von PPO verwendete separate Wertnetzwerk eliminiert. Es wurde als zentraler Trainingstrick hinter den Argumentationsmodellen von DeepSeek berühmt.

Welche Hauptkomponente von PPO eliminiert GRPO?

Durch die Signaturänderung von GRPO wird das Lernwert-/Kritikmodell von PPO gelöscht, das normalerweise ungefähr die gleiche Größe wie die Richtlinie hat, wodurch erheblich Speicher und Rechenleistung eingespart werden.

Wie berechnet GRPO den Vorteil für eine bestimmte Fertigstellung?

Der Vorteil jeder Vervollständigung beträgt (Belohnung – Gruppenmittelwert) / Gruppenstandardabweichung, sodass die Gruppe der Antworten auf dieselbe Eingabeaufforderung als Basislinie dient.

Welche Modelle haben GRPO bekannt gemacht?

GRPO wurde von DeepSeek eingeführt und populär gemacht, insbesondere in DeepSeekMath und als RL-Engine hinter den DeepSeek-R1-Argumentationsmodellen.

Welche Rolle spielt der KL-Divergenzterm in GRPO?

Eine KL-Strafe gegen ein Referenzmodell (normalerweise das Vor-RL-Modell) reguliert das Training, sodass sich die Richtlinie verbessert, ohne zusammenzubrechen oder in degenerierte Ergebnisse abzudriften.

Warum ist GRPO besonders attraktiv für das Training von Argumentationsmodellen in Mathematik oder Code?

Die Stichprobe vieler Lösungen und deren Bewertung mit automatischen Korrektheitsprüfungen passt perfekt zu den gruppennormalisierten Vorteilen von GRPO, es ist keine Kritik erforderlich.