Als nächstesNächster Leitfaden
Proximale Richtlinienoptimierung
Sprach-KI
Technischer Leitfaden
Group Relative Policy Optimization (GRPO) ist eine Methode des verstärkenden Lernens zur Feinabstimmung von Sprachmodellen, die jede Antwort anhand einer Gruppe von Geschwisterantworten auf dieselbe Eingabeaufforderung beurteilt und so das von PPO verwendete separate Wertnetzwerk eliminiert.
It became famous as the core training trick behind DeepSeek's reasoning models.
GRPO ist eine Variante des Policy-Gradient-Reinforcement-Learnings, die darauf abzielt, die RL-Feinabstimmung großer Sprachmodelle kostengünstiger und stabiler zu machen. Standard-PPO benötigt einen erlernten „Kritiker“ (Wertmodell), der ungefähr so groß ist wie die Richtlinie selbst, um abzuschätzen, wie gut jeder Token ist. GRPO entfernt diesen Kritikpunkt vollständig. Für jede Eingabeaufforderung wird eine Gruppe von Abschlüssen (z. B. 8–64) abgetastet, alle mit einem Belohnungssignal bewertet und dann der Vorteil jedes Abschlusses berechnet, indem die Belohnung mit dem Mittelwert und der Standardabweichung der Gruppe standardisiert wird. Überdurchschnittliche Antworten werden verstärkt und unterdurchschnittliche unterdrückt. Ein KL-Divergenzterm hält das Modell nahe an einer Referenzrichtlinie. Es wurde von DeepSeek eingeführt und basierte auf DeepSeekMath und den DeepSeek-R1-Argumentationsmodellen.
Architekturentscheidungen beeinflussen über Jahre hinweg die Leistung und die Betriebskosten.
Technische Schulungen helfen Teams dabei, den richtigen Stack auszuwählen, nicht nur den neuesten.
Bessere technische Entscheidungen reduzieren Zuverlässigkeitsvorfälle in der Produktion.
GRPO hat sich schnell zu einem Standardrezept für das Training offener Argumentationsmodelle entwickelt, und Labore iterieren an seinen Schwachstellen. Forscher erforschen Korrekturen für Längen- und Schwierigkeitsverzerrungen (wie Dr. GRPO), eine Normalisierung auf Token- statt auf Sequenzebene sowie das Entfernen oder Umformen des KL-Begriffs. Erwarten Sie eine engere Integration mit überprüfbaren Belohnungen (Mathematik, Code, Tool-Nutzung), einen besseren Umgang mit spärlichen Signalen und Hybriden, die Gruppen-Baselines mit einfachen Kritikern für agentische, mehrstufige Aufgaben kombinieren.
Trainieren Sie DeepSeek-R1 und DeepSeekMath, um lange Gedankenketten mithilfe regelbasierter Korrektheitsbelohnungen bei mathematischen Problemen zu erstellen
Feinabstimmung von Codegenerierungsmodellen, bei denen jede Stichprobenlösung danach bewertet wird, ob sie Unit-Tests besteht, und die Gruppe normalisiert wird, um Gewinner auszuwählen
Open-Source-RLHF-Pipelines (z. B. in TRL- und Verl-Bibliotheken), die GRPO verwenden, um Chat-Modelle auszurichten, ohne für ein separates Wertnetzwerk zu bezahlen
Verbesserung der Befolgung von Anweisungen oder des Sicherheitsverhaltens durch Auswahl mehrerer Antworten pro Eingabeaufforderung und Belohnung derjenigen, die ein Belohnungsmodell im Vergleich zu ihren Mitbewerbern am höchsten bewertet
Die Optimierung eines Benchmarks kann umfassendere Systemschwächen verbergen.
Infrastruktur- und Wartungskosten werden oft unterschätzt.
Sicherheits- und Beobachtbarkeitslücken können größer werden, wenn die Systeme komplexer werden.
Definieren Sie vor der Implementierung Latenz-, Qualitäts- und Kostenziele.
Benchmark unter realistischen Last- und Datenbedingungen.
Instrumentenüberwachung auf Fehler, Drift und Benutzereinflüsse.
Bereiten Sie vor der Skalierung Rollback- und Incident-Response-Pfade vor.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Group Relative Policy Optimization (GRPO) ist eine Methode des verstärkenden Lernens zur Feinabstimmung von Sprachmodellen, die jede Antwort anhand einer Gruppe von Geschwisterantworten auf dieselbe Eingabeaufforderung beurteilt und so das von PPO verwendete separate Wertnetzwerk eliminiert. Es wurde als zentraler Trainingstrick hinter den Argumentationsmodellen von DeepSeek berühmt.
Durch die Signaturänderung von GRPO wird das Lernwert-/Kritikmodell von PPO gelöscht, das normalerweise ungefähr die gleiche Größe wie die Richtlinie hat, wodurch erheblich Speicher und Rechenleistung eingespart werden.
Der Vorteil jeder Vervollständigung beträgt (Belohnung – Gruppenmittelwert) / Gruppenstandardabweichung, sodass die Gruppe der Antworten auf dieselbe Eingabeaufforderung als Basislinie dient.
GRPO wurde von DeepSeek eingeführt und populär gemacht, insbesondere in DeepSeekMath und als RL-Engine hinter den DeepSeek-R1-Argumentationsmodellen.
Eine KL-Strafe gegen ein Referenzmodell (normalerweise das Vor-RL-Modell) reguliert das Training, sodass sich die Richtlinie verbessert, ohne zusammenzubrechen oder in degenerierte Ergebnisse abzudriften.
Die Stichprobe vieler Lösungen und deren Bewertung mit automatischen Korrektheitsprüfungen passt perfekt zu den gruppennormalisierten Vorteilen von GRPO, es ist keine Kritik erforderlich.
Lerne weiter
Weitere Leitfäden zu diesem Thema ausgewählt
Als nächstesNächster Leitfaden
Proximale Richtlinienoptimierung
Sprach-KI