Proximale Richtlinienoptimierung
Proximal Policy Optimization (PPO) ist der Reinforcement-Learning-Algorithmus, der am häufigsten mit der Feinabstimmung von Sprachmodellen anhand menschlichen Feedbacks in Verbindung gebracht wird.
Übersicht
It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.
Tiefer Einblick
PPO wurde 2017 von OpenAI eingeführt und wurde zum Arbeitstier hinter RLHF für Systeme wie InstructGPT und ChatGPT. Die größte Herausforderung bei Policy-Gradient-RL besteht darin, dass ein einziges zu großes Update die Leistung beeinträchtigen kann. PPO begegnet diesem Problem mit einem „abgeschnittenen Ersatzziel“: Es misst, um wie viel wahrscheinlicher (oder weniger) eine Aktion im Vergleich zur alten Richtlinie geworden ist, multipliziert dieses Verhältnis mit dem Vorteil (wie viel besser die Aktion war als erwartet) und begrenzt das Verhältnis auf einen kleinen Bereich wie 0,8 bis 1,2. Dadurch wird begrenzt, wie weit sich die Richtlinie pro Aktualisierung bewegen kann, wodurch das Lernen stabil bleibt und gleichzeitig eine stetige Verbesserung ermöglicht wird. Im Sprachmodell RLHF generiert die „Aktion“ ein Token oder eine Antwort, die Belohnung kommt von einem Belohnungsmodell und eine KL-Divergenzstrafe verhindert, dass das Modell zu weit von seinem ursprünglichen Verhalten abweicht.
Technischer Einblick
PPO maximiert ein abgeschnittenes Ziel: min(Verhältnis * Vorteil, Clip(Verhältnis, 1-eps, 1+eps) * Vorteil), wobei Verhältnis die neue gegenüber der alten Aktionswahrscheinlichkeit ist. Vorteile werden normalerweise mit der Generalized Advantage Estimation und einem Lernwertnetzwerk (Kritikernetzwerk) geschätzt. In RLHF kombiniert die Gesamtbelohnung die Bewertung des Belohnungsmodells mit einer KL-Strafe pro Token gegenüber der Referenzrichtlinie, wodurch der Belohnungsgewinn gegen die Annäherung an das ursprüngliche Modell ausgeglichen wird.
Strategische Auswirkungen
Geschwindigkeit und Umfang
Sprachworkflows können schneller ablaufen, ohne dass die Konsistenz darunter leidet.
Zugang und Erreichbarkeit
Es erweitert den Zugang über Sprachen und Kommunikationsstile hinweg.
Klarere Entscheidungen
Teams können mehr Zeit für die Beurteilung aufwenden, während die Automatisierung die Wiederholungen bewältigt.
Die Zukunft der proximalen Richtlinienoptimierung
PPO bleibt stark, ist aber bekanntermaßen umständlich: Es erfordert ein separates Wertschöpfungsnetzwerk, eine sorgfältige Abstimmung der Hyperparameter und viel Rechenleistung. Einfachere Alternativen sind auf dem Vormarsch, darunter DPO (überhaupt kein RL) und GRPO, das das Wertschöpfungsnetzwerk durch die Schätzung von Vorteilen aus Gruppen von Stichprobenantworten verkleinert und neuere Argumentationsmodelle unterstützt. PPO wird dort bestehen bleiben, wo die richtlinienkonforme Erkundung wirklich hilft, aber der Bereich tauscht aktiv einen Teil seiner Komplexität gegen günstigere Methoden ein.
Reale Umsetzung
Feinabstimmung von InstructGPT und ChatGPT, um Anweisungen und menschliche Vorlieben über RLHF zu befolgen
Training von Spiel- und Robotik-Kontrollagenten, die ursprüngliche Domäne von PPO vor Sprachmodellen
Reduzierung der Toxizität oder Verbesserung der Hilfsbereitschaft durch Maximierung eines Belohnungsmodell-Scores unter einer KL-Einschränkung
Optimierung der Werkzeugnutzung oder des mehrstufigen Agentenverhaltens, bei dem ein Modell für die korrekte Erledigung von Aufgaben belohnt wird
Risiken und Leitplanken
Halluzinierte Fakten können still und leise in Berichte, Support-Flows oder Forschungsergebnisse einfließen.
Eine schnelle Sensibilität kann bei ähnlichen Anfragen zu inkonsistenten Ergebnissen führen.
Sensible Textdaten können offengelegt werden, wenn die Zugriffskontrollen schwach sind.
Implementierungs-Roadmap
Definieren Sie vor dem Rollout Ausgabeformat, Ton und Qualitätsstandards.
Bodenantworten mit vertrauenswürdigen Quellen, wann immer es auf Genauigkeit ankommt.
Halten Sie einen Kontrollpunkt für die menschliche Überprüfung für Ergebnisse mit hohem Risiko ein.
Verfolgen Sie Fehlermuster und trainieren Sie Eingabeaufforderungen oder Arbeitsabläufe regelmäßig neu.
Entdecken Sie weiter
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Proximal Policy Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Nächster Leitfaden
Gruppenrelative Richtlinienoptimierung
Häufig gestellte Fragen
What is Proximal Policy Optimization?
Proximal Policy Optimization (PPO) ist der Reinforcement-Learning-Algorithmus, der am häufigsten mit der Feinabstimmung von Sprachmodellen anhand menschlichen Feedbacks in Verbindung gebracht wird. Es verbessert eine Richtlinie in sorgfältigen, kleinen Schritten, um die Instabilität zu vermeiden, die naive Richtliniengradientenmethoden plagt.
Welches Problem löst das „Clipping“ von PPO in erster Linie?
Durch das Beschneiden des Wahrscheinlichkeitsverhältnisses wird verhindert, dass eine einzelne Aktualisierung die Richtlinie zu weit verschiebt, was die Hauptursache für Instabilität bei Richtliniengradientenmethoden darstellt.
Woher kommt im Sprachmodell RLHF mit PPO normalerweise das Belohnungssignal?
Ein Belohnungsmodell stellt die skalare Belohnung für generierte Antworten bereit, da es undurchführbar wäre, dass Menschen jede Ausgabe während des RL bewerten.
Was bewirkt die KL-Divergenzstrafe bei PPO-basiertem RLHF?
Die KL-Strafe pro Token gegenüber der ursprünglichen (Referenz-)Richtlinie hält das Modell davon ab, sein Verhalten zu drastisch zu ändern, während es der Belohnung nachjagt.
Welche Rolle spielt das Wertenetzwerk (Kritikernetzwerk) bei PPO?
PPO ist eine schauspielerisch-kritische Methode; Das Wertschöpfungsnetzwerk schätzt die erwartete Belohnung und ermöglicht so Vorteilsschätzungen (häufig über GAE), die die Varianz verringern.
Was bedeutet der „Vorteil“ bei PPO?
Der Vorteil misst, um wie viel besser (oder schlechter) eine ausgewählte Aktion im Vergleich zur Wertschätzung war, und gibt der Richtlinie an, welche Aktionen verstärkt werden sollen.