Sprach-KI-GUIDE

Proximale Richtlinienoptimierung

Proximal Policy Optimization (PPO) ist der Reinforcement-Learning-Algorithmus, der am häufigsten mit der Feinabstimmung von Sprachmodellen anhand menschlichen Feedbacks in Verbindung gebracht wird.

2 Minuten gelesenZuletzt aktualisiert

Übersicht

It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.

Tiefer Einblick

PPO wurde 2017 von OpenAI eingeführt und wurde zum Arbeitstier hinter RLHF für Systeme wie InstructGPT und ChatGPT. Die größte Herausforderung bei Policy-Gradient-RL besteht darin, dass ein einziges zu großes Update die Leistung beeinträchtigen kann. PPO begegnet diesem Problem mit einem „abgeschnittenen Ersatzziel“: Es misst, um wie viel wahrscheinlicher (oder weniger) eine Aktion im Vergleich zur alten Richtlinie geworden ist, multipliziert dieses Verhältnis mit dem Vorteil (wie viel besser die Aktion war als erwartet) und begrenzt das Verhältnis auf einen kleinen Bereich wie 0,8 bis 1,2. Dadurch wird begrenzt, wie weit sich die Richtlinie pro Aktualisierung bewegen kann, wodurch das Lernen stabil bleibt und gleichzeitig eine stetige Verbesserung ermöglicht wird. Im Sprachmodell RLHF generiert die „Aktion“ ein Token oder eine Antwort, die Belohnung kommt von einem Belohnungsmodell und eine KL-Divergenzstrafe verhindert, dass das Modell zu weit von seinem ursprünglichen Verhalten abweicht.

Technischer Einblick

PPO maximiert ein abgeschnittenes Ziel: min(Verhältnis * Vorteil, Clip(Verhältnis, 1-eps, 1+eps) * Vorteil), wobei Verhältnis die neue gegenüber der alten Aktionswahrscheinlichkeit ist. Vorteile werden normalerweise mit der Generalized Advantage Estimation und einem Lernwertnetzwerk (Kritikernetzwerk) geschätzt. In RLHF kombiniert die Gesamtbelohnung die Bewertung des Belohnungsmodells mit einer KL-Strafe pro Token gegenüber der Referenzrichtlinie, wodurch der Belohnungsgewinn gegen die Annäherung an das ursprüngliche Modell ausgeglichen wird.

Strategische Auswirkungen

Geschwindigkeit und Umfang

Sprachworkflows können schneller ablaufen, ohne dass die Konsistenz darunter leidet.

Zugang und Erreichbarkeit

Es erweitert den Zugang über Sprachen und Kommunikationsstile hinweg.

Klarere Entscheidungen

Teams können mehr Zeit für die Beurteilung aufwenden, während die Automatisierung die Wiederholungen bewältigt.

Die Zukunft der proximalen Richtlinienoptimierung

PPO bleibt stark, ist aber bekanntermaßen umständlich: Es erfordert ein separates Wertschöpfungsnetzwerk, eine sorgfältige Abstimmung der Hyperparameter und viel Rechenleistung. Einfachere Alternativen sind auf dem Vormarsch, darunter DPO (überhaupt kein RL) und GRPO, das das Wertschöpfungsnetzwerk durch die Schätzung von Vorteilen aus Gruppen von Stichprobenantworten verkleinert und neuere Argumentationsmodelle unterstützt. PPO wird dort bestehen bleiben, wo die richtlinienkonforme Erkundung wirklich hilft, aber der Bereich tauscht aktiv einen Teil seiner Komplexität gegen günstigere Methoden ein.

Reale Umsetzung

Feinabstimmung von InstructGPT und ChatGPT, um Anweisungen und menschliche Vorlieben über RLHF zu befolgen

Training von Spiel- und Robotik-Kontrollagenten, die ursprüngliche Domäne von PPO vor Sprachmodellen

Reduzierung der Toxizität oder Verbesserung der Hilfsbereitschaft durch Maximierung eines Belohnungsmodell-Scores unter einer KL-Einschränkung

Optimierung der Werkzeugnutzung oder des mehrstufigen Agentenverhaltens, bei dem ein Modell für die korrekte Erledigung von Aufgaben belohnt wird

Risiken und Leitplanken

Halluzinierte Fakten können still und leise in Berichte, Support-Flows oder Forschungsergebnisse einfließen.

Eine schnelle Sensibilität kann bei ähnlichen Anfragen zu inkonsistenten Ergebnissen führen.

Sensible Textdaten können offengelegt werden, wenn die Zugriffskontrollen schwach sind.

Implementierungs-Roadmap

1

Definieren Sie vor dem Rollout Ausgabeformat, Ton und Qualitätsstandards.

2

Bodenantworten mit vertrauenswürdigen Quellen, wann immer es auf Genauigkeit ankommt.

3

Halten Sie einen Kontrollpunkt für die menschliche Überprüfung für Ergebnisse mit hohem Risiko ein.

4

Verfolgen Sie Fehlermuster und trainieren Sie Eingabeaufforderungen oder Arbeitsabläufe regelmäßig neu.

Entdecken Sie weiter

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Proximal Policy Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz starten

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Nächster Leitfaden

Gruppenrelative Richtlinienoptimierung

Häufig gestellte Fragen

What is Proximal Policy Optimization?

Proximal Policy Optimization (PPO) ist der Reinforcement-Learning-Algorithmus, der am häufigsten mit der Feinabstimmung von Sprachmodellen anhand menschlichen Feedbacks in Verbindung gebracht wird. Es verbessert eine Richtlinie in sorgfältigen, kleinen Schritten, um die Instabilität zu vermeiden, die naive Richtliniengradientenmethoden plagt.

Welches Problem löst das „Clipping“ von PPO in erster Linie?

Durch das Beschneiden des Wahrscheinlichkeitsverhältnisses wird verhindert, dass eine einzelne Aktualisierung die Richtlinie zu weit verschiebt, was die Hauptursache für Instabilität bei Richtliniengradientenmethoden darstellt.

Woher kommt im Sprachmodell RLHF mit PPO normalerweise das Belohnungssignal?

Ein Belohnungsmodell stellt die skalare Belohnung für generierte Antworten bereit, da es undurchführbar wäre, dass Menschen jede Ausgabe während des RL bewerten.

Was bewirkt die KL-Divergenzstrafe bei PPO-basiertem RLHF?

Die KL-Strafe pro Token gegenüber der ursprünglichen (Referenz-)Richtlinie hält das Modell davon ab, sein Verhalten zu drastisch zu ändern, während es der Belohnung nachjagt.

Welche Rolle spielt das Wertenetzwerk (Kritikernetzwerk) bei PPO?

PPO ist eine schauspielerisch-kritische Methode; Das Wertschöpfungsnetzwerk schätzt die erwartete Belohnung und ermöglicht so Vorteilsschätzungen (häufig über GAE), die die Varianz verringern.

Was bedeutet der „Vorteil“ bei PPO?

Der Vorteil misst, um wie viel besser (oder schlechter) eine ausgewählte Aktion im Vergleich zur Wertschätzung war, und gibt der Richtlinie an, welche Aktionen verstärkt werden sollen.