Optimisation des politiques proximales
L'optimisation des politiques proximales (PPO) est l'algorithme d'apprentissage par renforcement le plus associé à l'ajustement fin des modèles de langage à partir des commentaires humains.
Aperçu
It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.
Plongée profonde
PPO a été introduit par OpenAI en 2017 et est devenu le cheval de bataille derrière RLHF pour des systèmes comme InstructGPT et ChatGPT. Le principal défi du RL à gradient de politique est qu’une seule mise à jour trop volumineuse peut réduire les performances. Le PPO résout ce problème avec un « objectif de substitution tronqué » : il mesure la probabilité qu'une action soit devenue plus (ou moins) par rapport à l'ancienne politique, multiplie ce rapport par l'avantage (à quel point l'action était meilleure que prévu) et réduit le rapport à une petite plage comme 0,8 à 1,2. Cela limite jusqu'où la politique peut évoluer par mise à jour, gardant l'apprentissage stable tout en permettant une amélioration constante. Dans le modèle de langage RLHF, « l'action » génère un jeton ou une réponse, la récompense vient d'un modèle de récompense et une pénalité de divergence KL empêche le modèle de trop s'éloigner de son comportement d'origine.
Aperçu technique
PPO maximise un objectif tronqué : min(ratio * avantage, clip(ratio, 1-eps, 1+eps) * avantage), où ratio est la probabilité d'action nouvelle par rapport à l'ancienne. Les avantages sont généralement estimés à l’aide d’une estimation généralisée des avantages et d’un réseau de valeurs apprises (critiques). Dans RLHF, la récompense totale combine le score du modèle de récompense avec une pénalité KL par jeton par rapport à la politique de référence, équilibrant ainsi le gain de récompense et le fait de rester proche du modèle d'origine.
Impact stratégique
Vitesse et échelle
Les flux de travail linguistiques peuvent évoluer plus rapidement sans sacrifier la cohérence.
Accès et portée
Il étend l’accès à toutes les langues et styles de communication.
Décisions plus claires
Les équipes peuvent consacrer plus de temps au jugement tandis que l’automatisation gère les répétitions.
L’avenir de l’optimisation proximale des politiques
Le PPO reste fort mais est notoirement délicat : il nécessite un réseau de valeurs séparé, un réglage minutieux des hyperparamètres et beaucoup de calcul. Des alternatives plus simples gagnent du terrain, notamment le DPO (pas de RL du tout) et le GRPO, qui abandonnent le réseau de valeurs en estimant les avantages de groupes de réponses échantillonnées et qui ont alimenté des modèles de raisonnement récents. Le PPO persistera là où l’exploration politique est réellement utile, mais le domaine échange activement une partie de sa complexité contre des méthodes moins coûteuses.
Mise en œuvre dans le monde réel
Affiner InstructGPT et ChatGPT pour suivre les instructions et les préférences humaines via RLHF
Formation d'agents de jeu et de contrôle robotique, domaine d'origine de PPO avant les modèles linguistiques
Réduire la toxicité ou améliorer l'utilité en maximisant un score de modèle de récompense sous une contrainte KL
Optimiser l'utilisation des outils ou le comportement des agents en plusieurs étapes où un modèle est récompensé pour avoir accompli correctement les tâches
Risques et garde-fous
Les faits hallucinés peuvent discrètement entrer dans des rapports, des flux de support ou des résultats de recherche.
La sensibilité des invites peut créer des résultats incohérents pour des demandes similaires.
Les données textuelles sensibles peuvent être exposées si les contrôles d’accès sont faibles.
Feuille de route de mise en œuvre
Définissez le format de sortie, le ton et les normes de qualité avant le déploiement.
Établissez des réponses auprès de sources fiables chaque fois que la précision est importante.
Gardez un point de contrôle d’examen humain pour les résultats à enjeux élevés.
Suivez les modèles de défaillance et recyclez régulièrement les invites ou les flux de travail.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Proximal Policy Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
Optimisation de la politique relative du groupe
Questions fréquemment posées
What is Proximal Policy Optimization?
L'optimisation des politiques proximales (PPO) est l'algorithme d'apprentissage par renforcement le plus associé à l'ajustement fin des modèles de langage à partir des commentaires humains. Il améliore une politique par petites étapes prudentes pour éviter l’instabilité qui sévit dans les méthodes naïves de gradient politique.
Quel problème le « détourage » du PPO résout-il principalement ?
La réduction du rapport de probabilité empêche toute mise à jour unique de déplacer la politique trop loin, ce qui constitue la principale source d'instabilité des méthodes de gradient de politique.
Dans le modèle de langage RLHF avec PPO, d'où vient généralement le signal de récompense ?
Un modèle de récompense fournit une récompense scalaire pour les réponses générées, car il serait impossible que des humains notent chaque résultat pendant RL.
Que fait la pénalité de divergence KL dans le RLHF basé sur PPO ?
La pénalité KL par jeton par rapport à la politique d'origine (de référence) décourage le modèle de modifier son comportement de manière trop radicale tout en recherchant une récompense.
Quel est le rôle du réseau de valeur (critique) dans le PPO ?
Le PPO est une méthode acteur-critique ; le réseau de valeurs estime la récompense attendue, permettant des estimations d'avantages (souvent via GAE) qui réduisent la variance.
Que représente « l'avantage » dans PPO ?
L’avantage mesure dans quelle mesure une action choisie était meilleure (ou pire) par rapport à l’estimation de la valeur, indiquant à la politique quelles actions renforcer.