GUIDE IA du langage

Optimisation des politiques proximales

L'optimisation des politiques proximales (PPO) est l'algorithme d'apprentissage par renforcement le plus associé à l'ajustement fin des modèles de langage à partir des commentaires humains.

2 minutes de lectureDernière mise à jour

Aperçu

It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.

Plongée profonde

PPO a été introduit par OpenAI en 2017 et est devenu le cheval de bataille derrière RLHF pour des systèmes comme InstructGPT et ChatGPT. Le principal défi du RL à gradient de politique est qu’une seule mise à jour trop volumineuse peut réduire les performances. Le PPO résout ce problème avec un « objectif de substitution tronqué » : il mesure la probabilité qu'une action soit devenue plus (ou moins) par rapport à l'ancienne politique, multiplie ce rapport par l'avantage (à quel point l'action était meilleure que prévu) et réduit le rapport à une petite plage comme 0,8 à 1,2. Cela limite jusqu'où la politique peut évoluer par mise à jour, gardant l'apprentissage stable tout en permettant une amélioration constante. Dans le modèle de langage RLHF, « l'action » génère un jeton ou une réponse, la récompense vient d'un modèle de récompense et une pénalité de divergence KL empêche le modèle de trop s'éloigner de son comportement d'origine.

Aperçu technique

PPO maximise un objectif tronqué : min(ratio * avantage, clip(ratio, 1-eps, 1+eps) * avantage), où ratio est la probabilité d'action nouvelle par rapport à l'ancienne. Les avantages sont généralement estimés à l’aide d’une estimation généralisée des avantages et d’un réseau de valeurs apprises (critiques). Dans RLHF, la récompense totale combine le score du modèle de récompense avec une pénalité KL par jeton par rapport à la politique de référence, équilibrant ainsi le gain de récompense et le fait de rester proche du modèle d'origine.

Impact stratégique

Vitesse et échelle

Les flux de travail linguistiques peuvent évoluer plus rapidement sans sacrifier la cohérence.

Accès et portée

Il étend l’accès à toutes les langues et styles de communication.

Décisions plus claires

Les équipes peuvent consacrer plus de temps au jugement tandis que l’automatisation gère les répétitions.

L’avenir de l’optimisation proximale des politiques

Le PPO reste fort mais est notoirement délicat : il nécessite un réseau de valeurs séparé, un réglage minutieux des hyperparamètres et beaucoup de calcul. Des alternatives plus simples gagnent du terrain, notamment le DPO (pas de RL du tout) et le GRPO, qui abandonnent le réseau de valeurs en estimant les avantages de groupes de réponses échantillonnées et qui ont alimenté des modèles de raisonnement récents. Le PPO persistera là où l’exploration politique est réellement utile, mais le domaine échange activement une partie de sa complexité contre des méthodes moins coûteuses.

Mise en œuvre dans le monde réel

Affiner InstructGPT et ChatGPT pour suivre les instructions et les préférences humaines via RLHF

Formation d'agents de jeu et de contrôle robotique, domaine d'origine de PPO avant les modèles linguistiques

Réduire la toxicité ou améliorer l'utilité en maximisant un score de modèle de récompense sous une contrainte KL

Optimiser l'utilisation des outils ou le comportement des agents en plusieurs étapes où un modèle est récompensé pour avoir accompli correctement les tâches

Risques et garde-fous

Les faits hallucinés peuvent discrètement entrer dans des rapports, des flux de support ou des résultats de recherche.

La sensibilité des invites peut créer des résultats incohérents pour des demandes similaires.

Les données textuelles sensibles peuvent être exposées si les contrôles d’accès sont faibles.

Feuille de route de mise en œuvre

1

Définissez le format de sortie, le ton et les normes de qualité avant le déploiement.

2

Établissez des réponses auprès de sources fiables chaque fois que la précision est importante.

3

Gardez un point de contrôle d’examen humain pour les résultats à enjeux élevés.

4

Suivez les modèles de défaillance et recyclez régulièrement les invites ou les flux de travail.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Proximal Policy Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Optimisation de la politique relative du groupe

Questions fréquemment posées

What is Proximal Policy Optimization?

L'optimisation des politiques proximales (PPO) est l'algorithme d'apprentissage par renforcement le plus associé à l'ajustement fin des modèles de langage à partir des commentaires humains. Il améliore une politique par petites étapes prudentes pour éviter l’instabilité qui sévit dans les méthodes naïves de gradient politique.

Quel problème le « détourage » du PPO résout-il principalement ?

La réduction du rapport de probabilité empêche toute mise à jour unique de déplacer la politique trop loin, ce qui constitue la principale source d'instabilité des méthodes de gradient de politique.

Dans le modèle de langage RLHF avec PPO, d'où vient généralement le signal de récompense ?

Un modèle de récompense fournit une récompense scalaire pour les réponses générées, car il serait impossible que des humains notent chaque résultat pendant RL.

Que fait la pénalité de divergence KL dans le RLHF basé sur PPO ?

La pénalité KL par jeton par rapport à la politique d'origine (de référence) décourage le modèle de modifier son comportement de manière trop radicale tout en recherchant une récompense.

Quel est le rôle du réseau de valeur (critique) dans le PPO ?

Le PPO est une méthode acteur-critique ; le réseau de valeurs estime la récompense attendue, permettant des estimations d'avantages (souvent via GAE) qui réduisent la variance.

Que représente « l'avantage » dans PPO ?

L’avantage mesure dans quelle mesure une action choisie était meilleure (ou pire) par rapport à l’estimation de la valeur, indiquant à la politique quelles actions renforcer.