GUIDE Technique

Optimisation de la politique relative du groupe

L'optimisation de la politique relative de groupe (GRPO) est une méthode d'apprentissage par renforcement permettant d'affiner les modèles de langage qui juge chaque réponse par rapport à un groupe de réponses frères et sœurs à la même invite, éliminant ainsi le réseau de valeurs distinct utilisé par PPO.

2 minutes de lectureDernière mise à jour

Aperçu

It became famous as the core training trick behind DeepSeek's reasoning models.

Plongée profonde

GRPO est une variante de l'apprentissage par renforcement par gradient de politique conçu pour rendre le réglage fin RL de grands modèles de langage moins cher et plus stable. Le PPO standard a besoin d'un « critique » (modèle de valeur) appris, à peu près aussi grand que la politique elle-même, pour estimer la qualité de chaque jeton. Le GRPO supprime entièrement cette critique. Pour chaque invite, il échantillonne un groupe d'achèvements (disons 8 à 64), les note tous avec un signal de récompense, puis calcule l'avantage de chaque achèvement en standardisant sa récompense par rapport à la moyenne et à l'écart type du groupe. Les réponses supérieures à la moyenne sont renforcées et celles inférieures à la moyenne supprimées. Un terme de divergence KL maintient le modèle proche d'une politique de référence. Introduit par DeepSeek, il alimente DeepSeekMath et les modèles de raisonnement DeepSeek-R1.

Aperçu technique

L'idée clé est de remplacer la référence de valeur apprise de PPO par une référence de groupe de Monte Carlo. Pour un groupe de sorties avec des récompenses r_i, chaque avantage est A_i = (r_i - moyenne(r)) / std(r). Ce score normalisé multiplie le rapport de probabilité écrêté, exactement comme dans PPO, et une pénalité KL par rapport à un modèle de référence gelé freine la dérive. Étant donné qu'aucun critique n'est formé, la mémoire et le calcul sont réduits de moitié environ, et la normalisation par invite offre des avantages naturellement mis à l'échelle et à faible variance.

Impact stratégique

Coût et budget

Les décisions en matière d'architecture déterminent les performances et les coûts d'exploitation pendant des années.

Décisions plus claires

La formation technique aide les équipes à choisir la bonne pile, pas seulement la plus récente.

Contrôle qualité

De meilleurs choix d’ingénierie réduisent les incidents de fiabilité en production.

L’avenir de l’optimisation des politiques relatives de groupe

GRPO est rapidement devenu une recette par défaut pour former des modèles de raisonnement ouverts, et les laboratoires itèrent sur ses points faibles. Les chercheurs explorent des correctifs pour les biais de longueur et de difficulté (comme le Dr GRPO), la normalisation au niveau du jeton plutôt qu'au niveau de la séquence, et suppriment ou remodèlent le terme KL. Attendez-vous à une intégration plus étroite avec des récompenses vérifiables (mathématiques, code, utilisation d'outils), une meilleure gestion des signaux clairsemés et des hybrides combinant des lignes de base de groupe avec des critiques légères pour des tâches agentiques en plusieurs étapes.

Mise en œuvre dans le monde réel

Entraîner DeepSeek-R1 et DeepSeekMath pour produire un raisonnement à longue chaîne de pensée en utilisant des récompenses d'exactitude basées sur des règles sur des problèmes mathématiques

Affiner les modèles de génération de code dans lesquels chaque solution échantillonnée est notée selon qu'elle réussit les tests unitaires, et le groupe est normalisé pour choisir les gagnants

Pipelines RLHF open source (par exemple, dans les bibliothèques TRL et verl) utilisant GRPO pour aligner les modèles de discussion sans payer pour un réseau de valeur distinct

Améliorer le respect des instructions ou le comportement de sécurité en échantillonnant plusieurs réponses par invite et en récompensant celles qu'un modèle de récompense obtient les notes les plus élevées par rapport à leurs pairs

Risques et garde-fous

L’optimisation d’un benchmark peut masquer des faiblesses plus larges du système.

Les coûts d’infrastructure et de maintenance sont souvent sous-estimés.

Les lacunes en matière de sécurité et d’observabilité peuvent se creuser à mesure que les systèmes deviennent plus complexes.

Feuille de route de mise en œuvre

1

Définissez les objectifs de latence, de qualité et de coût avant la mise en œuvre.

2

Benchmark dans des conditions de charge et de données réalistes.

3

Surveillance des instruments pour détecter les erreurs, la dérive et l'impact sur l'utilisateur.

4

Préparez les chemins de restauration et de réponse aux incidents avant la mise à l’échelle.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Group Relative Policy Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Optimisation des politiques proximales

Questions fréquemment posées

What is Group Relative Policy Optimization?

L'optimisation de la politique relative de groupe (GRPO) est une méthode d'apprentissage par renforcement permettant d'affiner les modèles de langage qui juge chaque réponse par rapport à un groupe de réponses frères et sœurs à la même invite, éliminant ainsi le réseau de valeurs distinct utilisé par PPO. Il est devenu célèbre comme étant l'astuce de formation principale derrière les modèles de raisonnement de DeepSeek.

Quel composant majeur du PPO le GRPO élimine-t-il ?

Le changement de signature du GRPO supprime le modèle valeur/critique appris du PPO, qui a normalement à peu près la même taille que la politique, économisant ainsi une mémoire et un calcul substantiels.

Comment GRPO calcule-t-il l’avantage pour un achèvement donné ?

L'avantage de chaque achèvement est (récompense - moyenne du groupe) / écart type du groupe, de sorte que le groupe de réponses à la même invite sert de référence.

Quels modèles ont fait connaître GRPO ?

GRPO a été introduit et popularisé par DeepSeek, notamment dans DeepSeekMath et en tant que moteur RL derrière les modèles de raisonnement DeepSeek-R1.

Quel rôle le terme de divergence KL joue-t-il dans GRPO ?

Une pénalité KL par rapport à un modèle de référence (généralement le modèle pré-RL) régularise la formation afin que la politique s'améliore sans s'effondrer ou dériver vers des résultats dégénérés.

Pourquoi GRPO est-il particulièrement intéressant pour former des modèles de raisonnement sur les mathématiques ou le code ?

L'échantillonnage de nombreuses solutions et leur notation avec des contrôles automatiques d'exactitude s'associent parfaitement aux avantages normalisés de groupe de GRPO, aucun critique n'est nécessaire.