Normalisation des récompenses groupées dans RLHF
La normalisation des récompenses groupées standardise les récompenses d'un modèle au sein d'un lot de réponses à la même invite, transformant ainsi les scores bruyants en un signal d'entraînement stable.
Aperçu
It is the core trick behind GRPO, the algorithm that powers many modern reasoning models.
Plongée profonde
Dans l'apprentissage par renforcement à partir de la rétroaction humaine (RLHF), un modèle génère des réponses et un modèle de récompense les note, mais les récompenses brutes sont bruyantes et varient énormément selon les invites. La normalisation des récompenses groupées corrige ce problème en échantillonnant un groupe de plusieurs réponses à la même invite, puis en normalisant chaque récompense en soustrayant la moyenne du groupe et en divisant par l'écart type du groupe. Ce z-score devient l’avantage. Cette approche est au cœur de l'optimisation des politiques relatives de groupe (GRPO), introduite par DeepSeek, qui a alimenté le raisonnement de DeepSeek-R1. Fondamentalement, GRPO élimine le réseau de valeurs distinct (critique) utilisé par PPO, puisque la moyenne du groupe sert de référence. Cela rend la formation plus simple, moins chère et plus efficace en mémoire tout en gardant le signal de gradient à une bonne échelle.
Aperçu technique
Pour un groupe de sorties avec des récompenses r_1...r_G, l'avantage est A_i = (r_i − moyenne(r)) / std(r). Les réponses meilleures que la moyenne de leur groupe obtiennent un avantage positif et sont renforcées ; ceux qui sont pires que la moyenne sont poussés vers le bas. Parce que la comparaison est relative au sein d’une échelle de récompense absolue et rapide, la difficulté par invite s’annule, réduisant ainsi la variance. GRPO conserve l'objectif tronqué de PPO et la pénalité KL par rapport à une politique de référence pour empêcher le modèle de dériver trop loin.
Impact stratégique
Décisions plus claires
Il vous aide à séparer les affirmations techniques claires du langage marketing.
Coût et budget
Vous pouvez poser de meilleures questions de mise en œuvre avant de dépenser de l'argent ou du temps.
Équipe et flux de travail
Les équipes partageant une compréhension commune prennent de meilleures décisions en matière de produits, de politiques et d’apprentissage.
L'avenir de la normalisation des récompenses groupées dans le RLHF
La normalisation groupée alimente le boom des modèles de raisonnement, où les modèles apprennent de récompenses vérifiables comme des réponses mathématiques correctes sans un critique érudit. La recherche l'affine : débats sur l'opportunité de diviser par écart type, gestion des groupes tout à fait corrects ou tout à fait faux qui ne produisent aucun avantage, et mise à l'échelle de la taille des groupes. Attendez-vous à ce que des méthodes groupées et sans critique se propagent à l’utilisation d’outils agents et à la génération de code, où les vérificateurs automatiques fournissent des signaux de récompense abondants et bon marché.
Mise en œuvre dans le monde réel
Entraîner un modèle de raisonnement mathématique en échantillonnant 16 solutions par problème et en récompensant celles dont l'exactitude est supérieure à la moyenne du groupe.
Ajustez l'utilité d'un chatbot en normalisant les scores du modèle de récompense sur plusieurs réponses de candidats à chaque invite utilisateur.
Amélioration d'un assistant de codage où chaque solution échantillonnée est notée selon qu'elle réussit les tests unitaires, puis normalisée au sein du groupe.
Réduire la mémoire GPU dans un pipeline RLHF en supprimant le réseau critique PPO et en utilisant à la place la moyenne du groupe comme référence.
Risques et garde-fous
Différentes équipes peuvent utiliser le même terme différemment, alors définissez la portée dès le début.
Les benchmarks peuvent paraître solides alors que les performances réelles sont inégales.
Ignorer la qualité des données et les plans d’évaluation crée souvent des résultats fragiles.
Feuille de route de mise en œuvre
Commencez par une définition en langage simple du résultat dont vous avez besoin.
Choisissez une mesure de réussite et une condition d’échec avant de tester.
Exécutez un petit pilote avec des données représentatives, pas un ensemble de démonstration raffiné.
Documentez où la normalisation des récompenses groupées dans RLHF est utile et où les méthodes plus simples sont meilleures.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Grouped Reward Normalization in RLHF quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
Normalisation de la longueur dans l'optimisation des préférences
Questions fréquemment posées
What is Grouped Reward Normalization in RLHF?
La normalisation des récompenses groupées standardise les récompenses d'un modèle au sein d'un lot de réponses à la même invite, transformant ainsi les scores bruyants en un signal d'entraînement stable. C’est l’astuce principale de GRPO, l’algorithme qui alimente de nombreux modèles de raisonnement modernes.
Dans la normalisation des récompenses groupées, à quoi est comparée la récompense de chaque réponse ?
Chaque récompense est convertie en un score z en utilisant la moyenne et l'écart type du groupe de réponses à la même invite.
Quel algorithme est le plus associé à la normalisation des récompenses groupées ?
GRPO, introduit par DeepSeek et utilisé dans DeepSeek-R1, est construit autour de la normalisation des récompenses au sein d'un groupe.
Quelle composante du PPO standard le GRPO élimine-t-il notamment ?
En utilisant la moyenne du groupe comme référence, GRPO abandonne le critique érudit, économisant ainsi la mémoire et le calcul.
Qu'arrive-t-il à une réponse dont la récompense est inférieure à la moyenne de son groupe ?
En soustrayant la moyenne du groupe, les réponses inférieures à la moyenne présentent un avantage négatif, ce qui éloigne la politique.
Pourquoi la normalisation au sein d'un groupe réduit-elle la variance de l'entraînement ?
Étant donné que les comparaisons sont relatives au sein de chaque invite, les différences d’échelle absolue et de difficulté d’invite disparaissent.