GHID de fundamente

Normalizarea recompenselor grupate în RLHF

Normalizarea recompenselor grupate standardizează recompensele unui model într-un lot de răspunsuri la același prompt, transformând scorurile zgomotoase într-un semnal de antrenament stabil.

2 minute de lecturăUltima actualizare

Prezentare generală

It is the core trick behind GRPO, the algorithm that powers many modern reasoning models.

Scufundare în profunzime

În învățarea prin întărire din feedbackul uman (RLHF), un model generează răspunsuri și un model de recompensă le punctează, dar recompensele brute sunt zgomotoase și variază foarte mult în funcție de solicitări. Normalizarea recompensei grupate rezolvă acest lucru prin eșantionarea unui grup de mai multe răspunsuri la același prompt, apoi normalizând fiecare recompensă prin scăderea mediei grupului și împărțirea la abaterea standard a grupului. Acest scor z devine avantaj. Abordarea este esențială pentru Group Relative Policy Optimization (GRPO), introdusă de DeepSeek, care a alimentat raționamentul DeepSeek-R1. În mod esențial, GRPO elimină rețeaua de valori separată (critică) utilizată de PPO, deoarece media grupului servește ca linie de bază. Acest lucru face antrenamentul mai simplu, mai ieftin și mai eficient din punct de vedere al memoriei, păstrând în același timp semnalul de gradient bine scalat.

Perspectivă tehnică

Pentru un grup de ieșiri cu recompense r_1...r_G, avantajul este A_i = (r_i − mean(r)) / std(r). Răspunsurile mai bune decât media grupului lor obțin un avantaj pozitiv și sunt consolidate; cele mai proaste decât media sunt împinse în jos. Deoarece comparația este relativă într-o scară de recompensă promptă, absolută și dificultatea pe solicitare se anulează, reducând variația. GRPO păstrează obiectivul tăiat al PPO și penalizarea KL împotriva unei politici de referință pentru a preveni deplasarea prea departe a modelului.

Impact strategic

Decizii mai clare

Vă ajută să separați afirmațiile tehnice clare de limbajul de marketing.

Cost și buget

Puteți pune întrebări de implementare mai bune înainte de a cheltui bani sau timp.

Echipa și fluxul de lucru

Echipele cu înțelegere comună iau decizii mai bune despre produse, politici și învățare.

Viitorul normalizării recompenselor grupate în RLHF

Normalizarea grupată alimentează boom-ul modelelor de raționament, în care modelele învață din recompense verificabile, cum ar fi răspunsuri corecte la matematică, fără un critic învățat. Cercetările o perfecționează: dezbateri cu privire la împărțirea prin abaterea standard, gestionarea grupurilor complet corecte sau greșite care produc avantaj zero și mărirea dimensiunii grupului. Așteptați-vă ca metodele grupate, fără critici, să se răspândească la utilizarea instrumentelor agentice și la generarea de coduri, unde verificatoarele automate furnizează semnale de recompensă abundente și ieftine.

Implementare în lumea reală

Antrenarea unui model de raționament matematic prin eșantionarea a 16 soluții per problemă și recompensarea celor peste corectitudinea medie a grupului.

Îmbunătățiți utilitatea unui chatbot prin normalizarea scorurilor modelului de recompensă în mai multe răspunsuri ale candidaților la fiecare prompt de utilizator.

Îmbunătățirea unui asistent de codare în care fiecare soluție eșantionată este notată dacă trece testele unitare, apoi normalizată în cadrul grupului.

Reducerea memoriei GPU într-o conductă RLHF prin renunțarea la rețeaua critică PPO și folosind în schimb media grupului ca linie de bază.

Riscuri și balustrade

Echipe diferite pot folosi același termen în mod diferit, așa că definiți domeniul de aplicare din timp.

Benchmark-urile pot părea puternice, în timp ce performanța în lumea reală este neuniformă.

Ignorarea calității datelor și a planurilor de evaluare generează adesea rezultate fragile.

Foaia de parcurs de implementare

1

Începeți cu o definiție simplă a rezultatului de care aveți nevoie.

2

Alegeți o măsură de succes și o condiție de eșec înainte de testare.

3

Rulați un pilot mic cu date reprezentative, nu un set demonstrativ bine definit.

4

Document în care normalizarea recompenselor grupate în RLHF ajută și unde metodele mai simple sunt mai bune.

Continuați să explorați

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Grouped Reward Normalization in RLHF quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz Start

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Următorul ghid

Normalizarea lungimii în Optimizarea preferințelor

Întrebări frecvente

What is Grouped Reward Normalization in RLHF?

Normalizarea recompenselor grupate standardizează recompensele unui model într-un lot de răspunsuri la același prompt, transformând scorurile zgomotoase într-un semnal de antrenament stabil. Este trucul principal din spatele GRPO, algoritmul care alimentează multe modele de raționament moderne.

În normalizarea recompenselor grupate, cu ce este comparată recompensa fiecărui răspuns?

Fiecare recompensă este convertită într-un scor z folosind media și abaterea standard a grupului de răspunsuri la același prompt.

Care algoritm este cel mai asociat cu normalizarea recompensei grupate?

GRPO, introdus de DeepSeek și folosit în DeepSeek-R1, este construit în jurul normalizării recompenselor în cadrul unui grup.

Ce componentă a PPO standard elimină în mod deosebit GRPO?

Folosind media grupului ca linie de bază, GRPO renunță la criticul învățat, economisind memorie și calcul.

Ce se întâmplă cu un răspuns a cărui recompensă este sub media grupului său?

Scăderea mediei grupului face ca răspunsurile sub medie să aibă un avantaj negativ, împingând politica departe de ele.

De ce normalizarea în cadrul unui grup reduce varianța antrenamentului?

Deoarece comparațiile sunt relative în cadrul fiecărui prompt, diferențele de scară absolută și dificultatea promptului dispar.