PRŮVODCE Základy

Normalizace skupinových odměn v RLHF

Skupinová normalizace odměn standardizuje odměny modelu v rámci dávky odpovědí na stejnou výzvu a přeměňuje hlučné skóre na stabilní tréninkový signál.

2 minuty čteníNaposledy aktualizováno

Přehled

It is the core trick behind GRPO, the algorithm that powers many modern reasoning models.

Hluboký ponor

Při posilování učení z lidské zpětné vazby (RLHF) model generuje odpovědi a model odměn je hodnotí, ale hrubé odměny jsou hlučné a mezi výzvami se velmi liší. Skupinová normalizace odměn to řeší vzorkováním skupiny několika odpovědí na stejnou výzvu, poté normalizací každé odměny odečtením průměru skupiny a dělením standardní odchylkou skupiny. Toto z-skóre se stává výhodou. Tento přístup je ústředním bodem optimalizace relativních zásad skupiny (GRPO), kterou představil DeepSeek a která skvěle posílila úvahy DeepSeek-R1. Rozhodující je, že GRPO eliminuje samostatnou hodnotovou síť (kritickou) používanou PPO, protože jako základ slouží průměr skupiny. Díky tomu je trénink jednodušší, levnější a efektivnější z hlediska paměti při zachování správného měřítka signálu gradientu.

Technický přehled

Pro skupinu výstupů s odměnami r_1...r_G je výhoda A_i = (r_i − mean(r)) / std(r). Odpovědi lepší, než je průměr jejich skupiny, získávají pozitivní výhodu a jsou posíleny; horší než průměrné jsou stlačeny dolů. Vzhledem k tomu, že srovnání je relativní v rámci okamžité, absolutní stupnice odměny a obtížnosti na výzvu se ruší, což snižuje rozptyl. GRPO ponechává oříznutý cíl PPO a penalizaci KL proti referenční politice, aby zabránil přílišnému posunu modelu.

Strategický dopad

Jasnější rozhodnutí

Pomůže vám oddělit jasná technická tvrzení od marketingového jazyka.

Cena a rozpočet

Než utratíte peníze nebo čas, můžete se zeptat na lepší implementační otázky.

Tým a pracovní postup

Týmy se sdíleným porozuměním dělají lepší rozhodnutí o produktech, zásadách a učení.

Budoucnost normalizace skupinových odměn v RLHF

Skupinová normalizace podporuje boom modelů uvažování, kde se modely učí z ověřitelných odměn, jako jsou správné matematické odpovědi, bez učené kritiky. Výzkum to zdokonaluje: debaty o tom, zda dělit směrodatnou odchylkou, zacházení se zcela správnými nebo zcela špatnými skupinami, které generují nulovou výhodu, a škálování velikosti skupiny. Očekávejte seskupené metody bez kritiky, které se rozšíří na použití agentských nástrojů a generování kódu, kde automatické ověřovatele poskytují levné a bohaté signály odměn.

Real-World Implementace

Trénujte model matematického uvažování vzorkováním 16 řešení na problém a odměňováním těch, která přesahují průměrnou správnost skupiny.

Jemné vyladění užitečnosti chatbota normalizací skóre modelu odměn napříč několika odpověďmi kandidátů na každou výzvu uživatele.

Vylepšení asistenta kódování, kde je každé vzorkované řešení hodnoceno podle toho, zda prošlo jednotkovými testy, a poté normalizováno v rámci skupiny.

Snížení paměti GPU v potrubí RLHF zrušením sítě kritiků PPO a místo toho použitím skupiny střední hodnoty jako základní linie.

Rizika a zábradlí

Různé týmy mohou používat stejný termín odlišně, proto definujte rozsah včas.

Srovnávací testy mohou vypadat dobře, zatímco výkon v reálném světě je nerovnoměrný.

Ignorování kvality dat a plánů hodnocení často vytváří křehké výsledky.

Plán implementace

1

Začněte s jasnou definicí výsledku, který potřebujete.

2

Před testováním vyberte jednu metriku úspěchu a jednu podmínku selhání.

3

Spusťte malý pilotní projekt s reprezentativními údaji, nikoli leštěnou ukázkovou sadu.

4

Zdokumentujte, kde normalizace skupinových odměn v RLHF pomáhá a kde jsou jednodušší metody lepší.

Pokračujte v objevování

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Grouped Reward Normalization in RLHF quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Spustit kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Další průvodce

Normalizace délky v Preference Optimization

Často kladené otázky

What is Grouped Reward Normalization in RLHF?

Skupinová normalizace odměn standardizuje odměny modelu v rámci dávky odpovědí na stejnou výzvu a přeměňuje hlučné skóre na stabilní tréninkový signál. Je to základní trik za GRPO, algoritmem, který pohání mnoho moderních modelů uvažování.

Jaká je při normalizaci seskupených odměn odměna jednotlivých odpovědí porovnána?

Každá odměna je převedena na z-skóre pomocí průměru a standardní odchylky skupiny odpovědí na stejnou výzvu.

Který algoritmus je nejvíce spojen s normalizací seskupených odměn?

GRPO, představený DeepSeek a používaný v DeepSeek-R1, je postaven na normalizaci odměn v rámci skupiny.

Jakou složku standardního PPO GRPO výrazně eliminuje?

Použitím skupinového průměru jako základní linie GRPO upustí od naučeného kritika, čímž šetří paměť a výpočet.

Co se stane s odpovědí, jejíž odměna je pod průměrem její skupiny?

Odečtením skupinového průměru má podprůměrné odpovědi negativní výhodu a odtlačuje od nich politiku.

Proč normalizace v rámci skupiny snižuje tréninkové rozptyly?

Vzhledem k tomu, že srovnání jsou v rámci každé výzvy relativní, rozdíly v absolutním měřítku a obtížnosti výzvy se smývají.