Technický PRŮVODCE

Optimalizace relativních zásad skupiny

Group Relative Policy Optimization (GRPO) je metoda posílení a učení pro dolaďování jazykových modelů, která posuzuje každou odpověď proti skupině sourozeneckých odpovědí na stejnou výzvu, čímž eliminuje samostatnou hodnotovou síť používanou PPO.

2 minuty čteníNaposledy aktualizováno

Přehled

It became famous as the core training trick behind DeepSeek's reasoning models.

Hluboký ponor

GRPO je varianta učení s gradientem politiky navržená tak, aby dolaďování RL velkých jazykových modelů bylo levnější a stabilnější. Standardní PPO potřebuje naučený „kritický“ (hodnotový model), zhruba tak velký jako samotná politika, aby mohl odhadnout, jak dobrý je každý token. GRPO tohoto kritika zcela odstraňuje. Pro každou výzvu navzorkuje skupinu dokončení (řekněme 8–64), všechna je ohodnotí signálem odměny a poté vypočítá výhodu každého dokončení tak, že jeho odměnu standardizuje podle průměru a směrodatné odchylky skupiny. Nadprůměrné odpovědi jsou posíleny a podprůměrné potlačeny. Pojem KL-divergence udržuje model blízko referenční politice. Představený DeepSeek, poháněl modely DeepSeekMath a DeepSeek-R1.

Technický přehled

Klíčovou myšlenkou je nahrazení naučených hodnotových základů PPO skupinovými základními hodnotami Monte Carlo. Pro skupinu výstupů s odměnami r_i je každá výhoda A_i = (r_i - průměr(r)) / std(r). Toto normalizované skóre násobí oříznutý poměr pravděpodobnosti, přesně jako v PPO, a penalizaci KL proti zmrazenému referenčnímu modelu omezuje posun. Protože žádný kritik není trénován, paměť a výpočet se sníží zhruba na polovinu a normalizace na výzvu poskytuje přirozeně škálované výhody s nízkou variabilitou.

Strategický dopad

Cena a rozpočet

Rozhodnutí o architektuře zvyšují výkon a provozní náklady po mnoho let.

Jasnější rozhodnutí

Technické vzdělání pomáhá týmům vybrat ten správný stack, nejen ten nejnovější.

Kontrola kvality

Lepší konstrukční volby snižují výskyt problémů se spolehlivostí ve výrobě.

Budoucnost optimalizace relativních zásad skupiny

GRPO se rychle stalo výchozím receptem na trénování modelů otevřeného uvažování a laboratoře opakují jeho slabá místa. Výzkumníci zkoumají opravy zkreslení délky a obtížnosti (jako je Dr. GRPO), normalizace na úrovni tokenu spíše než na úrovni sekvence a odstranění nebo přetvoření termínu KL. Očekávejte těsnější integraci s ověřitelnými odměnami (matematika, kód, použití nástrojů), lepší zacházení s řídkými signály a hybridy, které kombinují skupinové základní linie s lehkými kritiky pro agentní, vícekrokové úkoly.

Real-World Implementace

Školení DeepSeek-R1 a DeepSeekMath pro vytváření dlouhého řetězce myšlenek pomocí odměn za správnost na základě pravidel u matematických problémů

Jemné ladění modelů generování kódu, kde je každé vzorkované řešení hodnoceno podle toho, zda prošlo jednotkovými testy, a skupina je normalizována, aby vybrala vítěze

Open-source kanály RLHF (např. v knihovnách TRL a verl) využívající GRPO k zarovnání modelů chatu bez placení za samostatnou síť hodnot

Zlepšení chování při dodržování pokynů nebo bezpečnostního chování vzorkováním několika odpovědí na výzvu a odměňováním těch, které model odměny ohodnotí nejvíce ve srovnání s jejich vrstevníky

Rizika a zábradlí

Optimalizace jednoho benchmarku může skrýt širší systémové slabiny.

Náklady na infrastrukturu a údržbu jsou často podceňovány.

Mezery v zabezpečení a pozorovatelnosti se mohou zvětšovat, jak se systémy stávají složitějšími.

Plán implementace

1

Před implementací definujte cíle latence, kvality a nákladů.

2

Benchmark za realistických podmínek zatížení a dat.

3

Monitorování chyb, posunu a dopadu na uživatele.

4

Před škálováním připravte cesty vrácení zpět a reakce na incidenty.

Pokračujte v objevování

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Group Relative Policy Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Spustit kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Další průvodce

Proximální optimalizace politiky

Často kladené otázky

What is Group Relative Policy Optimization?

Group Relative Policy Optimization (GRPO) je metoda posílení a učení pro dolaďování jazykových modelů, která posuzuje každou odpověď proti skupině sourozeneckých odpovědí na stejnou výzvu, čímž eliminuje samostatnou hodnotovou síť používanou PPO. Proslavil se jako základní tréninkový trik za modely uvažování DeepSeek.

Jakou hlavní složku PPO eliminuje GRPO?

Změna signatury GRPO vypouští model naučených hodnot/kritických hodnot PPO, který je obvykle přibližně stejně velký jako politika, což šetří značnou paměť a výpočetní výkon.

Jak GRPO vypočítá výhodu pro dané dokončení?

Výhodou každého dokončení je (odměna - průměr skupiny) / směrodatná odchylka skupiny, takže skupina odpovědí na stejnou výzvu funguje jako výchozí.

Které modely proslavily GRPO?

GRPO bylo představeno a popularizováno DeepSeek, zejména v DeepSeekMath a jako RL engine za uvažovacími modely DeepSeek-R1.

Jakou roli hraje termín KL-divergence v GRPO?

Pokuta KL proti referenčnímu (obvykle pre-RL) modelu reguluje trénink, takže politika se zlepšuje, aniž by se zhroutila nebo se posunula do degenerovaných výstupů.

Proč je GRPO obzvláště atraktivní pro trénování modelů uvažování v matematice nebo kódu?

Vzorkování mnoha řešení a jejich vyhodnocování pomocí automatických kontrol správnosti se čistě spáruje s výhodami GRPO normalizovanými na skupiny, není třeba žádné kritiky.