Optimalizace relativních zásad skupiny
Group Relative Policy Optimization (GRPO) je metoda posílení a učení pro dolaďování jazykových modelů, která posuzuje každou odpověď proti skupině sourozeneckých odpovědí na stejnou výzvu, čímž eliminuje samostatnou hodnotovou síť používanou PPO.
Přehled
It became famous as the core training trick behind DeepSeek's reasoning models.
Hluboký ponor
GRPO je varianta učení s gradientem politiky navržená tak, aby dolaďování RL velkých jazykových modelů bylo levnější a stabilnější. Standardní PPO potřebuje naučený „kritický“ (hodnotový model), zhruba tak velký jako samotná politika, aby mohl odhadnout, jak dobrý je každý token. GRPO tohoto kritika zcela odstraňuje. Pro každou výzvu navzorkuje skupinu dokončení (řekněme 8–64), všechna je ohodnotí signálem odměny a poté vypočítá výhodu každého dokončení tak, že jeho odměnu standardizuje podle průměru a směrodatné odchylky skupiny. Nadprůměrné odpovědi jsou posíleny a podprůměrné potlačeny. Pojem KL-divergence udržuje model blízko referenční politice. Představený DeepSeek, poháněl modely DeepSeekMath a DeepSeek-R1.
Technický přehled
Klíčovou myšlenkou je nahrazení naučených hodnotových základů PPO skupinovými základními hodnotami Monte Carlo. Pro skupinu výstupů s odměnami r_i je každá výhoda A_i = (r_i - průměr(r)) / std(r). Toto normalizované skóre násobí oříznutý poměr pravděpodobnosti, přesně jako v PPO, a penalizaci KL proti zmrazenému referenčnímu modelu omezuje posun. Protože žádný kritik není trénován, paměť a výpočet se sníží zhruba na polovinu a normalizace na výzvu poskytuje přirozeně škálované výhody s nízkou variabilitou.
Strategický dopad
Cena a rozpočet
Rozhodnutí o architektuře zvyšují výkon a provozní náklady po mnoho let.
Jasnější rozhodnutí
Technické vzdělání pomáhá týmům vybrat ten správný stack, nejen ten nejnovější.
Kontrola kvality
Lepší konstrukční volby snižují výskyt problémů se spolehlivostí ve výrobě.
Budoucnost optimalizace relativních zásad skupiny
GRPO se rychle stalo výchozím receptem na trénování modelů otevřeného uvažování a laboratoře opakují jeho slabá místa. Výzkumníci zkoumají opravy zkreslení délky a obtížnosti (jako je Dr. GRPO), normalizace na úrovni tokenu spíše než na úrovni sekvence a odstranění nebo přetvoření termínu KL. Očekávejte těsnější integraci s ověřitelnými odměnami (matematika, kód, použití nástrojů), lepší zacházení s řídkými signály a hybridy, které kombinují skupinové základní linie s lehkými kritiky pro agentní, vícekrokové úkoly.
Real-World Implementace
Školení DeepSeek-R1 a DeepSeekMath pro vytváření dlouhého řetězce myšlenek pomocí odměn za správnost na základě pravidel u matematických problémů
Jemné ladění modelů generování kódu, kde je každé vzorkované řešení hodnoceno podle toho, zda prošlo jednotkovými testy, a skupina je normalizována, aby vybrala vítěze
Open-source kanály RLHF (např. v knihovnách TRL a verl) využívající GRPO k zarovnání modelů chatu bez placení za samostatnou síť hodnot
Zlepšení chování při dodržování pokynů nebo bezpečnostního chování vzorkováním několika odpovědí na výzvu a odměňováním těch, které model odměny ohodnotí nejvíce ve srovnání s jejich vrstevníky
Rizika a zábradlí
Optimalizace jednoho benchmarku může skrýt širší systémové slabiny.
Náklady na infrastrukturu a údržbu jsou často podceňovány.
Mezery v zabezpečení a pozorovatelnosti se mohou zvětšovat, jak se systémy stávají složitějšími.
Plán implementace
Před implementací definujte cíle latence, kvality a nákladů.
Benchmark za realistických podmínek zatížení a dat.
Monitorování chyb, posunu a dopadu na uživatele.
Před škálováním připravte cesty vrácení zpět a reakce na incidenty.
Pokračujte v objevování
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Group Relative Policy Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Další průvodce
Proximální optimalizace politiky
Často kladené otázky
What is Group Relative Policy Optimization?
Group Relative Policy Optimization (GRPO) je metoda posílení a učení pro dolaďování jazykových modelů, která posuzuje každou odpověď proti skupině sourozeneckých odpovědí na stejnou výzvu, čímž eliminuje samostatnou hodnotovou síť používanou PPO. Proslavil se jako základní tréninkový trik za modely uvažování DeepSeek.
Jakou hlavní složku PPO eliminuje GRPO?
Změna signatury GRPO vypouští model naučených hodnot/kritických hodnot PPO, který je obvykle přibližně stejně velký jako politika, což šetří značnou paměť a výpočetní výkon.
Jak GRPO vypočítá výhodu pro dané dokončení?
Výhodou každého dokončení je (odměna - průměr skupiny) / směrodatná odchylka skupiny, takže skupina odpovědí na stejnou výzvu funguje jako výchozí.
Které modely proslavily GRPO?
GRPO bylo představeno a popularizováno DeepSeek, zejména v DeepSeekMath a jako RL engine za uvažovacími modely DeepSeek-R1.
Jakou roli hraje termín KL-divergence v GRPO?
Pokuta KL proti referenčnímu (obvykle pre-RL) modelu reguluje trénink, takže politika se zlepšuje, aniž by se zhroutila nebo se posunula do degenerovaných výstupů.
Proč je GRPO obzvláště atraktivní pro trénování modelů uvažování v matematice nebo kódu?
Vzorkování mnoha řešení a jejich vyhodnocování pomocí automatických kontrol správnosti se čistě spáruje s výhodami GRPO normalizovanými na skupiny, není třeba žádné kritiky.