Optymalizacja polityki względnej grupy
Group Relative Policy Optimization (GRPO) to metoda uczenia się przez wzmacnianie, służąca dostrajaniu modeli językowych, która ocenia każdą odpowiedź na podstawie grupy odpowiedzi rodzeństwa na to samo pytanie, eliminując odrębną sieć wartości wykorzystywaną przez PPO.
Przegląd
It became famous as the core training trick behind DeepSeek's reasoning models.
Głębokie nurkowanie
GRPO to wariant uczenia się przez wzmacnianie z gradientem polityki, zaprojektowany tak, aby dostrajanie RL dużych modeli językowych było tańsze i stabilniejsze. Standardowy PPO potrzebuje wyuczonego „krytyka” (modelu wartości), mniej więcej tak dużego jak sama polityka, aby oszacować, jak dobry jest każdy token. GRPO całkowicie usuwa tę krytykę. Dla każdego podpowiedzi pobiera próbkę grupy ukończeń (powiedzmy 8–64), ocenia je wszystkie za pomocą sygnału nagrody, a następnie oblicza przewagę każdego ukończenia, standaryzując jego nagrodę w stosunku do średniej i odchylenia standardowego grupy. Odpowiedzi powyżej średniej są wzmacniane, a odpowiedzi poniżej średniej tłumione. Termin rozbieżności KL utrzymuje model blisko polityki odniesienia. Wprowadzony przez DeepSeek, obsługiwał modele wnioskowania DeepSeekMath i DeepSeek-R1.
Wgląd techniczny
Kluczową ideą jest zastąpienie wartości bazowej wyuczonej PPO wartością bazową grupy Monte Carlo. Dla grupy wyników z nagrodami r_i, każda zaleta wynosi A_i = (r_i - średnia(r)) / std(r). Ten znormalizowany wynik mnoży obcięty współczynnik prawdopodobieństwa, dokładnie tak jak w PPO, a kara KL za zamrożony model referencyjny ogranicza dryf. Ponieważ żaden krytyk nie jest przeszkolony, pamięć i obliczenia zmniejszają się mniej więcej o połowę, a normalizacja na bieżąco daje naturalnie skalowane korzyści o niskiej wariancji.
Wpływ strategiczny
Koszt i budżet
Decyzje dotyczące architektury wpływają na wydajność i koszty operacyjne przez lata.
Jaśniejsze decyzje
Edukacja techniczna pomaga zespołom wybrać odpowiedni stos, a nie tylko najnowszy.
Kontrola jakości
Lepsze wybory inżynieryjne zmniejszają liczbę incydentów związanych z niezawodnością w produkcji.
Przyszłość optymalizacji polityki względnej grupy
GRPO szybko stało się domyślną receptą na szkolenie modeli otwartego rozumowania, a laboratoria pracują nad iteracją w oparciu o jej słabe punkty. Badacze badają poprawki błędów związanych z długością i trudnością (takie jak Dr. GRPO), normalizację na poziomie tokena, a nie na poziomie sekwencji, oraz usuwanie lub przekształcanie terminu KL. Oczekuj ściślejszej integracji z weryfikowalnymi nagrodami (matematyka, kod, użycie narzędzi), lepszej obsługi rzadkich sygnałów i rozwiązań hybrydowych, które łączą grupowe wartości bazowe z lekką krytyką w przypadku agentycznych, wieloetapowych zadań.
Implementacja w świecie rzeczywistym
Szkolenie DeepSeek-R1 i DeepSeekMath w zakresie tworzenia długich łańcuchów myślowych przy użyciu opartych na regułach nagród za poprawność problemów matematycznych
Dostrajanie modeli generowania kodu, w których każde próbowane rozwiązanie jest oceniane pod kątem tego, czy przeszło testy jednostkowe, a grupa jest normalizowana w celu wybrania zwycięzców
Potoki RLHF typu open source (np. w bibliotekach TRL i Verl) wykorzystujące GRPO do wyrównywania modeli czatów bez płacenia za oddzielną sieć wartości
Poprawa przestrzegania instrukcji lub zachowań związanych z bezpieczeństwem poprzez próbkowanie kilku odpowiedzi na monit i nagradzanie tych, które model nagradzania ocenia najwyżej w porównaniu z innymi
Zagrożenia i poręcze
Optymalizacja jednego testu porównawczego może ukryć szersze słabości systemu.
Koszty infrastruktury i utrzymania są często niedoszacowane.
W miarę jak systemy stają się coraz bardziej złożone, luki w bezpieczeństwie i obserwowalności mogą się zwiększać.
Plan wdrożenia
Przed wdrożeniem zdefiniuj docelowe opóźnienia, jakość i koszty.
Test porównawczy w realistycznych warunkach obciążenia i danych.
Monitorowanie przyrządu pod kątem błędów, dryftu i wpływu użytkownika.
Przed skalowaniem przygotuj ścieżki wycofywania zmian i reakcji na incydenty.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Group Relative Policy Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Bliższa optymalizacja polityki
Często zadawane pytania
What is Group Relative Policy Optimization?
Group Relative Policy Optimization (GRPO) to metoda uczenia się przez wzmacnianie, służąca dostrajaniu modeli językowych, która ocenia każdą odpowiedź na podstawie grupy odpowiedzi rodzeństwa na to samo pytanie, eliminując odrębną sieć wartości wykorzystywaną przez PPO. Zasłynęło jako podstawowa sztuczka szkoleniowa stojąca za modelami rozumowania DeepSeek.
Jaki główny składnik PPO eliminuje GRPO?
Zmiana sygnatury GRPO powoduje porzucenie wyuczonego modelu wartości/krytycznego PPO, który zwykle ma mniej więcej ten sam rozmiar co polityka, co pozwala zaoszczędzić znaczną ilość pamięci i obliczeń.
W jaki sposób GRPO oblicza przewagę za dane ukończenie?
Zaletą każdego ukończenia jest (nagroda – średnia grupowa) / odchylenie standardowe grupy, więc grupa odpowiedzi na ten sam monit pełni rolę linii bazowej.
Które modele sprawiły, że GRPO stało się znane?
GRPO zostało wprowadzone i spopularyzowane przez DeepSeek, zwłaszcza w DeepSeekMath i jako silnik RL stojący za modelami rozumowania DeepSeek-R1.
Jaką rolę odgrywa termin rozbieżności KL w GRPO?
Kara KL za model referencyjny (zwykle sprzed RL) reguluje szkolenie, dzięki czemu polityka ulega poprawie bez załamania się lub dryfowania w stronę zdegenerowanych wyników.
Dlaczego GRPO jest szczególnie atrakcyjne do uczenia modeli rozumowania na matematyce lub kodzie?
Próbkowanie wielu rozwiązań i ocenianie ich za pomocą automatycznych kontroli poprawności doskonale łączy się z zaletami GRPO znormalizowanymi dla grup i nie wymaga krytyki.