PRZEWODNIK techniczny

Optymalizacja polityki względnej grupy

Group Relative Policy Optimization (GRPO) to metoda uczenia się przez wzmacnianie, służąca dostrajaniu modeli językowych, która ocenia każdą odpowiedź na podstawie grupy odpowiedzi rodzeństwa na to samo pytanie, eliminując odrębną sieć wartości wykorzystywaną przez PPO.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It became famous as the core training trick behind DeepSeek's reasoning models.

Głębokie nurkowanie

GRPO to wariant uczenia się przez wzmacnianie z gradientem polityki, zaprojektowany tak, aby dostrajanie RL dużych modeli językowych było tańsze i stabilniejsze. Standardowy PPO potrzebuje wyuczonego „krytyka” (modelu wartości), mniej więcej tak dużego jak sama polityka, aby oszacować, jak dobry jest każdy token. GRPO całkowicie usuwa tę krytykę. Dla każdego podpowiedzi pobiera próbkę grupy ukończeń (powiedzmy 8–64), ocenia je wszystkie za pomocą sygnału nagrody, a następnie oblicza przewagę każdego ukończenia, standaryzując jego nagrodę w stosunku do średniej i odchylenia standardowego grupy. Odpowiedzi powyżej średniej są wzmacniane, a odpowiedzi poniżej średniej tłumione. Termin rozbieżności KL utrzymuje model blisko polityki odniesienia. Wprowadzony przez DeepSeek, obsługiwał modele wnioskowania DeepSeekMath i DeepSeek-R1.

Wgląd techniczny

Kluczową ideą jest zastąpienie wartości bazowej wyuczonej PPO wartością bazową grupy Monte Carlo. Dla grupy wyników z nagrodami r_i, każda zaleta wynosi A_i = (r_i - średnia(r)) / std(r). Ten znormalizowany wynik mnoży obcięty współczynnik prawdopodobieństwa, dokładnie tak jak w PPO, a kara KL za zamrożony model referencyjny ogranicza dryf. Ponieważ żaden krytyk nie jest przeszkolony, pamięć i obliczenia zmniejszają się mniej więcej o połowę, a normalizacja na bieżąco daje naturalnie skalowane korzyści o niskiej wariancji.

Wpływ strategiczny

Koszt i budżet

Decyzje dotyczące architektury wpływają na wydajność i koszty operacyjne przez lata.

Jaśniejsze decyzje

Edukacja techniczna pomaga zespołom wybrać odpowiedni stos, a nie tylko najnowszy.

Kontrola jakości

Lepsze wybory inżynieryjne zmniejszają liczbę incydentów związanych z niezawodnością w produkcji.

Przyszłość optymalizacji polityki względnej grupy

GRPO szybko stało się domyślną receptą na szkolenie modeli otwartego rozumowania, a laboratoria pracują nad iteracją w oparciu o jej słabe punkty. Badacze badają poprawki błędów związanych z długością i trudnością (takie jak Dr. GRPO), normalizację na poziomie tokena, a nie na poziomie sekwencji, oraz usuwanie lub przekształcanie terminu KL. Oczekuj ściślejszej integracji z weryfikowalnymi nagrodami (matematyka, kod, użycie narzędzi), lepszej obsługi rzadkich sygnałów i rozwiązań hybrydowych, które łączą grupowe wartości bazowe z lekką krytyką w przypadku agentycznych, wieloetapowych zadań.

Implementacja w świecie rzeczywistym

Szkolenie DeepSeek-R1 i DeepSeekMath w zakresie tworzenia długich łańcuchów myślowych przy użyciu opartych na regułach nagród za poprawność problemów matematycznych

Dostrajanie modeli generowania kodu, w których każde próbowane rozwiązanie jest oceniane pod kątem tego, czy przeszło testy jednostkowe, a grupa jest normalizowana w celu wybrania zwycięzców

Potoki RLHF typu open source (np. w bibliotekach TRL i Verl) wykorzystujące GRPO do wyrównywania modeli czatów bez płacenia za oddzielną sieć wartości

Poprawa przestrzegania instrukcji lub zachowań związanych z bezpieczeństwem poprzez próbkowanie kilku odpowiedzi na monit i nagradzanie tych, które model nagradzania ocenia najwyżej w porównaniu z innymi

Zagrożenia i poręcze

Optymalizacja jednego testu porównawczego może ukryć szersze słabości systemu.

Koszty infrastruktury i utrzymania są często niedoszacowane.

W miarę jak systemy stają się coraz bardziej złożone, luki w bezpieczeństwie i obserwowalności mogą się zwiększać.

Plan wdrożenia

1

Przed wdrożeniem zdefiniuj docelowe opóźnienia, jakość i koszty.

2

Test porównawczy w realistycznych warunkach obciążenia i danych.

3

Monitorowanie przyrządu pod kątem błędów, dryftu i wpływu użytkownika.

4

Przed skalowaniem przygotuj ścieżki wycofywania zmian i reakcji na incydenty.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Group Relative Policy Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Bliższa optymalizacja polityki

Często zadawane pytania

What is Group Relative Policy Optimization?

Group Relative Policy Optimization (GRPO) to metoda uczenia się przez wzmacnianie, służąca dostrajaniu modeli językowych, która ocenia każdą odpowiedź na podstawie grupy odpowiedzi rodzeństwa na to samo pytanie, eliminując odrębną sieć wartości wykorzystywaną przez PPO. Zasłynęło jako podstawowa sztuczka szkoleniowa stojąca za modelami rozumowania DeepSeek.

Jaki główny składnik PPO eliminuje GRPO?

Zmiana sygnatury GRPO powoduje porzucenie wyuczonego modelu wartości/krytycznego PPO, który zwykle ma mniej więcej ten sam rozmiar co polityka, co pozwala zaoszczędzić znaczną ilość pamięci i obliczeń.

W jaki sposób GRPO oblicza przewagę za dane ukończenie?

Zaletą każdego ukończenia jest (nagroda – średnia grupowa) / odchylenie standardowe grupy, więc grupa odpowiedzi na ten sam monit pełni rolę linii bazowej.

Które modele sprawiły, że GRPO stało się znane?

GRPO zostało wprowadzone i spopularyzowane przez DeepSeek, zwłaszcza w DeepSeekMath i jako silnik RL stojący za modelami rozumowania DeepSeek-R1.

Jaką rolę odgrywa termin rozbieżności KL w GRPO?

Kara KL za model referencyjny (zwykle sprzed RL) reguluje szkolenie, dzięki czemu polityka ulega poprawie bez załamania się lub dryfowania w stronę zdegenerowanych wyników.

Dlaczego GRPO jest szczególnie atrakcyjne do uczenia modeli rozumowania na matematyce lub kodzie?

Próbkowanie wielu rozwiązań i ocenianie ich za pomocą automatycznych kontroli poprawności doskonale łączy się z zaletami GRPO znormalizowanymi dla grup i nie wymaga krytyki.