Техническо РЪКОВОДСТВО

Оптимизация на груповата относителна политика

Оптимизацията на груповата относителна политика (GRPO) е метод за обучение за подсилване за фина настройка на езикови модели, който преценява всеки отговор спрямо група братски отговори на една и съща подкана, елиминирайки отделната мрежа от стойности, използвана от PPO.

2 min readПоследна актуализация

Преглед

It became famous as the core training trick behind DeepSeek's reasoning models.

Дълбоко гмуркане

GRPO е вариант на обучение за подсилване на градиент на политики, предназначен да направи фината настройка на RL на големи езикови модели по-евтина и по-стабилна. Стандартният PPO се нуждае от научен „критик“ (стойностен модел), приблизително толкова голям, колкото самата политика, за да оцени колко добър е всеки токен. GRPO премахва този критик изцяло. За всяка подкана той взема проби от група завършвания (да речем 8-64), оценява ги всички със сигнал за награда и след това изчислява предимството на всяко завършване чрез стандартизиране на наградата спрямо средната стойност и стандартното отклонение на групата. Отговорите над средното се засилват, а тези под средното се потискат. Терминът на KL-дивергенция поддържа модела близо до референтна политика. Въведен от DeepSeek, той захранва DeepSeekMath и моделите за разсъждение DeepSeek-R1.

Техническа информация

Ключовата идея е да се замени базовата линия на научената стойност на PPO с базовата линия на групата Монте Карло. За група изходи с награди r_i, всяко предимство е A_i = (r_i - средно(r)) / std(r). Този нормализиран резултат умножава съотношението на ограничената вероятност, точно както в PPO, и KL наказание срещу замразен референтен модел ограничава отклонението. Тъй като нито един критик не е обучен, паметта и изчисленията намаляват приблизително наполовина, а нормализацията на подкана дава естествено мащабирани предимства с ниска вариация.

Стратегическо въздействие

Cost and budget

Архитектурните решения стимулират производителността и оперативните разходи в продължение на години.

Clearer decisions

Техническото образование помага на екипите да изберат правилния стек, а не само най-новия.

Quality control

По-добрият инженерен избор намалява инцидентите, свързани с надеждността в производството.

Бъдещето на оптимизацията на груповата относителна политика

GRPO бързо се превърна в рецепта по подразбиране за обучение на отворени модели на разсъждение и лабораториите повтарят слабите му места. Изследователите проучват корекции за отклонения в дължината и трудността (като Dr. GRPO), нормализиране на ниво токен, а не на ниво последователност, и премахване или преоформяне на термина KL. Очаквайте по-тясна интеграция с проверими награди (математика, код, използване на инструменти), по-добро управление на оскъдни сигнали и хибриди, които съчетават групови базови линии с леки критици за агентни, многоетапни задачи.

Внедряване в реалния свят

Обучение на DeepSeek-R1 и DeepSeekMath за създаване на дълга верига от разсъждения чрез използване на базирани на правила награди за коректност при математически проблеми

Модели за фина настройка на генериране на код, при които всяко извадено решение се оценява според това дали преминава тестове на единица и групата се нормализира, за да избере победителите

RLHF тръбопроводи с отворен код (напр. в TRL и verl библиотеки), използващи GRPO за подравняване на чат модели, без да плащате за отделна стойностна мрежа

Подобряване на поведението при следване на инструкциите или безопасността чрез вземане на проби от няколко отговора на подкана и награждаване на тези, които моделът за възнаграждение оценява най-високо спрямо техните връстници

Рискове и предпазни огради

Оптимизирането на един бенчмарк може да скрие по-широки системни слабости.

Разходите за инфраструктура и поддръжка често се подценяват.

Пропуските в сигурността и видимостта могат да нарастват, когато системите стават по-сложни.

Пътна карта за изпълнение

1

Определете целите за латентност, качество и разходи преди внедряването.

2

Бенчмарк при реалистични условия на натоварване и данни.

3

Мониторинг на инструмента за грешки, отклонение и въздействие върху потребителя.

4

Подгответе пътеките за връщане назад и реакция на инцидент преди мащабиране.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Group Relative Policy Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Оптимизация на проксималната политика

Frequently asked questions

What is Group Relative Policy Optimization?

Оптимизацията на груповата относителна политика (GRPO) е метод за обучение за подсилване за фина настройка на езикови модели, който преценява всеки отговор спрямо група братски отговори на една и съща подкана, елиминирайки отделната мрежа от стойности, използвана от PPO. Той стана известен като основния трик за обучение зад моделите на разсъждение на DeepSeek.

Какъв основен компонент на PPO елиминира GRPO?

Промяната на подписа на GRPO премахва модела на научена стойност/критичен модел на PPO, който обикновено е приблизително със същия размер като политиката, спестявайки значителна памет и изчисления.

Как GRPO изчислява предимството за дадено завършване?

Предимството на всяко завършване е (награда - средна стойност на групата) / групово стандартно отклонение, така че групата от отговори на една и съща подкана действа като базова линия.

Кои модели направиха GRPO известен?

GRPO беше въведен и популяризиран от DeepSeek, особено в DeepSeekMath и като RL двигател зад моделите за разсъждение DeepSeek-R1.

Каква роля играе терминът на KL-дивергенция в GRPO?

KL наказание срещу референтен (обикновено преди RL) модел регулира обучението, така че политиката се подобрява, без да се срива или да се отклонява към изродени резултати.

Защо GRPO е особено привлекателен за обучение на модели за разсъждение по математика или код?

Вземането на проби от много решения и оценяването им с автоматични проверки за коректност се съчетава чисто с групово нормализираните предимства на GRPO, без нужда от критика.