Техническое РУКОВОДСТВО

Оптимизация групповой относительной политики

Оптимизация групповой относительной политики (GRPO) — это метод обучения с подкреплением для точной настройки языковых моделей, который оценивает каждый ответ по группе одноуровневых ответов на один и тот же запрос, устраняя отдельную сеть создания ценности, используемую PPO.

2 минуты чтенияПоследнее обновление

Обзор

Он стал известен как основной тренировочный приём, лежащий в основе моделей рассуждения DeepSeek.

Глубокое погружение

GRPO — это вариант обучения с подкреплением градиента политики, предназначенный для того, чтобы сделать тонкую настройку больших языковых моделей с помощью RL более дешевой и стабильной. Стандартному PPO нужен обученный «критик» (модель стоимости), примерно такого же размера, как и сама политика, чтобы оценить, насколько хорош каждый токен. GRPO полностью устраняет этого критика. Для каждого запроса он выбирает группу завершений (скажем, 8–64), оценивает их все с помощью сигнала вознаграждения, а затем вычисляет преимущество каждого завершения, стандартизируя вознаграждение по отношению к среднему значению группы и стандартному отклонению. Ответы выше среднего подкрепляются, а ответы ниже среднего подавляются. Член KL-дивергенции сохраняет модель близкой к эталонной политике. Представленный DeepSeek, он послужил основой для моделей рассуждений DeepSeekMath и DeepSeek-R1.

Техническая информация

Ключевая идея заключается в замене базового уровня изученной ценности PPO базовым уровнем группы Монте-Карло. Для группы выходов с вознаграждениями r_i каждое преимущество равно A_i = (r_i - среднее(r))/std(r). Эта нормализованная оценка умножает урезанное отношение вероятностей, точно так же, как в PPO, и штраф KL за замороженное смещение ограничений эталонной модели. Поскольку ни один критик не обучен, память и вычислительные ресурсы сокращаются примерно вдвое, а нормализация для каждой подсказки дает естественно масштабируемые преимущества с низкой дисперсией.

Стратегическое воздействие

Стоимость и бюджет

Архитектурные решения влияют на производительность и эксплуатационные расходы на протяжении многих лет.

Более четкие решения

Техническое образование помогает командам выбрать правильный стек, а не только самый новый.

Контроль качества

Лучший инженерный выбор снижает вероятность возникновения проблем с надежностью на производстве.

Будущее оптимизации групповой относительной политики

GRPO быстро стал стандартным рецептом для обучения моделей открытого мышления, и лаборатории работают над его слабыми местами. Исследователи изучают способы исправления ошибок в длине и сложности (например, Dr. GRPO), нормализацию на уровне токенов, а не на уровне последовательностей, а также удаление или изменение термина KL. Ожидайте более тесной интеграции с проверяемыми вознаграждениями (математика, код, использование инструментов), лучшей обработки редких сигналов и гибридов, которые сочетают групповые базовые показатели с облегченными критическими критериями для агентных, многоэтапных задач.

Реальная реализация

Обучение DeepSeek-R1 и DeepSeekMath построению длинных цепочек мыслей с использованием вознаграждений за правильность решения математических задач на основе правил.

Точная настройка моделей генерации кода, в которых каждое выбранное решение оценивается по тому, прошло ли оно модульные тесты, а группа нормализуется для выбора победителей.

Конвейеры RLHF с открытым исходным кодом (например, в библиотеках TRL и verl), использующие GRPO для согласования моделей чата без оплаты отдельной сети создания ценности.

Улучшение выполнения инструкций или безопасного поведения за счет выборки нескольких ответов на подсказку и награждения тех, которые в модели вознаграждения оцениваются наиболее высоко по сравнению с их аналогами.

Риски и ограничения

Оптимизация одного теста может скрыть более широкие недостатки системы.

Затраты на инфраструктуру и техническое обслуживание часто недооцениваются.

Пробелы в безопасности и наблюдаемости могут увеличиваться по мере усложнения систем.

Дорожная карта реализации

1

Определите целевые показатели задержки, качества и стоимости перед внедрением.

2

Тестирование при реалистичной нагрузке и условиях данных.

3

Мониторинг прибора на наличие ошибок, дрейфа и влияния пользователя.

4

Перед масштабированием подготовьте пути отката и реагирования на инциденты.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Group Relative Policy Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Оптимизация проксимальной политики

Часто задаваемые вопросы

Что такое групповая относительная оптимизация политики?

Оптимизация групповой относительной политики (GRPO) — это метод обучения с подкреплением для точной настройки языковых моделей, который оценивает каждый ответ по группе одноуровневых ответов на один и тот же запрос, устраняя отдельную сеть создания ценности, используемую PPO. Он стал известен как основной метод обучения, лежащий в основе моделей рассуждения DeepSeek.

Какой основной компонент PPO исключает GRPO?

Изменение сигнатуры GRPO заключается в отказе от модели изученной ценности/критики PPO, которая обычно имеет примерно тот же размер, что и политика, что позволяет сэкономить значительную память и вычислительные ресурсы.

Как GRPO рассчитывает преимущество для данного завершения?

Преимущество каждого завершения равно (награда — среднее значение группы) / стандартное отклонение группы, поэтому группа ответов на один и тот же запрос действует как базовый уровень.

Какие модели прославили GRPO?

GRPO был представлен и популяризирован компанией DeepSeek, особенно в DeepSeekMath и в качестве механизма RL, лежащего в основе моделей рассуждения DeepSeek-R1.

Какую роль играет термин KL-дивергенция в GRPO?

Штраф KL против эталонной модели (обычно до RL) упорядочивает обучение, поэтому политика улучшается, не разрушаясь и не скатываясь к ухудшению результатов.

Почему GRPO особенно привлекателен для обучения моделям рассуждения по математике или программированию?

Выборка множества решений и их оценка с помощью автоматической проверки правильности четко сочетаются с нормализованными по группам преимуществами GRPO, не требуя никакой критики.