Технічний КЕРІВНИЦТВО

Оптимізація групової відносної політики

Оптимізація групової відносної політики (GRPO) — це метод навчання з підкріпленням для точного налаштування мовних моделей, який порівнює кожну відповідь із групою однотипних відповідей на той самий запит, усуваючи окрему мережу значень, яку використовує PPO.

2 хвилини читанняОстаннє оновлення

Огляд

It became famous as the core training trick behind DeepSeek's reasoning models.

Глибоке занурення

GRPO — це варіант навчання з підкріпленням градієнта політики, розроблений для того, щоб зробити тонке налаштування RL великих мовних моделей дешевшим і стабільнішим. Стандартний PPO потребує навченого «критика» (модель вартості), приблизно такого ж масштабу, як і сама політика, щоб оцінити, наскільки хороший кожен маркер. GRPO повністю знімає цю критику. Для кожної підказки він відбирає групу завершень (скажімо, 8-64), оцінює їх усі за допомогою сигналу винагороди, а потім обчислює перевагу кожного завершення, стандартизуючи винагороду щодо середнього значення групи та стандартного відхилення. Відповіді вище середнього посилюються, а нижче середнього пригнічуються. Термін KL-дивергенції утримує модель близько до еталонної політики. Представлений компанією DeepSeek, він використовував моделі міркування DeepSeekMath і DeepSeek-R1.

Технічне розуміння

Ключова ідея полягає в заміні базового рівня вивченого значення PPO на базовий рівень групи Монте-Карло. Для групи результатів із винагородами r_i кожна перевага дорівнює A_i = (r_i - середнє (r)) / стандартне значення (r). Ця нормалізована оцінка множить обрізане відношення ймовірностей, точно як у PPO, а штраф KL проти замороженої еталонної моделі стримує дрейф. Оскільки жоден критик не навчений, пам’ять і обчислення скорочуються приблизно вдвічі, а нормалізація кожного підказки дає переваги природного масштабу з низькою дисперсією.

Стратегічний вплив

Вартість і бюджет

Архітектурні рішення збільшують продуктивність і експлуатаційні витрати протягом багатьох років.

Чіткіші рішення

Технічна освіта допомагає командам вибрати правильний стек, а не лише найновіший.

Контроль якості

Кращий інженерний вибір зменшує проблеми з надійністю у виробництві.

Майбутнє оптимізації групової відносної політики

GRPO швидко став стандартним рецептом для навчання відкритих моделей міркування, і лабораторії повторюють його слабкі місця. Дослідники вивчають виправлення упереджень щодо довжини та складності (наприклад, Dr. GRPO), нормалізацію на рівні маркера, а не на рівні послідовності, а також видалення або зміну форми терміна KL. Очікуйте тіснішої інтеграції з винагородами, які можна перевірити (математика, код, використання інструментів), кращої обробки розріджених сигналів і гібридів, які поєднують групові базові показники з легкою критикою для агентських багатоетапних завдань.

Реалізація в реальному світі

Навчання DeepSeek-R1 і DeepSeekMath виробляти довгий ланцюжок думок, використовуючи нагороди за правильність математичних задач на основі правил

Тонке налаштування моделей генерації коду, де кожне вибіркове рішення оцінюється за тим, чи проходить воно модульні тести, а група нормалізується для вибору переможців

Конвеєри RLHF з відкритим вихідним кодом (наприклад, у бібліотеках TRL і verl), що використовують GRPO для узгодження моделей чату, не сплачуючи за окрему мережу цінностей

Поліпшення виконання інструкцій або безпечної поведінки шляхом вибірки кількох відповідей на підказку та винагородження тих, які модель винагороди оцінює найвище порівняно з аналогами

Ризики та огорожі

Оптимізація одного тесту може приховати ширші слабкі сторони системи.

Витрати на інфраструктуру та обслуговування часто недооцінюються.

Прогалини в безпеці та спостережуваності можуть зростати в міру ускладнення систем.

Дорожня карта впровадження

1

Визначте цільові показники затримки, якості та вартості перед впровадженням.

2

Тест за реалістичних умов навантаження та даних.

3

Моніторинг інструментів на наявність помилок, дрейфу та впливу користувача.

4

Перед масштабуванням підготуйте шляхи відкату та реагування на інциденти.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Group Relative Policy Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Оптимізація проксимальної політики

Часті запитання

What is Group Relative Policy Optimization?

Оптимізація групової відносної політики (GRPO) — це метод навчання з підкріпленням для точного налаштування мовних моделей, який порівнює кожну відповідь із групою однотипних відповідей на той самий запит, усуваючи окрему мережу значень, яку використовує PPO. Він став відомим як основний навчальний трюк, що лежить в основі моделей міркування DeepSeek.

Який основний компонент PPO виключає GRPO?

Зміна підпису GRPO скасовує модель отриманого значення/критики PPO, яка зазвичай приблизно такого ж розміру, як і політика, що економить значну пам’ять і обчислювальні ресурси.

Як GRPO обчислює перевагу для даного завершення?

Перевага кожного виконання дорівнює (винагорода – середнє значення групи)/групове стандартне відхилення, тому група відповідей на те саме запитання діє як базова лінія.

Які моделі зробили GRPO відомим?

GRPO був представлений і популяризований DeepSeek, зокрема в DeepSeekMath і як механізм RL, що стоїть за моделями міркування DeepSeek-R1.

Яку роль відіграє термін KL-дивергенції в GRPO?

Покарання KL проти еталонної моделі (зазвичай попередньої RL) упорядковує навчання, щоб політика покращилася без згортання чи дрейфу до вироджених результатів.

Чому GRPO особливо привабливий для навчання моделям міркування на математиці чи програмуванні?

Вибірка багатьох рішень і оцінка їх за допомогою автоматичних перевірок правильності чітко поєднується з перевагами GRPO, нормалізованими групою, без критики.