Нормалізація згрупованої винагороди в RLHF
Нормалізація згрупованої винагороди стандартизує винагороди моделі в межах групи відповідей на ту саму підказку, перетворюючи галасливі оцінки на стабільний тренувальний сигнал.
Огляд
It is the core trick behind GRPO, the algorithm that powers many modern reasoning models.
Глибоке занурення
У підкріплюючому навчанні на основі зворотного зв’язку людини (RLHF) модель генерує відповіді, а модель винагороди оцінює їх, але необроблені винагороди є шумними та дуже різняться між підказками. Нормалізація групової винагороди виправляє це шляхом вибірки групи з кількох відповідей на одне й те саме підказка, а потім нормалізації кожної винагороди шляхом віднімання середнього значення групи та ділення на стандартне відхилення групи. Цей z-показник стає перевагою. Цей підхід є центральним для оптимізації групової відносної політики (GRPO), представленої DeepSeek, яка відома як джерело міркувань DeepSeek-R1. Важливо, що GRPO усуває окрему мережу значень (критику), яку використовує PPO, оскільки базовим є середнє значення групи. Це робить навчання простішим, дешевшим і ефективнішим з використанням пам’яті, зберігаючи градієнтний сигнал добре масштабованим.
Технічне розуміння
Для групи результатів із винагородами r_1...r_G перевага становить A_i = (r_i − mean(r)) / std(r). Відповіді, які є кращими за середній показник у групі, отримують позитивну перевагу та підкріплюються; ті, що гірше середнього, відсуваються вниз. Оскільки порівняння є відносним у межах підказки, абсолютна шкала винагороди та складність підказки компенсуються, зменшуючи дисперсію. GRPO зберігає обрізану мету PPO та покарання KL проти еталонної політики, щоб запобігти занадто далекому відхиленню моделі.
Стратегічний вплив
Чіткіші рішення
Це допоможе вам відокремити чіткі технічні заяви від маркетингової мови.
Вартість і бюджет
Перш ніж витрачати гроші чи час, ви можете задати питання про кращу реалізацію.
Команда та робочий процес
Команди зі спільним розумінням приймають кращі рішення щодо продуктів, політики та навчання.
Майбутнє нормалізації згрупованої винагороди в RLHF
Згрупована нормалізація підживлює бум моделей міркування, коли моделі навчаються за допомогою перевірених винагород, як-от правильних математичних відповідей без досвідченої критики. Дослідження вдосконалюють його: дискусії про те, чи ділити за стандартним відхиленням, обробка абсолютно правильних чи зовсім неправильних груп, які не дають переваги, і масштабування розміру групи. Очікуйте, що згруповані, вільні від критики методи поширяться на використання агентських інструментів і генерацію коду, де автоматичні верифікатори постачають дешеві та численні сигнали винагороди.
Реалізація в реальному світі
Навчання моделі математичних міркувань шляхом вибірки 16 розв’язків на задачу та винагородження тих, хто відповідає середньому рівню правильності в групі.
Точне налаштування корисності чат-бота шляхом нормалізації результатів моделі винагороди для кількох відповідей кандидатів на кожне запит користувача.
Удосконалення помічника з кодування, де кожне вибіркове рішення оцінюється за тим, чи проходить воно модульні тести, а потім нормалізується в межах групи.
Зменшення пам’яті графічного процесора в конвеєрі RLHF шляхом видалення критичної мережі PPO та використання натомість групового середнього як базового.
Ризики та огорожі
Різні команди можуть використовувати той самий термін по-різному, тому визначте обсяг завчасно.
Порівняльні показники можуть виглядати сильними, тоді як продуктивність у реальному світі нерівномірна.
Ігнорування якості даних і планів оцінки часто призводить до нестабільних результатів.
Дорожня карта впровадження
Почніть із простого визначення необхідного результату.
Перед тестуванням виберіть одну метрику успіху та одну умову невдачі.
Запустіть невеликий пілот із репрезентативними даними, а не відшліфованим демонстраційним набором.
Задокументуйте, де нормалізація згрупованої винагороди в RLHF допомагає, а де простіші методи кращі.
Продовжуйте досліджувати
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Grouped Reward Normalization in RLHF quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Наступний посібник
Нормалізація довжини в оптимізації переваг
Часті запитання
What is Grouped Reward Normalization in RLHF?
Нормалізація згрупованої винагороди стандартизує винагороди моделі в межах групи відповідей на ту саму підказку, перетворюючи галасливі оцінки на стабільний тренувальний сигнал. Це основний трюк GRPO, алгоритму, на якому базуються багато сучасних моделей міркування.
У нормалізації згрупованої винагороди, з чим порівнюється винагорода кожної відповіді?
Кожна винагорода перетворюється на z-показник із використанням середнього значення та стандартного відхилення групи відповідей на ту саму підказку.
Який алгоритм найбільш пов’язаний із нормалізацією згрупованої винагороди?
GRPO, представлений DeepSeek і використовується в DeepSeek-R1, побудований на нормалізації винагород у групі.
Який компонент стандартного РРО значно виключає GRPO?
Використовуючи середнє групове значення як базову лінію, GRPO відмовляється від навчених критиків, заощаджуючи пам’ять і обчислення.
Що відбувається з відповіддю, винагорода якої нижча за середнє значення групи?
Віднімання групового середнього робить відповіді нижче середнього негативними, відштовхуючи політику від них.
Чому нормалізація всередині групи зменшує тренувальну дисперсію?
Оскільки порівняння є відносними в межах кожної підказки, відмінності в абсолютному масштабі та складності підказки зникають.