Мова AI GUIDE

Оптимізація проксимальної політики

Проксимальна оптимізація політики (PPO) — це алгоритм навчання з підкріпленням, найбільш пов’язаний із тонким налаштуванням мовних моделей за відгуками людини.

2 хвилини читанняОстаннє оновлення

Огляд

It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.

Глибоке занурення

PPO був представлений OpenAI у 2017 році та став робочою конячкою для RLHF для таких систем, як InstructGPT і ChatGPT. Основна проблема RL з градієнтом політики полягає в тому, що одне надто велике оновлення може знизити продуктивність. PPO вирішує це за допомогою «обрізаної сурогатної цілі»: він вимірює, наскільки більшою (чи меншою) є ймовірність дії порівняно зі старою політикою, множить це співвідношення на перевагу (наскільки дія була кращою, ніж очікувалося), і обрізає співвідношення до невеликого діапазону, наприклад від 0,8 до 1,2. Це обмежує, наскільки політика може просунутися за одне оновлення, зберігаючи стабільність навчання, водночас дозволяючи постійне вдосконалення. У мовній моделі RLHF «дія» генерує маркер або відповідь, винагорода надходить від моделі винагороди, а штраф за розбіжність KL утримує модель від занадто далекого відхилення від її початкової поведінки.

Технічне розуміння

PPO максимізує обмежену ціль: min(коефіцієнт * перевага, кліп(коефіцієнт, 1-eps, 1+eps) * перевага), де співвідношення — це ймовірність нової дії над старим. Переваги зазвичай оцінюються за допомогою узагальненої оцінки переваг і мережі вивчених цінностей (критики). У RLHF загальна винагорода поєднує оцінку моделі винагороди зі штрафом KL за токен у порівнянні з еталонною політикою, врівноважуючи отримання винагороди з наближенням до вихідної моделі.

Стратегічний вплив

Швидкість і масштаб

Мовні робочі процеси можуть рухатися швидше без шкоди для узгодженості.

Доступ і охоплення

Це розширює доступ до різних мов і стилів спілкування.

Чіткіші рішення

Команди можуть витрачати більше часу на оцінювання, поки автоматизація справляється з повторенням.

Майбутнє оптимізації проксимальної політики

PPO залишається сильним, але, як відомо, незручним: йому потрібна окрема мережа цінностей, ретельне налаштування гіперпараметрів і багато обчислень. Набувають поширення простіші альтернативи, зокрема DPO (загалом без RL) і GRPO, які скидають ціннісну мережу, оцінюючи переваги на основі груп вибіркових відповідей, і стали джерелом недавніх моделей міркування. PPO зберігатиметься там, де справді допомагає дослідження згідно з політикою, але сфера активно обмінює частину своєї складності на більш дешеві методи.

Реалізація в реальному світі

Точне налаштування InstructGPT і ChatGPT для виконання інструкцій і вподобань людини через RLHF

Навчання ігор і агентів керування робототехнікою, оригінальний домен PPO перед мовними моделями

Зменшення токсичності або підвищення корисності шляхом максимізації оцінки моделі винагороди за обмеженням KL

Оптимізація використання інструментів або багатоетапної поведінки агента, коли модель отримує винагороду за правильне виконання завдань

Ризики та огорожі

Галюциновані факти можуть непомітно входити у звіти, допоміжні потоки або результати досліджень.

Делікатність підказок може створити суперечливі результати для подібних запитів.

Конфіденційні текстові дані можуть бути розкриті, якщо контроль доступу слабкий.

Дорожня карта впровадження

1

Визначте вихідний формат, тон і стандарти якості перед розгортанням.

2

Якщо точність має значення, зв’яжіться з надійними джерелами.

3

Тримайте контрольну точку перевірки людьми для отримання високих ставок.

4

Відстежуйте моделі збоїв і регулярно перенавчайте підказки або робочі процеси.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Proximal Policy Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Оптимізація групової відносної політики

Часті запитання

What is Proximal Policy Optimization?

Проксимальна оптимізація політики (PPO) — це алгоритм навчання з підкріпленням, найбільш пов’язаний із тонким налаштуванням мовних моделей за відгуками людини. Він покращує політику обережними невеликими кроками, щоб уникнути нестабільності, яка заважає наївним методам градієнта політики.

Яку проблему в першу чергу вирішує «вирізка» PPO?

Відсікання співвідношення ймовірностей запобігає будь-якому окремому оновленню від переміщення політики занадто далеко, що є основним джерелом нестабільності в методах градієнта політики.

У мовній моделі RLHF із PPO, звідки зазвичай надходить сигнал винагороди?

Модель винагороди забезпечує скалярну винагороду за згенеровані відповіді, оскільки люди оцінюють кожен результат під час RL було б неможливо.

Що робить штраф за розбіжність KL у RLHF на основі PPO?

Покарання KL за токен проти вихідної (референсної) політики перешкоджає моделі змінювати свою поведінку надто різко під час гонитви за винагородою.

Яка роль ціннісної (критичної) мережі в PPO?

ППО — акторсько-критичний метод; мережа вартості оцінює очікувану винагороду, дозволяючи оцінювати переваги (часто через GAE), що зменшує дисперсію.

Що означає «перевага» в РРО?

Перевага вимірює, наскільки кращою (або гіршою) вибрана дія була відносно оцінки вартості, вказуючи політиці, які дії підсилити.