Оптимизация на проксималната политика
Оптимизацията на проксималната политика (PPO) е алгоритъмът за обучение с подсилване, свързан най-много с фина настройка на езиковите модели от човешка обратна връзка.
Преглед
It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.
Дълбоко гмуркане
PPO беше въведено от OpenAI през 2017 г. и се превърна в работния кон зад RLHF за системи като InstructGPT и ChatGPT. Основното предизвикателство в RL с градиент на политики е, че една прекалено голяма актуализация може да срине производителността. PPO се справя с това с „отрязана сурогатна цел“: измерва колко по-голяма (или по-малко) е станала вероятността дадено действие спрямо старата политика, умножава това съотношение по предимството (колко по-добро е било действието от очакваното) и ограничава съотношението до малък диапазон като 0,8 до 1,2. Това ограничава докъде може да се придвижи политиката за актуализация, поддържайки обучението стабилно, като същевременно позволява стабилно подобрение. В езиковия модел RLHF „действието“ генерира знак или отговор, наградата идва от модел на награда, а наказанието за дивергенция на KL предпазва модела от отклонение твърде далеч от първоначалното си поведение.
Техническа информация
PPO максимизира ограничена цел: min(съотношение * предимство, клип(съотношение, 1-eps, 1+eps) * предимство), където съотношението е вероятността за ново спрямо старо действие. Предимствата обикновено се оценяват с обобщена оценка на предимствата и научена стойност (критична) мрежа. В RLHF общото възнаграждение съчетава резултата от модела на възнаграждението с наказание KL за токен спрямо референтната политика, балансирайки печалбата от възнаграждение срещу оставането близо до оригиналния модел.
Стратегическо въздействие
Speed and scale
Езиковите работни процеси могат да се движат по-бързо, без да се жертва последователността.
Access and reach
Той разширява достъпа между езици и стилове на комуникация.
Clearer decisions
Екипите могат да отделят повече време за преценка, докато автоматизацията се справя с повторението.
Бъдещето на оптимизацията на проксималната политика
PPO остава силен, но е пословично непохватен: нуждае се от отделна стойностна мрежа, внимателна настройка на хиперпараметрите и много изчисления. По-простите алтернативи набират популярност, включително DPO (изобщо без RL) и GRPO, което намалява стойностната мрежа чрез оценка на предимствата от групи от извадкови отговори и задвижва последните модели на разсъждение. PPO ще продължи да съществува там, където проучването на правилата наистина помага, но областта активно разменя част от своята сложност за по-евтини методи.
Внедряване в реалния свят
Фина настройка на InstructGPT и ChatGPT за следване на инструкции и човешки предпочитания чрез RLHF
Обучение на агенти за игра на игри и роботика, оригинален домейн на PPO преди езикови модели
Намаляване на токсичността или подобряване на полезността чрез максимизиране на резултата от модела на възнаграждение при ограничение на KL
Оптимизиране на използването на инструмента или многоетапното поведение на агента, където моделът се възнаграждава за правилното изпълнение на задачите
Рискове и предпазни огради
Халюцинираните факти могат тихо да влязат в отчети, потоци за поддръжка или резултати от изследвания.
Бързата чувствителност може да създаде противоречиви резултати при подобни заявки.
Чувствителните текстови данни могат да бъдат разкрити, ако контролите за достъп са слаби.
Пътна карта за изпълнение
Определете изходен формат, тон и стандарти за качество преди внедряване.
Наземни отговори с доверени източници винаги, когато точността има значение.
Поддържайте контролна точка за човешки преглед за изходи с високи залози.
Проследявайте моделите на неуспехи и редовно обучавайте подкани или работни потоци.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Proximal Policy Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Оптимизация на груповата относителна политика
Frequently asked questions
What is Proximal Policy Optimization?
Оптимизацията на проксималната политика (PPO) е алгоритъмът за обучение с подсилване, свързан най-много с фина настройка на езиковите модели от човешка обратна връзка. Той подобрява политиката с внимателни, малки стъпки, за да се избегне нестабилността, която тормози наивните градиентни методи на политиката.
Какъв проблем основно адресира „изрязването“ на PPO?
Изрязването на съотношението на вероятността предотвратява преместването на политиката твърде далеч от всяка отделна актуализация, което е основният източник на нестабилност в методите с градиент на политика.
В езиковия модел RLHF с PPO, откъде обикновено идва сигналът за награда?
Един модел на възнаграждение предоставя скаларна награда за генерирани отговори, тъй като хората да оценяват всеки резултат по време на RL би било невъзможно.
Какво прави наказанието за KL-дивергенция в базиран на PPO RLHF?
Санкцията на KL за токен спрямо оригиналната (референтна) политика обезсърчава модела да променя поведението си твърде драстично, докато преследва награда.
Каква е ролята на ценностната (критична) мрежа в PPO?
PPO е метод на актьор-критика; стойностната мрежа оценява очакваното възнаграждение, позволявайки оценки на предимствата (често чрез GAE), които намаляват дисперсията.
Какво представлява „предимството“ в PPO?
Предимството измерва колко по-добро (или по-лошо) е било избраното действие спрямо оценката на стойността, като казва на политиката кои действия да подсили.