Оптимизация проксимальной политики
Оптимизация проксимальной политики (PPO) — это алгоритм обучения с подкреплением, который больше всего связан с точной настройкой языковых моделей на основе отзывов людей.
Обзор
It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.
Глубокое погружение
PPO был представлен OpenAI в 2017 году и стал основой RLHF для таких систем, как InstructGPT и ChatGPT. Основная проблема в RL с градиентом политик заключается в том, что одно слишком большое обновление может привести к снижению производительности. PPO решает эту проблему с помощью «обрезанной суррогатной цели»: он измеряет, насколько более (или менее) вероятным стало действие по сравнению со старой политикой, умножает это соотношение на преимущество (насколько действие было лучше, чем ожидалось) и ограничивает соотношение до небольшого диапазона, например, от 0,8 до 1,2. Это ограничивает то, насколько далеко может продвинуться политика за одно обновление, сохраняя стабильность обучения и в то же время обеспечивая постоянное улучшение. В языковой модели RLHF «действие» генерирует токен или ответ, вознаграждение исходит из модели вознаграждения, а штраф за KL-дивергенцию удерживает модель от слишком далекого отклонения от исходного поведения.
Техническая информация
PPO максимизирует урезанную цель: min(отношение * преимущество, клип(отношение, 1-eps, 1+eps) * преимущество), где отношение — это вероятность нового действия по сравнению со старым. Преимущества обычно оцениваются с помощью обобщенной оценки преимуществ и сети усвоенных ценностей (критиков). В RLHF общее вознаграждение объединяет оценку модели вознаграждения со штрафом KL для каждого токена в соответствии с эталонной политикой, уравновешивая получение вознаграждения и сохранение близости к исходной модели.
Стратегическое воздействие
Скорость и масштаб
Языковые рабочие процессы могут развиваться быстрее, не жертвуя при этом согласованностью.
Доступ и охват
Это расширяет доступ к различным языкам и стилям общения.
Более четкие решения
Команды могут тратить больше времени на принятие решений, в то время как автоматизация занимается повторением.
Будущее оптимизации ближайшей политики
PPO остается сильным, но, как известно, он неудобен: ему нужна отдельная сеть создания ценности, тщательная настройка гиперпараметров и много вычислений. Набирают популярность более простые альтернативы, в том числе DPO (без RL вообще) и GRPO, которые отказываются от сети создания ценности за счет оценки преимуществ на основе групп выборочных ответов и служат основой для последних моделей рассуждения. PPO будет сохраняться там, где разведка в соответствии с политикой действительно помогает, но часть сложности месторождения активно обменивается на более дешевые методы.
Реальная реализация
Точная настройка InstructGPT и ChatGPT для следования инструкциям и предпочтениям человека через RLHF.
Обучение агентов управления играми и робототехникой, первоначальная область применения PPO до появления языковых моделей.
Снижение токсичности или повышение полезности за счет максимизации оценки модели вознаграждения при ограничении KL.
Оптимизация использования инструментов или многоэтапного поведения агента, при котором модель вознаграждается за правильное выполнение задач.
Риски и ограничения
Галлюцинированные факты могут незаметно войти в отчеты, потоки поддержки или результаты исследований.
Незамедлительная чувствительность может привести к противоречивым результатам по схожим запросам.
Конфиденциальные текстовые данные могут быть раскрыты, если контроль доступа слабый.
Дорожная карта реализации
Перед развертыванием определите выходной формат, тон и стандарты качества.
Наземные ответы с помощью надежных источников, когда точность имеет значение.
Обеспечьте контрольную точку человеческого контроля для получения важных результатов.
Отслеживайте закономерности сбоев и регулярно обновляйте подсказки или рабочие процессы.
Продолжайте исследовать
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Proximal Policy Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Следующее руководство
Оптимизация групповой относительной политики
Часто задаваемые вопросы
What is Proximal Policy Optimization?
Оптимизация проксимальной политики (PPO) — это алгоритм обучения с подкреплением, который больше всего связан с точной настройкой языковых моделей на основе отзывов людей. Он совершенствует политику осторожными, небольшими шагами, чтобы избежать нестабильности, от которой страдают наивные методы градиентной политики.
Какую проблему в первую очередь решает «обрезка» PPO?
Ограничение отношения вероятности не позволяет любому отдельному обновлению слишком далеко продвинуть политику, что является основным источником нестабильности в методах градиента политики.
Откуда обычно поступает сигнал вознаграждения в языковой модели RLHF с PPO?
Модель вознаграждения обеспечивает скалярное вознаграждение за сгенерированные ответы, поскольку было бы невозможно заставить людей оценивать каждый результат во время RL.
Что делает штраф за KL-дивергенцию в RLHF на основе PPO?
Штраф KL для каждого токена по сравнению с исходной (эталонной) политикой не позволяет модели слишком резко менять свое поведение в погоне за вознаграждением.
Какова роль сети ценностей (критиков) в PPO?
PPO — метод актера-критика; сеть создания ценности оценивает ожидаемое вознаграждение, позволяя оценить преимущества (часто через GAE), которые уменьшают дисперсию.
Что представляет собой «преимущество» в PPO?
Преимущество измеряет, насколько лучше (или хуже) выбранное действие было по сравнению с оценкой ценности, указывая политике, какие действия следует усилить.