Прямая оптимизация предпочтений
Оптимизация прямых предпочтений (DPO) — это способ привести языковые модели в соответствие с предпочтениями человека без обучения отдельной модели вознаграждения или обучения с подкреплением.
Обзор
It collapses a complex multi-stage pipeline into a single, stable training loss.
Глубокое погружение
DPO, представленный Рафаиловым и его коллегами из Стэнфорда в 2023 году, переосмысливает то, как мы учим модель тому, что предпочитают люди. Традиционный подход (RLHF) обучает модель вознаграждения на человеческих сравнениях, а затем использует обучение с подкреплением, чтобы максимизировать это вознаграждение. Основная идея DPO является математической: оптимальная политика в соответствии с целью RLHF имеет замкнутую связь с вознаграждением, поэтому вы можете перестроить уравнения и оптимизировать языковую модель непосредственно на парах предпочтений. Вы даете ей подсказку, «выбранный» (предпочтительный) ответ и «отклоненный» ответ, а простая потеря в стиле классификации подталкивает модель к тому, чтобы сделать выбранный ответ относительно более вероятным. Никакой модели вознаграждения, никакого цикла выборки, никакого взлома вознаграждений. Это гораздо проще и стабильнее в эксплуатации.
Техническая информация
DPO использует двоичную кросс-энтропийную потерю по парам предпочтений. Это увеличивает логарифмическое отношение вероятности выбранного ответа по отношению к отклоненному, каждый из которых измеряется по замороженной эталонной модели (обычно это контролируемая и точно настроенная отправная точка). Бета-параметр температуры контролирует, насколько далеко политика может отклоняться от этого эталона, неявно обеспечивая соблюдение ограничения KL, которое RLHF применяет явно. Награда никогда не материализуется; это неявно заложено в собственных логарифмах вероятности политики.
Стратегическое воздействие
Скорость и масштаб
Языковые рабочие процессы могут развиваться быстрее, не жертвуя при этом согласованностью.
Доступ и охват
Это расширяет доступ к различным языкам и стилям общения.
Более четкие решения
Команды могут тратить больше времени на принятие решений, в то время как автоматизация занимается повторением.
Будущее прямой оптимизации предпочтений
DPO стал методом выравнивания по умолчанию, потому что он дешев и воспроизводим, и он породил семейство вариантов: IPO исправляет переоснащение почти детерминированных предпочтений, KTO учится на отдельных метках «хорошо» или «плохо», а не на парах, а ORPO объединяет изучение предпочтений в тонкую настройку без эталонной модели. Ожидайте продолжения работы по объединению DPO с данными о политике и устранению систематических ошибок в отношении длины/качества, что позволит сократить оставшийся разрыв с помощью полного онлайн-RLHF.
Реальная реализация
Точная настройка моделей чата с открытым весом, таких как Zephyr и многих производных от Llama и Mistral, которые были согласованы с DPO в наборах данных о предпочтениях.
Сокращение вредных или бесполезных результатов с использованием пар, в которых безопасный и полезный ответ «выбирается» вместо проблемного.
Обучение помощника по программированию предпочтению правильных, хорошо документированных решений ошибочным с использованием сравнений, оцененных разработчиками.
Настройка стиля реферирования, чтобы модели отдавали предпочтение кратким и точным изложениям, а не многословным или галлюцинаторным.
Риски и ограничения
Галлюцинированные факты могут незаметно войти в отчеты, потоки поддержки или результаты исследований.
Незамедлительная чувствительность может привести к противоречивым результатам по схожим запросам.
Конфиденциальные текстовые данные могут быть раскрыты, если контроль доступа слабый.
Дорожная карта реализации
Перед развертыванием определите выходной формат, тон и стандарты качества.
Наземные ответы с помощью надежных источников, когда точность имеет значение.
Обеспечьте контрольную точку человеческого контроля для получения важных результатов.
Отслеживайте закономерности сбоев и регулярно обновляйте подсказки или рабочие процессы.
Продолжайте исследовать
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Direct Preference Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Следующее руководство
Оптимизация предпочтений по соотношению шансов
Часто задаваемые вопросы
What is Direct Preference Optimization?
Оптимизация прямых предпочтений (DPO) — это способ привести языковые модели в соответствие с предпочтениями человека без обучения отдельной модели вознаграждения или обучения с подкреплением. Это сворачивает сложный многоэтапный конвейер в одну стабильную потерю обучения.
Что устраняет DPO по сравнению с традиционным RLHF?
Основным преимуществом DPO является отказ от модели явного вознаграждения и цикла выборки RL, вместо этого оптимизируя политику непосредственно на парах предпочтений.
Из каких данных состоит один пример обучения DPO?
DPO тренируется на парах предпочтений: подсказка плюс один предпочтительный («выбранный») и один непредпочтительный («отклоненный») ответ.
Какую роль эталонная модель играет в DPO?
Замороженная ссылка (обычно модель SFT) фиксирует потери; параметр бета определяет, насколько далеко обученная политика может отойти от него.
Где в DPO представлена «награда»?
Вывод DPO показывает, что вознаграждение неявно определяется логарифмическим соотношением вероятностей между политикой и ссылкой, поэтому явная модель вознаграждения не требуется.
Что контролирует параметр бета (температура) в ДПО?
Бета управляет неявным ограничением KL: более высокая бета приближает политику к эталону, более низкая бета допускает большее отклонение.