Оптимизация предпочтений по соотношению шансов
Оптимизация предпочтений отношения шансов (ORPO) — это метод тонкой настройки, который обучает языковую модель хорошему поведению и человеческим предпочтениям за один проход обучения.
Обзор
It matters because it skips the usual separate reward model and reference model, making alignment cheaper and simpler.
Глубокое погружение
ORPO, представленный Хонгом, Ли и Торном в 2024 году, объединяет контролируемую точную настройку и согласование предпочтений в один этап. Большинство конвейеров выравнивания сначала выполняют SFT на хороших примерах, а затем запускают второй метод, такой как RLHF или DPO, который требует замороженной копии модели (ссылки) плюс сохраненных пар предпочтений. ORPO полностью удаляет эталонную модель. Его потеря добавляет штрафной срок к стандартной цели следующего токена: он повышает шансы, которые модель присваивает выбранному (предпочтительному) ответу, одновременно снижая шансы отклоненного ответа. Because it uses the odds ratio rather than a strong log-probability gap, the penalty is gentle, so the model learns to favor good answers without catastrophically forgetting fluent generation.
Техническая информация
Потери ORPO представляют собой потерю перекрестной энтропии SFT плюс взвешенную логарифмическую сигмоиду логарифмического отношения шансов между выбранными и отклоненными ответами. Шансы равны p/(1-p), поэтому соотношение сравнивает, насколько более вероятно, что модель найдет хороший ответ по сравнению с плохим. Использование шансов вместо необработанной вероятности сохраняет умеренный контраст, что предотвращает чрезмерное подавление отклоненных токенов, которые могут ухудшить неиспользуемую модель.
Стратегическое воздействие
Скорость и масштаб
Языковые рабочие процессы могут развиваться быстрее, не жертвуя при этом согласованностью.
Доступ и охват
Это расширяет доступ к различным языкам и стилям общения.
Более четкие решения
Команды могут тратить больше времени на принятие решений, в то время как автоматизация занимается повторением.
Будущее оптимизации предпочтений соотношения шансов
ORPO набирает обороты, поскольку сокращает объем памяти и вычислительных ресурсов, отказываясь от эталонной модели, что привлекательно для команд, выполняющих тонкую настройку на ограниченном оборудовании. Ожидайте, что он будет чаще появляться в рецептах с открытым исходным кодом и в качестве опции по умолчанию в таких библиотеках, как Hugging Face TRL. Будущая работа, вероятно, будет автоматически настраивать лямбда-взвешивание, объединять ORPO с другими целями без ссылок и распространять его на мультимодальные и очень большие модели, где хранение двух копий в памяти обходится дорого.
Реальная реализация
Точная настройка модели чата 7B с открытым исходным кодом на парах предпочтений без загрузки второй эталонной копии, что позволяет сократить вдвое память графического процессора.
Стартап, настраивающий помощника по поддержке клиентов предпочитать вежливые ответы в соответствии с политикой за одно обучение вместо SFT, а затем DPO.
Исследователи сравнивают ORPO и DPO на одном и том же наборе данных, чтобы продемонстрировать сопоставимое соответствие при меньших вычислительных затратах.
Адаптация базовой модели к специализированной области (например, составлению юридических документов), где доступны пары хороших и плохих примеров, но нет бюджета модели вознаграждения.
Риски и ограничения
Галлюцинированные факты могут незаметно войти в отчеты, потоки поддержки или результаты исследований.
Незамедлительная чувствительность может привести к противоречивым результатам по схожим запросам.
Конфиденциальные текстовые данные могут быть раскрыты, если контроль доступа слабый.
Дорожная карта реализации
Перед развертыванием определите выходной формат, тон и стандарты качества.
Наземные ответы с помощью надежных источников, когда точность имеет значение.
Обеспечьте контрольную точку человеческого контроля для получения важных результатов.
Отслеживайте закономерности сбоев и регулярно обновляйте подсказки или рабочие процессы.
Продолжайте исследовать
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Odds Ratio Preference Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Следующее руководство
Прямая оптимизация предпочтений
Часто задаваемые вопросы
What is Odds Ratio Preference Optimization?
Оптимизация предпочтений отношения шансов (ORPO) — это метод тонкой настройки, который обучает языковую модель хорошему поведению и человеческим предпочтениям за один проход обучения. Это важно, потому что здесь отсутствует обычная отдельная модель вознаграждения и эталонная модель, что делает согласование более дешевым и простым.
В чем основное практическое преимущество ORPO перед такими методами, как DPO?
ORPO объединяет изучение предпочтений с потерями SFT и не требует замороженной эталонной копии модели, что позволяет экономить память и вычислительные ресурсы.
С чем сравнивается «отношение шансов» в ORPO?
ORPO использует соотношение шансов (p/(1-p)), которое модель присваивает предпочтительному ответу по сравнению с непредпочтительным.
Какие две задачи ОРПО выполняет за один проход обучения?
ORPO объединяет стандартную цель следующего токена SFT со штрафом за предпочтение в одном едином убытке.
Почему ORPO использует для определения штрафа коэффициенты, а не необработанную логарифмическую разницу вероятностей?
Наказание, основанное на шансах, мягче, что помогает модели, на которую нет ссылок, сохранять плавность генерации, но при этом предпочитать хорошие ответы.
Какой комбинацией лучше всего описать потерю ORPO?
ORPO добавляет взвешенный логарифмически-сигмовидный коэффициент отношения шансов поверх контролируемой потери перекрестной энтропии.