РУКОВОДСТВО ПО ОСНОВАМ

Моделирование вознаграждения Брэдли-Терри

Модель Брэдли-Терри — это столетний статистический метод преобразования парных сравнений (А превосходит Б) в числовые оценки.

2 минуты чтенияПоследнее обновление

Обзор

In modern AI it powers reward models that learn human preferences from 'which answer is better?' labels, the backbone of RLHF.

Глубокое погружение

Брэдли-Терри, представленный в 1952 году, предполагает, что каждый предмет имеет скрытый показатель силы, а вероятность того, что предмет A превосходит предмет B, является логистической функцией разницы их оценок. В согласовании с ИИ это аккуратно сопоставляется с данными о предпочтениях: люди, определяющие ярлыки, видят два ответа модели и выбирают лучший, вместо того, чтобы давать трудно поддающиеся калибровке абсолютные оценки. Модель вознаграждения, обычно языковая модель со скалярной выходной головкой, обучается так, чтобы ответ, который предпочитает человек, получал более высокое скалярное вознаграждение. Потеря представляет собой отрицательную логарифмическую вероятность вероятности Брэдли-Терри: максимизируйте логарифмическую сигмоида (награда выбранного минус награда отклоненного). Полученная модель вознаграждения затем оценивает произвольные выходные данные, предоставляя сигнал, который оптимизируются алгоритмами обучения с подкреплением, такими как PPO, чтобы сделать модели более полезными и согласованными.

Техническая информация

Потери при обучении для сравнения просто минус лог-сигмоида (r_chosen − r_rejected), поэтому модель всегда изучает только относительные различия. Это означает, что вознаграждения можно идентифицировать только с точностью до аддитивной константы; абсолютный масштаб произволен. Поскольку сравнения проще и более последовательны для людей, чем оценки от 1 до 10, данные Брэдли-Терри менее зашумлены. Позже прямая оптимизация предпочтений показала, что можно пропустить отдельную модель вознаграждения и оптимизировать цель Брэдли-Терри непосредственно в политике.

Стратегическое воздействие

Более четкие решения

Это поможет вам отделить четкие технические заявления от маркетингового языка.

Стоимость и бюджет

Вы можете задать более эффективные вопросы по реализации, прежде чем тратить деньги или время.

Команда и рабочий процесс

Команды с общим пониманием принимают более эффективные решения по продуктам, политике и обучению.

Будущее моделирования вознаграждений Брэдли-Терри

Брэдли-Терри предполагает наличие единого последовательного ранжирования и транзитивных предпочтений, которые перестают действовать, когда люди не соглашаются или предпочтения цикличны. Исследования движутся к моделям, которые фиксируют распределение предпочтений, многомерные вознаграждения (полезность, безопасность, честность оцениваются отдельно) и такие методы, как обучение Нэша на основе отзывов людей, которые отказываются от предположения об одном балле. DPO и его варианты все чаще включают цель Брэдли-Терри непосредственно в политическую подготовку. Ожидайте более богатых схем сравнения, включая ранжирование более чем двух элементов и предпочтений, взвешенных по доверию, чтобы уменьшить вознаграждение за взлом.

Реальная реализация

Обучение модели вознаграждения в RLHF, которая ранжирует два ответа чат-бота и передает сигнал «лучше-хуже» для тонкой настройки PPO.

Прямая оптимизация предпочтений — точная настройка модели непосредственно на парах ответов «выбранный» и «отклоненный» с использованием логарифмических сигмовидных потерь Брэдли-Терри.

Рейтинг шахматистов или киберспортсменов с помощью Эло, которое математически является близким родственником модели Брэдли-Терри по результатам игр.

Создание рейтинга рекомендаций по контенту на основе данных о кликах «пользователи предпочитают А, а не Б», а не абсолютных звездных рейтингов.

Риски и ограничения

Разные команды могут использовать один и тот же термин по-разному, поэтому заранее определите масштаб.

Тесты могут выглядеть сильными, в то время как реальная производительность неравномерна.

Игнорирование качества данных и планов оценки часто приводит к нестабильным результатам.

Дорожная карта реализации

1

Начните с простого определения желаемого результата.

2

Перед тестированием выберите один показатель успеха и одно условие отказа.

3

Запустите небольшой пилотный проект с репрезентативными данными, а не отточенный демонстрационный набор.

4

Документ, в котором помогает моделирование вознаграждения Брэдли-Терри и где более простые методы лучше.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Bradley-Terry Reward Modeling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Моделирование вознаграждений

Часто задаваемые вопросы

What is Bradley-Terry Reward Modeling?

Модель Брэдли-Терри — это столетний статистический метод преобразования парных сравнений (А превосходит Б) в числовые оценки. В современном искусственном интеллекте он обеспечивает работу моделей вознаграждения, которые изучают человеческие предпочтения на основе вопроса «какой ответ лучше?» этикетки, основа RLHF.

Что модель Брэдли-Терри преобразует в числовые оценки?

Брэдли-Терри проводит парные сравнения «А лучше Б» и выводит скрытый показатель силы для каждого элемента, поэтому он так хорошо соответствует маркировке человеческих предпочтений.

В случае Брэдли-Терри вероятность того, что A победит B, является функцией чего?

Модель устанавливает P(A побеждает B) равным логистической (сигмовидной) разнице между показателями скрытой силы A и B.

Почему вознаграждения Брэдли-Терри можно идентифицировать только с точностью до аддитивной константы?

При потере обучения используется только разница между выбранными и отклоненными вознаграждениями, поэтому сдвиг всех оценок на одну и ту же константу оставляет потери неизменными; абсолютный масштаб произволен.

Какова стандартная потеря при одном сравнении предпочтений при моделировании вознаграждения?

Отрицательное логарифмическое правдоподобие Брэдли-Терри сводится к минус логарифм-сигмовидной разницы между выбранным и отклоненным вознаграждением, повышая вознаграждение за выбранный ответ.

Какой метод пропускает отдельную модель вознаграждения, оптимизируя цель Брэдли-Терри непосредственно в политике?

DPO переформулирует цель предпочтения Брэдли-Терри, чтобы ее можно было применять непосредственно к модели политики, устраняя необходимость обучения и запроса отдельной модели вознаграждения.