ПОСІБНИК З ОСНОВ

Моделювання винагород Бредлі-Террі

Модель Бредлі-Террі — це столітній статистичний метод для перетворення парних порівнянь (A краще B) у числові оцінки.

2 хвилини читанняОстаннє оновлення

Огляд

In modern AI it powers reward models that learn human preferences from 'which answer is better?' labels, the backbone of RLHF.

Глибоке занурення

Бредлі-Террі, введений у 1952 році, припускає, що кожен предмет має приховану оцінку сили, а ймовірність того, що предмет А перевершить елемент Б, є логістичною функцією різниці їх балів. У вирівнюванні штучного інтелекту це чітко відображається на даних про переваги: ​​люди, які ставлять етикетки, бачать дві моделі відповідей і обирають кращу, замість того, щоб давати абсолютні оцінки, які важко відкалібрувати. Модель винагороди, як правило, мовна модель зі скалярною головкою виведення, навчена таким чином, щоб відповідь, якій віддають перевагу люди, отримувала вищу скалярну винагороду. Втрата — це негативна логарифмічна ймовірність імовірності Бредлі-Террі: максимізуйте логарифм сигмоїди (винагорода обраного мінус винагорода відхиленого). Отримана модель винагороди потім оцінює довільні результати, надаючи сигнал, проти якого оптимізують алгоритми навчання з підкріпленням, такі як PPO, щоб зробити моделі більш корисними та узгодженими.

Технічне розуміння

Втрати навчання для порівняння просто мінус логарифм-сигмоід (r_chosen − r_rejected), тому модель вивчає лише відносні відмінності. Це означає, що винагороди можна ідентифікувати лише до адитивної константи; абсолютний масштаб довільний. Оскільки порівняння легше та послідовніше для людей, ніж оцінки 1 до 10, дані Бредлі-Террі менш шумні. Пізніше пряма оптимізація переваг показала, що можна пропустити окрему модель винагороди та оптимізувати ціль Бредлі-Террі безпосередньо в політиці.

Стратегічний вплив

Чіткіші рішення

Це допоможе вам відокремити чіткі технічні заяви від маркетингової мови.

Вартість і бюджет

Перш ніж витрачати гроші чи час, ви можете задати питання про кращу реалізацію.

Команда та робочий процес

Команди зі спільним розумінням приймають кращі рішення щодо продуктів, політики та навчання.

Майбутнє винагородного моделювання Бредлі-Террі

Бредлі-Террі припускає єдиний послідовний рейтинг і транзитивні уподобання, які руйнуються, коли люди не погоджуються або уподобання змінюються. Дослідження просуваються до моделей, які фіксують розподіл уподобань, багатовимірні винагороди (корисність, безпека, чесність, які оцінюються окремо), і такі методи, як навчання Неша на основі відгуків людей, які відкидають припущення про єдиний бал. DPO та його варіанти все більше включають мету Бредлі-Террі безпосередньо в політичне навчання. Очікуйте більш багатих схем порівняння, включаючи ранжування більше ніж двох елементів і зважені на впевненість переваги, щоб зменшити хакерство винагороди.

Реалізація в реальному світі

Навчання моделі винагороди в RLHF, яка ранжує відповіді двох чат-ботів і подає сигнал кращий-гірший для точного налаштування PPO.

Пряма оптимізація переваг точно налаштовує модель безпосередньо на парах відповідей обраний проти відхилених за допомогою логарифмічної сигмоїдної втрати Бредлі-Террі.

Рейтинг гравців у шахи чи кіберспорт за допомогою Elo, який математично є близьким кузеном моделі Бредлі-Террі щодо результатів гри.

Створення рейтингу рекомендацій щодо вмісту на основі даних про кліки «користувачі віддають перевагу А, а не Б», а не абсолютних рейтингів.

Ризики та огорожі

Різні команди можуть використовувати той самий термін по-різному, тому визначте обсяг завчасно.

Порівняльні показники можуть виглядати сильними, тоді як продуктивність у реальному світі нерівномірна.

Ігнорування якості даних і планів оцінки часто призводить до нестабільних результатів.

Дорожня карта впровадження

1

Почніть із простого визначення необхідного результату.

2

Перед тестуванням виберіть одну метрику успіху та одну умову невдачі.

3

Запустіть невеликий пілот із репрезентативними даними, а не відшліфованим демонстраційним набором.

4

Задокументуйте, де моделювання винагород Бредлі-Террі допомагає, а де простіші методи кращі.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Bradley-Terry Reward Modeling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Моделювання винагороди

Часті запитання

What is Bradley-Terry Reward Modeling?

Модель Бредлі-Террі — це столітній статистичний метод для перетворення парних порівнянь (A краще B) у числові оцінки. У сучасному штучному інтелекті він керує моделями винагороди, які вивчають людські вподобання з «яка відповідь краща?» етикетки, кістяк RLHF.

Що модель Бредлі-Террі перетворює на числові оцінки?

Бредлі-Террі проводить попарне порівняння «А перевершує В» і робить висновок про приховану оцінку сили для кожного елемента, тому він так добре відповідає маркуванню людських переваг.

У Бредлі-Террі ймовірність того, що А перевершить В, є функцією чого?

Модель встановлює P(A перевершує B), що дорівнює логістиці (сигмоіду) різниці між прихованими показниками сили A і B.

Чому винагороди Бредлі-Террі можна ідентифікувати лише з точністю до адитивної константи?

Втрата при навчанні використовує лише різницю між вибраною та відхиленою винагородою, тому зсув усіх оцінок на ту саму константу залишає втрату незмінною; абсолютний масштаб довільний.

Яка стандартна втрата для одного порівняння переваг у моделюванні винагороди?

Від’ємна логарифмічна правдоподібність Бредлі-Террі зменшується до мінус логарифмічної сигмоіди різниці винагороди обраний-мінус-відхилений, підвищуючи винагороду обраної відповіді.

Який метод пропускає окрему модель винагороди, оптимізуючи ціль Бредлі-Террі безпосередньо в полісі?

DPO переформулює мету переваг Бредлі-Террі, щоб її можна було застосувати безпосередньо до моделі політики, усуваючи потребу в навчанні та запитах автономної моделі винагороди.