РЪКОВОДСТВО по основи

Брадли-Тери Награждаване Моделиране

Моделът на Брадли-Тери е вековен статистически метод за превръщане на сравнения по двойки (A бие B) в числени резултати.

2 min readПоследна актуализация

Преглед

In modern AI it powers reward models that learn human preferences from 'which answer is better?' labels, the backbone of RLHF.

Дълбоко гмуркане

Брадли-Тери, въведен през 1952 г., приема, че всеки елемент има скрит резултат за сила и вероятността елемент А да победи елемент Б е логистичната функция на тяхната разлика в резултата. При подравняването с изкуствен интелект това прецизно се съпоставя с данните за предпочитанията: етикетиращите хора виждат два отговора на модела и избират по-добрия, вместо да дават трудни за калибриране абсолютни оценки. Модел на възнаграждение, обикновено езиковият модел със скаларна изходна глава, се обучава така, че отговорът, предпочитан от хората, да получава по-висока скаларна награда. Загубата е отрицателната логаритмична вероятност на вероятността на Брадли-Тери: максимизиране на логаритмичната сигмоида на (награда на избран минус награда на отхвърлен). Полученият модел на възнаграждение след това отбелязва произволни изходи, предоставяйки сигнала, срещу който оптимизират алгоритмите за обучение за подсилване, като PPO, за да направят моделите по-полезни и подравнени.

Техническа информация

Загубата на обучение за сравнение е просто минус лог-сигмоида от (r_chosen − r_rejected), така че моделът научава само относителни разлики. Това означава, че наградите могат да бъдат идентифицирани само до адитивна константа; абсолютната скала е произволна. Тъй като сравненията са по-лесни и по-последователни за хората, отколкото резултатите от 1 до 10, данните на Брадли-Тери са по-малко шумни. Директната оптимизация на предпочитанията по-късно показа, че можете да пропуснете отделния модел на възнаграждение и да оптимизирате целта на Брадли-Тери директно в политиката.

Стратегическо въздействие

Clearer decisions

Помага ви да отделите ясните технически твърдения от маркетинговия език.

Cost and budget

Можете да задавате въпроси за по-добро внедряване, преди да харчите пари или време.

Team and workflow

Екипи със споделено разбиране вземат по-добри решения за продукти, политики и обучение.

Бъдещето на моделите за възнаграждение на Брадли-Тери

Брадли-Тери приема едно последователно класиране и преходни предпочитания, които се разпадат, когато хората не са съгласни или предпочитанията се променят. Изследванията се насочват към модели, които улавят разпределение на предпочитанията, многоизмерни награди (полезност, безопасност, честност, оценени отделно) и методи като обучението на Nash от човешка обратна връзка, които отхвърлят предположението за един резултат. DPO и неговите варианти все повече преместват целта на Брадли-Тери директно в обучението по политиката. Очаквайте по-богати схеми за сравнение, включително класиране на повече от два елемента и претеглени на доверие предпочитания, за да намалите хакването на наградите.

Внедряване в реалния свят

Обучение на модела на възнаграждение в RLHF, който класира два отговора на чатбота и подава сигнала по-добър-лош към фина настройка на PPO.

Директна оптимизация на предпочитанията, фина настройка на модел директно върху двойки отговори избрани срещу отхвърлени, използвайки логаритмична сигмоидна загуба на Брадли-Тери.

Класиране на играчи на шах или електронни спортове чрез Elo, което математически е близък братовчед на модела Брадли-Тери за резултатите от играта.

Изграждане на рейтинг за препоръки за съдържание от данни за кликване „предпочитани от потребителите A пред B“ вместо абсолютни оценки със звезди.

Рискове и предпазни огради

Различните екипи могат да използват един и същи термин по различен начин, така че дефинирайте обхвата рано.

Бенчмарковете могат да изглеждат силни, докато производителността в реалния свят е неравномерна.

Пренебрегването на качеството на данните и плановете за оценка често създава крехки резултати.

Пътна карта за изпълнение

1

Започнете с дефиниция на обикновен език за резултата, от който се нуждаете.

2

Изберете един показател за успех и едно условие за неуспех преди тестване.

3

Изпълнете малък пилотен проект с представителни данни, а не изпипан демонстрационен набор.

4

Документирайте къде помага моделирането на възнаграждението на Брадли-Тери и къде по-простите методи са по-добри.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Bradley-Terry Reward Modeling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Моделиране на награди

Frequently asked questions

What is Bradley-Terry Reward Modeling?

Моделът на Брадли-Тери е вековен статистически метод за превръщане на сравнения по двойки (A бие B) в числени резултати. В съвременния AI той захранва модели за възнаграждение, които научават човешките предпочитания от „кой отговор е по-добър?“ етикети, гръбнакът на RLHF.

Какво превръща моделът на Брадли-Тери в цифрови резултати?

Брадли-Тери прави сравнения по двойки „А побеждава Б“ и прави извод за скрит резултат за сила за всеки елемент, поради което се вписва толкова добре в етикетирането на човешките предпочитания.

В Брадли-Тери вероятността A да победи B е функция на какво?

Моделът задава P(A бие B) равно на логистичния (сигмоид) на разликата между скритите резултати за сила на A и B.

Защо наградите на Брадли-Тери могат да бъдат идентифицирани само до адитивна константа?

Загубата при обучение използва само разликата между избраните и отхвърлените награди, така че преместването на всички резултати с една и съща константа оставя загубата непроменена; абсолютната скала е произволна.

Каква е стандартната загуба за сравнение на едно предпочитание при моделиране на възнаграждение?

Отрицателната логаритмична вероятност на Брадли-Тери намалява до минус логаритмична сигмоида на разликата в наградата избрано-минус-отхвърлено, което повишава наградата на избрания отговор.

Кой метод пропуска отделен модел на възнаграждение чрез оптимизиране на целта на Брадли-Тери директно в политиката?

DPO преформулира целта на предпочитанията на Брадли-Тери, така че да може да се приложи директно към модела на политиката, премахвайки необходимостта от обучение и запитване към самостоятелен модел на възнаграждение.