Моделиране на награди
Моделът на възнаграждение е невронна мрежа, обучена да предсказва колко добър е отговорът на ИИ, действайки като автоматизиран заместител на човешката преценка.
Преглед
It is the scoring engine that makes reinforcement learning from human feedback possible at scale.
Дълбоко гмуркане
Моделирането на възнагражденията решава практически проблем: хората не могат да оценят всеки един от милионите резултати, генерирани от модела по време на обучение. Вместо това етикетиращите сравняват малък набор от отговори, като обикновено избират кой от двата отговора на една и съща подкана е по-добър. След това модел на възнаграждение се обучава на тези сравнения, за да изведе единичен скаларен резултат за всяка двойка с бърз отговор. Стандартната цел на обучението е моделът на Брадли-Тери, който превръща предпочитанията по двойки във вероятност един отговор да превъзхожда друг. Веднъж обучен, този модел на възнаграждение може евтино да оценява неограничени нови изходи, предоставяйки сигнала, който алгоритми като PPO използват за подобряване на езиковия модел. Моделите за възнаграждение също се използват повторно по време на извод за вземане на проби от най-добрия от N, където се генерират много кандидати и се връща този с най-висок резултат.
Техническа информация
Моделът на възнаграждението обикновено е моделът на базовия език с неговата глава за предсказване на токени, заменена от единичен линеен слой, който излъчва един скалар. Обучението увеличава максимално логаритмичната вероятност избраният отговор да има по-висок резултат от отхвърления: загуба = -log(sigmoid(r_chosen - r_rejected)). Има значение само относителната разлика, така че абсолютната скала е произволна. Качеството зависи от последователността на етикетите и широкото покритие на стиловете на отговор.
Стратегическо въздействие
Speed and scale
Езиковите работни процеси могат да се движат по-бързо, без да се жертва последователността.
Access and reach
Той разширява достъпа между езици и стилове на комуникация.
Clearer decisions
Екипите могат да отделят повече време за преценка, докато автоматизацията се справя с повторението.
Бъдещето на моделирането на възнагражденията
Изследванията се занимават с най-големите слабости на моделите за възнаграждение: те могат да бъдат „хакнати“ (моделите използват странности като предпочитане на дължината) и те се отклоняват от разпространението, когато политиката се подобрява. Обещаващите насоки включват модели за възнаграждение на процеса, които оценяват всяка стъпка на разсъждение, групи и оценки на несигурността, за да се противопоставят на хакване, етикети за предпочитания, генерирани от изкуствен интелект (RLAIF), и генеративни модели за възнаграждение, които създават критики и обосновки, а не голо число.
Внедряване в реалния свят
Захранване на RLHF за асистенти като ChatGPT и Claude чрез оценяване на отговорите на кандидатите по време на PPO обучение
Извадка от най-доброто от N, където модел генерира много отговори и моделът за възнаграждение избира най-доброто за потребителя
Математически и кодиращи „верификатори“ или модели за възнаграждение на процеси, които отбелязват междинни стъпки за разсъждение за подобряване на решаването на проблеми
Класиране и филтриране на синтетични данни за обучение, запазване само на поколения с висок резултат за по-нататъшна фина настройка
Рискове и предпазни огради
Халюцинираните факти могат тихо да влязат в отчети, потоци за поддръжка или резултати от изследвания.
Бързата чувствителност може да създаде противоречиви резултати при подобни заявки.
Чувствителните текстови данни могат да бъдат разкрити, ако контролите за достъп са слаби.
Пътна карта за изпълнение
Определете изходен формат, тон и стандарти за качество преди внедряване.
Наземни отговори с доверени източници винаги, когато точността има значение.
Поддържайте контролна точка за човешки преглед за изходи с високи залози.
Проследявайте моделите на неуспехи и редовно обучавайте подкани или работни потоци.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Reward Modeling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Брадли-Тери Награждаване Моделиране
Frequently asked questions
What is Reward Modeling?
Моделът на възнаграждение е невронна мрежа, обучена да предсказва колко добър е отговорът на ИИ, действайки като автоматизиран заместител на човешката преценка. Това е машината за точкуване, която прави обучението за укрепване от човешка обратна връзка възможно в мащаб.
Какъв е основният резултат от модел на възнаграждение за дадена двойка бърз отговор?
Модел на възнаграждение картографира подкана и отговор към едно скаларно число, представляващо прогнозирано качество или човешко предпочитание.
Какъв вид човешки данни се използват най-често за обучение на модели за възнаграждение?
Етикетиращите обикновено сравняват два отговора на една и съща подкана и избират по-добрия; моделът на Брадли-Тери ги превръща в скаларна награда.
Какво оптимизира загубата на стандартния модел на възнаграждение?
Загубата на Брадли-Тери, -log(sigmoid(r_chosen - r_rejected)), се интересува само от относителното подреждане, така че абсолютният мащаб е произволен.
Какво е „хакване на награди“?
Хакване на награди се случва, когато моделът намери преки пътища (като прекомерна дължина или ласкателство), които несъвършеният модел на възнаграждение оценява високо, но хората не биха.
Как моделът на възнаграждение архитектурно се извлича от езиков модел?
Един модел на възнаграждение обикновено използва повторно LM гръбнака, но заменя крайния слой с такъв, който извежда единична скаларна награда.