Техническо РЪКОВОДСТВО

Подсилване на обучението от човешка обратна връзка

RLHF е техниката, която превръща необработен езиков модел в полезен, учтив помощник, като го обучава на човешки предпочитания.

2 min readПоследна актуализация

Преглед

It matters because it aligns model behavior with what people actually want, not just what is statistically likely.

Дълбоко гмуркане

Предварително обучен езиков модел предвижда правдоподобен текст, но правдоподобният не е същият като полезен, честен или безопасен. RLHF коригира това на етапи. Първо, контролираната фина настройка учи модела да следва инструкции, използвайки написани от човека примерни отговори. След това хората сравняват двойки модели отговори на една и съща подкана и избират по-добрия; тези сравнения обучават отделен модел на възнаграждение, който оценява всеки отговор. И накрая, езиковият модел е оптимизиран с обучение за подсилване, за да произвежда отговори, които моделът за възнаграждение оценява високо. Наказанието го предпазва от отклонение твърде далеч от оригиналния модел, така че да остане гладко и да не използва странностите на модела за възнаграждение. RLHF беше в основата на превръщането на използваемите асистенти в стил ChatGPT.

Техническа информация

Моделът на възнаграждението обикновено се обучава върху двойки предпочитания със загуба в стил Брадли-Тери, като се научава да дава на предпочитания от човека отговор по-висок скаларен резултат. След това политиката се актуализира с PPO (проксимална оптимизация на политика), която максимизира възнаграждението, докато наказанието за KL-дивергенция спрямо референтния модел предотвратява свръхоптимизирането и „хакването на възнагражденията“. Тъй като PPO е труден, по-новите методи като DPO (директна оптимизация на предпочитанията) пропускат изричния модел на възнаграждение и цикъла на подсилване, оптимизирайки политиката директно от двойки предпочитания.

Стратегическо въздействие

Cost and budget

Архитектурните решения стимулират производителността и оперативните разходи в продължение на години.

Clearer decisions

Техническото образование помага на екипите да изберат правилния стек, а не само най-новия.

Quality control

По-добрият инженерен избор намалява инцидентите, свързани с надеждността в производството.

Бъдещето на обучението за подсилване от човешката обратна връзка

RLHF се рационализира и частично автоматизира. DPO и свързаните с него методи за директни предпочитания заменят тежкия PPO тръбопровод за много екипи, а RLAIF използва обратна връзка, генерирана от AI (както в Конституционния AI), за да намали разходите за етикетиране. Изследванията се занимават с хакването на възнагражденията, пристрастията на анотаторите и трудността да се преценяват дългите или експертни отговори с техники като надзор на процеса и дебат. Очаквайте подравняване, което да съчетава човешка и AI обратна връзка, по-богати сигнали за възнаграждение отвъд едно вдигане на палец нагоре и нарастващ контрол върху това кой предоставя предпочитанията и какви ценности кодират.

Внедряване в реалния свят

Настройване на асистент за чат, така че да отказва вредни заявки и да дава полезни, добре структурирани отговори, а не просто правдоподобен текст.

Класиране на двойки резюмета по човешки предпочитания, за да се обучи модел, който пише резюмета, които хората наистина намират за полезни.

Намаляване на токсичните или предубедени резултати чрез възнаграждаване на отговорите, които човешките оценители оценяват като уважителни и безопасни.

Използване на DPO върху набор от данни за предпочитани срещу отхвърлени отговори за подравняване на модел с отворен код, без да се изпълнява пълен PPO цикъл.

Рискове и предпазни огради

Оптимизирането на един бенчмарк може да скрие по-широки системни слабости.

Разходите за инфраструктура и поддръжка често се подценяват.

Пропуските в сигурността и видимостта могат да нарастват, когато системите стават по-сложни.

Пътна карта за изпълнение

1

Определете целите за латентност, качество и разходи преди внедряването.

2

Бенчмарк при реалистични условия на натоварване и данни.

3

Мониторинг на инструмента за грешки, отклонение и въздействие върху потребителя.

4

Подгответе пътеките за връщане назад и реакция на инцидент преди мащабиране.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Reinforcement Learning From Human Feedback quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Обучение с подсилване

Frequently asked questions

What is Reinforcement Learning From Human Feedback?

RLHF е техниката, която превръща необработен езиков модел в полезен, учтив помощник, като го обучава на човешки предпочитания. Има значение, защото привежда поведението на модела в съответствие с това, което хората действително искат, а не само това, което е статистически вероятно.

Каква е основната цел на RLHF за езиков модел?

RLHF насочва модела към отговорите, които хората предпочитат, което го прави по-полезен, честен и безопасен, а не просто правдоподобен.

Какво всъщност се научава да прави моделът на възнаграждение в RLHF?

Моделът на възнаграждението се обучава на сравнения на човешки предпочитания, за да оценява отговорите, предоставяйки сигнала, спрямо който политиката оптимизира.

Защо по време на стъпката RL се използва наказание за KL-дивергенция спрямо оригиналния модел?

Наказанието за KL поддържа оптимизираната политика близо до референтния модел, предпазвайки от хакване на награди и загуба на плавност.

Как обикновено се събират данните за предпочитанията за модела на възнаграждение?

Анотаторите избират предпочитания отговор при сравнения по двойки, което обучава модела на възнаграждение чрез загуба в стил Брадли-Тери.

Какво предимство предлага DPO (Direct Preference Optimization) пред класическия RLHF тръбопровод?

DPO извлича целта директно от предпочитанията, като избягва отделния модел на възнаграждение и неудобната стъпка на обучение за подсилване.