Език AI РЪКОВОДСТВО

Директна оптимизация на предпочитанията

Директната оптимизация на предпочитанията (DPO) е начин за привеждане в съответствие на езиковите модели с човешките предпочитания, без да се обучава отделен модел на възнаграждение или да се изпълнява обучение за подсилване.

2 min readПоследна актуализация

Преглед

It collapses a complex multi-stage pipeline into a single, stable training loss.

Дълбоко гмуркане

DPO, въведен от Рафаилов и колеги от Станфорд през 2023 г., преосмисля как учим модел какво предпочитат хората. Традиционният подход (RLHF) обучава модел на възнаграждение върху човешки сравнения, след което използва обучение за подсилване, за да увеличи максимално тази награда. Ключовото прозрение на DPO е математическо: оптималната политика при тази цел на RLHF има връзка в затворена форма с наградата, така че можете да пренаредите уравненията и да оптимизирате езиковия модел директно върху двойки предпочитания. Вие му давате подкана, „избран“ (предпочитан) отговор и „отхвърлен“ отговор, а проста загуба в стил на класификация подтиква модела да направи избрания отговор относително по-вероятен. Без модел на възнаграждение, без цикъл на вземане на проби, без хакване на награди. Тя е много по-проста и по-стабилна за работа.

Техническа информация

DPO използва двоична кръстосана загуба на ентропия спрямо двойки предпочитания. Той увеличава коефициента на логаритмична вероятност на избрания отговор спрямо отхвърления, като всеки се измерва спрямо замразен референтен модел (обикновено наблюдаваната и фино настроена начална точка). Температурен параметър бета контролира колко далеч политиката може да се отклони от тази референция, имплицитно налагайки KL ограничението, което RLHF прилага изрично. Наградата никога не се материализира; това е имплицитно в собствените логаритмични вероятности на политиката.

Стратегическо въздействие

Speed and scale

Езиковите работни процеси могат да се движат по-бързо, без да се жертва последователността.

Access and reach

Той разширява достъпа между езици и стилове на комуникация.

Clearer decisions

Екипите могат да отделят повече време за преценка, докато автоматизацията се справя с повторението.

Бъдещето на директната оптимизация на предпочитанията

DPO се превърна в метод за подравняване по подразбиране, тъй като е евтин и възпроизводим, и породи семейство от варианти: IPO коригира пренастройването на почти детерминистични предпочитания, KTO се учи от единични добри или лоши етикети вместо двойки, а ORPO сгъва обучението за предпочитания във фина настройка без референтен модел. Очаквайте продължаване на работата по комбинирането на DPO с данни в съответствие с правилата и обезсърчаване на дължина/качество, стесняване на оставащата празнина с пълен онлайн RLHF.

Внедряване в реалния свят

Фина настройка на отворени модели за чат като Zephyr и много производни на Llama и Mistral, които бяха приведени в съответствие с DPO на набори от данни за предпочитания

Намаляване на вредните или безполезни резултати с помощта на двойки, където безопасният, полезен отговор е „избран“ пред проблемния

Обучение на асистент за кодиране да предпочита правилни, добре документирани решения пред такива с грешки, като използва сравнения, оценени от разработчици

Настройване на стила на обобщаване, така че моделите да предпочитат кратки, верни резюмета пред многословни или халюцинирани такива

Рискове и предпазни огради

Халюцинираните факти могат тихо да влязат в отчети, потоци за поддръжка или резултати от изследвания.

Бързата чувствителност може да създаде противоречиви резултати при подобни заявки.

Чувствителните текстови данни могат да бъдат разкрити, ако контролите за достъп са слаби.

Пътна карта за изпълнение

1

Определете изходен формат, тон и стандарти за качество преди внедряване.

2

Наземни отговори с доверени източници винаги, когато точността има значение.

3

Поддържайте контролна точка за човешки преглед за изходи с високи залози.

4

Проследявайте моделите на неуспехи и редовно обучавайте подкани или работни потоци.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Direct Preference Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Оптимизиране на предпочитанията за съотношение на шансовете

Frequently asked questions

What is Direct Preference Optimization?

Директната оптимизация на предпочитанията (DPO) е начин за привеждане в съответствие на езиковите модели с човешките предпочитания, без да се обучава отделен модел на възнаграждение или да се изпълнява обучение за подсилване. Той срива сложен многоетапен тръбопровод в единична, стабилна тренировъчна загуба.

Какво елиминира DPO в сравнение с традиционния RLHF?

Основното предимство на DPO е премахването на изричния модел на възнаграждение и цикъла на вземане на проби от RL, като вместо това оптимизира политиката директно върху двойки предпочитания.

От какви данни се състои един пример за обучение на DPO?

DPO обучава по двойки предпочитания: подкана плюс един предпочитан („избран“) и един непредпочитан („отхвърлен“) отговор.

Каква роля играе референтният модел в DPO?

Замразената референция (обикновено моделът SFT) закотвя загубата; бета параметърът контролира колко далеч обучената политика може да се отдалечи от него.

В DPO къде е представена „наградата“?

Изводът на DPO показва, че възнаграждението е имплицитно в съотношението на логаритмичната вероятност между политиката и справката, така че не е необходим изричен модел на възнаграждение.

Какво управлява параметърът бета (температура) в DPO?

Бета управлява имплицитното KL ограничение: по-високата бета поддържа политиката по-близо до референтната, по-ниската бета позволява повече отклонения.