Език AI РЪКОВОДСТВО

Оптимизиране на предпочитанията за съотношение на шансовете

Оптимизацията на предпочитанията за съотношение на коефициентите (ORPO) е метод за фина настройка, който учи езиков модел на добро поведение и човешки предпочитания в едно обучение.

2 min readПоследна актуализация

Преглед

It matters because it skips the usual separate reward model and reference model, making alignment cheaper and simpler.

Дълбоко гмуркане

ORPO, въведен от Хонг, Лий и Торн през 2024 г., съчетава контролирана фина настройка и подравняване на предпочитанията в една стъпка. Повечето тръбопроводи за подравняване първо правят SFT на добри примери, след което изпълняват втори метод като RLHF или DPO, който изисква замразено копие на модела (референция) плюс съхранени двойки предпочитания. ORPO премахва изцяло референтния модел. Загубата му добавя наказателен срок към стандартната цел за следващ жетон: повишава шансовете, които моделът присвоява на избрания (предпочитан) отговор, като същевременно намалява шансовете за отхвърления. Тъй като използва съотношението на шансовете, а не силна разлика в логаритмичните вероятности, наказанието е нежно, така че моделът се научава да предпочита добрите отговори, без катастрофално да забравя плавното генериране.

Техническа информация

Загубата на ORPO е SFT крос-ентропийна загуба плюс претеглен логаритмичен сигмоид на съотношението на логаритмичните шансове между избраните и отхвърлените отговори. Шансовете са равни на p/(1-p), така че съотношението сравнява колко по-вероятно е моделът да намери добрия отговор спрямо лошия. Използването на коефициенти вместо сурова вероятност запазва контраста мек, което предотвратява прекомерното потискане на отхвърлени токени, което може да влоши нереферентния модел.

Стратегическо въздействие

Speed and scale

Езиковите работни процеси могат да се движат по-бързо, без да се жертва последователността.

Access and reach

Той разширява достъпа между езици и стилове на комуникация.

Clearer decisions

Екипите могат да отделят повече време за преценка, докато автоматизацията се справя с повторението.

Бъдещето на оптимизацията на предпочитанията за коефициенти

ORPO набира популярност, защото съкращава паметта и изчисленията чрез премахване на референтния модел, което е привлекателно за екипи, извършващи фина настройка на ограничен хардуер. Очаквайте да се появява по-често в рецепти с отворен код и като опция по подразбиране в библиотеки като Hugging Face TRL. Бъдещата работа вероятно ще настрои ламбда претеглянето автоматично, ще смеси ORPO с други цели без референции и ще го разшири до мултимодални и много големи модели, където поддържането на две копия в паметта е скъпо.

Внедряване в реалния свят

Фина настройка на 7B чат модел с отворен код върху двойки предпочитания без зареждане на второ референтно копие, намаляване наполовина на GPU паметта

Стартъп, който насочва асистента за поддръжка на клиенти да предпочита учтиви отговори в съответствие с правилата в едно обучение вместо SFT-then-DPO

Изследователи, сравняващи ORPO срещу DPO на същия набор от данни, за да покажат сравнимо съответствие с по-ниски изчисления

Адаптиране на базов модел към специализирана област (напр. изготвяне на правни документи), където са налични двойки добри и лоши примери, но бюджетът за модел на възнаграждение не е

Рискове и предпазни огради

Халюцинираните факти могат тихо да влязат в отчети, потоци за поддръжка или резултати от изследвания.

Бързата чувствителност може да създаде противоречиви резултати при подобни заявки.

Чувствителните текстови данни могат да бъдат разкрити, ако контролите за достъп са слаби.

Пътна карта за изпълнение

1

Определете изходен формат, тон и стандарти за качество преди внедряване.

2

Наземни отговори с доверени източници винаги, когато точността има значение.

3

Поддържайте контролна точка за човешки преглед за изходи с високи залози.

4

Проследявайте моделите на неуспехи и редовно обучавайте подкани или работни потоци.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Odds Ratio Preference Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Директна оптимизация на предпочитанията

Frequently asked questions

What is Odds Ratio Preference Optimization?

Оптимизацията на предпочитанията за съотношение на коефициентите (ORPO) е метод за фина настройка, който учи езиков модел на добро поведение и човешки предпочитания в едно обучение. Има значение, защото пропуска обичайния отделен модел на възнаграждение и референтния модел, което прави подравняването по-евтино и по-лесно.

Кое е основното практическо предимство на ORPO пред методи като DPO?

ORPO сгъва научаването на предпочитанията в загубата на SFT и не се нуждае от замразено референтно копие на модела, спестявайки памет и изчисления.

Какво сравнява „съотношението на шансовете“ в ORPO?

ORPO използва съотношението на шансовете (p/(1-p)), което моделът присвоява на предпочитания отговор спрямо непредпочитания.

Кои две задачи изпълнява ORPO в едно обучение?

ORPO комбинира стандартната SFT цел за следващ токен с наказание за предпочитание в една унифицирана загуба.

Защо ORPO използва коефициенти, а не необработена лог-вероятностна разлика за наказанието?

Базираното на коефициентите наказание е по-меко, като помага на нереферентния модел да поддържа плавно генериране, като същевременно предпочита добри отговори.

Загубата на ORPO е най-добре описана като коя комбинация?

ORPO добавя претеглен термин за логаритмично сигмоидно съотношение на коефициентите върху контролираната загуба на кръстосана ентропия.