Nyelvi AI ÚTMUTATÓ

Közvetlen preferenciaoptimalizálás

A Direct Preference Optimization (DPO) egy módja annak, hogy a nyelvi modelleket az emberi preferenciákhoz igazítsák anélkül, hogy külön jutalmazási modellt tanítanának vagy megerősítő tanulást futtatnának.

2 perc olvasásUtoljára frissítve

Áttekintés

It collapses a complex multi-stage pipeline into a single, stable training loss.

Mély merülés

Az adatvédelmi tisztviselő, amelyet Rafailov és munkatársai mutattak be 2023-ban a Stanfordon, újragondolja, hogyan tanítsuk meg egy modellnek azt, amit az emberek preferálnak. A hagyományos megközelítés (RLHF) egy jutalmazási modellt dolgoz ki az emberi összehasonlítások alapján, majd megerősítő tanulást alkalmaz a jutalom maximalizálása érdekében. Az adatvédelmi tisztviselő kulcsfontosságú meglátása matematikai: az RLHF célkitűzés szerinti optimális irányelv zárt formában kapcsolódik a jutalomhoz, így átrendezheti az egyenleteket és optimalizálhatja a nyelvi modellt közvetlenül a preferenciapárokon. Adsz neki egy felszólítást, egy „választott” (preferált) és egy „elutasított” választ, és egy egyszerű osztályozási stílusú veszteség megbökteti a modellt, hogy a választott válasz relatíve valószínűbb legyen. Nincs jutalommodell, nincs mintavételi hurok, nincs jutalom-hackelés. Sokkal egyszerűbb és stabilabb a futása.

Technikai betekintés

Az adatvédelmi tisztviselő bináris keresztentrópia veszteséget használ a preferenciapárokhoz képest. Növeli a választott válasz log-valószínűségi arányát az elutasítotthoz képest, mindegyiket egy befagyasztott referenciamodellhez (általában a felügyelt-finomhangolt kiindulási ponthoz) mérve. A hőmérséklet-paraméter béta azt szabályozza, hogy a házirend milyen messzire távolodhat el ettől a referenciától, implicit módon kényszerítve az RLHF által kifejezetten alkalmazott KL-korlátozást. A jutalom soha nem valósul meg; ez benne van a politika saját log-valószínűségeiben.

Stratégiai hatás

Sebesség és méretarány

A nyelvi munkafolyamatok gyorsabban haladhatnak a következetesség feláldozása nélkül.

Hozzáférés és elérés

Kibővíti a hozzáférést a nyelvek és a kommunikációs stílusok között.

Tisztább döntések

A csapatok több időt tölthetnek az ítélkezéssel, míg az automatizálás kezeli az ismétlést.

A közvetlen preferenciaoptimalizálás jövője

A DPO alapértelmezett igazítási módszerré vált, mivel olcsó és reprodukálható, és változatok családját hozta létre: az IPO a túlillesztést szinte determinisztikus preferenciákon javítja, a KTO párok helyett egyetlen jó vagy rossz címkékből tanul, az ORPO pedig referenciamodell nélkül finomhangolássá teszi a preferenciák tanulását. Várhatóan további munka az adatvédelmi tisztviselőnek az irányelvekre vonatkozó adatokkal és a hossz/minőség torzítással való kombinálásán, csökkentve a fennmaradó szakadékot a teljes online RLHF-el.

Valós megvalósítás

A nyitott súlyú csevegési modellek finomhangolása, mint például a Zephyr és számos Llama és Mistral származék, amelyeket a preferencia adatkészleteken az adatvédelmi tisztviselőhöz igazítottak

A káros vagy nem hasznos kimenetek csökkentése olyan párok használatával, ahol a biztonságos, hasznos választ „választják” a problémás válasz helyett

A kódoló asszisztens megtanítása arra, hogy előnyben részesítse a helyes, jól dokumentált megoldásokat a hibás megoldásokkal szemben, fejlesztői értékelések segítségével

Hangolja az összefoglaló stílust, hogy a modellek előnyben részesítsék a tömör, hű összefoglalókat a bőbeszédű vagy hallucinált összefoglalásokkal szemben

Kockázatok és védőkorlátok

A hallucinált tények csendben bekerülhetnek a jelentésekbe, a támogatási folyamatokba vagy a kutatási eredményekbe.

Az azonnali érzékenység inkonzisztens eredményeket eredményezhet a hasonló kérések között.

Ha a hozzáférés-szabályozás gyenge, az érzékeny szöveges adatok megjelenhetnek.

Végrehajtási ütemterv

1

A kiadás előtt határozza meg a kimeneti formátumot, hangszínt és minőségi szabványokat.

2

Földelje a válaszokat megbízható forrásokból, amikor a pontosság számít.

3

Tartson emberi ellenőrzési pontot a nagy tétű kimenetekhez.

4

Kövesse nyomon a meghibásodási mintákat, és rendszeresen tanítsa át az utasításokat vagy a munkafolyamatokat.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Direct Preference Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Odds Arány Preferencia Optimalizálás

Gyakran ismételt kérdések

What is Direct Preference Optimization?

A Direct Preference Optimization (DPO) egy módja annak, hogy a nyelvi modelleket az emberi preferenciákhoz igazítsák anélkül, hogy külön jutalmazási modellt tanítanának vagy megerősítő tanulást futtatnának. Egy összetett többlépcsős csővezetéket egyetlen, stabil edzésveszteséggé omlik össze.

Mit szüntet meg az adatvédelmi tisztviselő a hagyományos RLHF-hez képest?

Az adatvédelmi tisztviselő fő előnye az explicit jutalmazási modell és az RL mintavételezési hurok eltávolítása, ehelyett közvetlenül a preferenciapárokra optimalizálva a házirendet.

Milyen adatokból áll egyetlen DPO képzési példa?

Az adatvédelmi tisztviselők preferenciapárokra vonatoznak: prompt plusz egy preferált ('választott') és egy nem preferált ('elutasított') válasz.

Milyen szerepet játszik a referenciamodell az adatvédelmi tisztviselőben?

Egy befagyasztott referencia (általában az SFT modell) rögzíti a veszteséget; a béta paraméter szabályozza, hogy a betanított házirend meddig tud elmozdulni tőle.

Az adatvédelmi tisztviselőben hol jelenik meg a „jutalom”?

Az adatvédelmi tisztviselő levezetése azt mutatja, hogy a jutalom implicit módon benne van az irányelv és a referencia közötti log-valószínűségi arányban, így nincs szükség explicit jutalmazási modellre.

Mit szabályoz a DPO béta (hőmérséklet) paramétere?

A béta szabályozza az implicit KL-korlátozást: a magasabb béta értéke közelebb tartja a házirendet a referenciához, az alacsonyabb béta pedig nagyobb eltérést tesz lehetővé.