Nyelvi AI ÚTMUTATÓ

Odds Arány Preferencia Optimalizálás

Az Odds Ratio Preference Optimization (ORPO) egy finomhangoló módszer, amely egyetlen edzési menetben tanítja meg a nyelvi modellt a jó viselkedésre és az emberi preferenciákra.

2 perc olvasásUtoljára frissítve

Áttekintés

It matters because it skips the usual separate reward model and reference model, making alignment cheaper and simpler.

Mély merülés

A Hong, Lee és Thorne által 2024-ben bevezetett ORPO egyetlen lépésben egyesíti a felügyelt finomhangolást és a preferenciák összehangolását. A legtöbb igazítási folyamat először SFT-t hajt végre jó példákon, majd egy második módszert, például RLHF-t vagy DPO-t futtat, amely megköveteli a modell fagyasztott másolatát (referenciát), valamint tárolt preferenciapárokat. Az ORPO teljesen eltávolítja a referenciamodellt. Ennek elvesztése büntetési tételt ad a szokásos next-token célhoz: növeli a modell által a választott (preferált) válaszhoz rendelt esélyeket, miközben lenyomja az elutasított szorzót. Mivel az esélyhányadost használja, nem pedig egy erős log-valószínűségi rést, a büntetés enyhe, így a modell megtanulja előnyben részesíteni a jó válaszokat anélkül, hogy katasztrofálisan megfeledkezne a gördülékeny generálásról.

Technikai betekintés

Az ORPO vesztesége az SFT keresztentrópia vesztesége plusz a kiválasztott és elutasított válaszok log odds arányának súlyozott log-szigmoidja. Az odds egyenlő p/(1-p), így az arány összehasonlítja, hogy a modell mennyivel nagyobb valószínűséggel találja meg a jó választ a rosszhoz képest. A nyers valószínűség helyett az esélyek használata enyhén tartja a kontrasztot, ami megakadályozza az elutasított tokenek túlzott elnyomását, ami ronthatja a nem hivatkozott modellt.

Stratégiai hatás

Sebesség és méretarány

A nyelvi munkafolyamatok gyorsabban haladhatnak a következetesség feláldozása nélkül.

Hozzáférés és elérés

Kibővíti a hozzáférést a nyelvek és a kommunikációs stílusok között.

Tisztább döntések

A csapatok több időt tölthetnek az ítélkezéssel, míg az automatizálás kezeli az ismétlést.

Az esélyhányados preferenciaoptimalizálás jövője

Az ORPO egyre nagyobb teret hódít, mert csökkenti a memóriát és a számításokat a referenciamodell elhagyásával, ami vonzó a korlátozott hardvereken finomhangoló csapatok számára. Várhatóan gyakrabban jelenik meg a nyílt forráskódú receptekben, és alapértelmezett beállításként olyan könyvtárakban, mint a Hugging Face TRL. A jövőbeni munkák valószínűleg automatikusan behangolják a lambda súlyozást, az ORPO-t más referencia-mentes objektívekkel keverik, és kiterjesztik a multimodális és nagyon nagy modellekre, ahol két másolat tárolása a memóriában költséges.

Valós megvalósítás

A nyílt forráskódú 7B csevegési modell finomhangolása preferenciapárokon a második referenciapéldány betöltése nélkül, a GPU-memória felére csökkentése

Egy induló vállalkozás, amely az ügyfélszolgálati asszisztenst az SFT-then-DPO helyett az udvarias, szabályszerű válaszokat részesíti előnyben egyetlen képzésben.

A kutatók összehasonlítják az ORPO-t a DPO-val ugyanazon az adatkészleten, hogy összehasonlítható igazodást mutassanak az alacsonyabb számítási sebességgel

Alapmodell adaptálása egy speciális területre (pl. jogi szövegezés), ahol rendelkezésre állnak jó és rossz példapárok, de a jutalommodell költségvetése nem

Kockázatok és védőkorlátok

A hallucinált tények csendben bekerülhetnek a jelentésekbe, a támogatási folyamatokba vagy a kutatási eredményekbe.

Az azonnali érzékenység inkonzisztens eredményeket eredményezhet a hasonló kérések között.

Ha a hozzáférés-szabályozás gyenge, az érzékeny szöveges adatok megjelenhetnek.

Végrehajtási ütemterv

1

A kiadás előtt határozza meg a kimeneti formátumot, hangszínt és minőségi szabványokat.

2

Földelje a válaszokat megbízható forrásokból, amikor a pontosság számít.

3

Tartson emberi ellenőrzési pontot a nagy tétű kimenetekhez.

4

Kövesse nyomon a meghibásodási mintákat, és rendszeresen tanítsa át az utasításokat vagy a munkafolyamatokat.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Odds Ratio Preference Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Közvetlen preferenciaoptimalizálás

Gyakran ismételt kérdések

What is Odds Ratio Preference Optimization?

Az Odds Ratio Preference Optimization (ORPO) egy finomhangoló módszer, amely egyetlen edzési menetben tanítja meg a nyelvi modellt a jó viselkedésre és az emberi preferenciákra. Ez azért fontos, mert kihagyja a szokásos külön jutalmazási modellt és referenciamodellt, így olcsóbb és egyszerűbb az igazítás.

Mi az ORPO fő gyakorlati előnye a DPO-hoz hasonló módszerekkel szemben?

Az ORPO a preferenciák tanulását az SFT veszteségbe hajtja, és nincs szüksége a modell lefagyott referenciapéldányára, így memóriát és számítást takarít meg.

Mihez viszonyít az ORPO-ban az esélyhányados?

Az ORPO az esélyek arányát (p/(1-p)) használja, amelyet a modell a preferált és a nem preferált válaszhoz rendel.

Az ORPO melyik két feladatot hajtja végre egy edzési menetben?

Az ORPO a szabványos SFT next-token célkitűzést a preferenciális büntetéssel kombinálja egy egységes veszteségben.

Miért használ az ORPO szorzót a nyers log-valószínűségi különbség helyett a büntetéshez?

Az odds-alapú büntetés enyhébb, segítve a nem hivatkozott modellt a gördülékeny generálás megőrzésében, miközben a jó válaszokat részesíti előnyben.

Az ORPO vesztesége melyik kombinációval írható le legjobban?

Az ORPO súlyozott log-szigmoid esélyhányados kifejezést ad hozzá a felügyelt keresztentrópia veszteséghez.