GHID AI limbaj

Optimizarea directă a preferințelor

Optimizarea directă a preferințelor (DPO) este o modalitate de a alinia modelele lingvistice cu preferințele umane fără a antrena un model de recompensă separat sau a rula învățarea prin întărire.

2 minute de lecturăUltima actualizare

Prezentare generală

It collapses a complex multi-stage pipeline into a single, stable training loss.

Scufundare în profunzime

DPO, introdus de Rafailov și colegii de la Stanford în 2023, regândește modul în care învățăm un model ceea ce preferă oamenii. Abordarea tradițională (RLHF) antrenează un model de recompensă pe comparații umane, apoi folosește învățarea prin întărire pentru a maximiza acea recompensă. Perspectiva cheie a DPO este matematică: politica optimă în cadrul acelui obiectiv RLHF are o relație de formă închisă cu recompensă, astfel încât să puteți rearanja ecuațiile și să optimizați modelul lingvistic direct pe perechile de preferințe. Îi oferiți un prompt, un răspuns „ales” (preferat) și un răspuns „respins”, iar o pierdere simplă în stil de clasificare determină modelul pentru a face răspunsul ales relativ mai probabil. Fără model de recompensă, fără buclă de eșantionare, fără hacking de recompense. Este mult mai simplu și mai stabil de rulat.

Perspectivă tehnică

DPO utilizează o pierdere de entropie încrucișată binară asupra perechilor de preferințe. Mărește raportul log-probabilitate al răspunsului ales în raport cu cel respins, fiecare măsurat față de un model de referință înghețat (de obicei punctul de pornire supravegheat-ajustat fin). Un parametru de temperatură beta controlează cât de departe se poate îndepărta politica de acea referință, impunând implicit constrângerea KL pe care RLHF o aplică în mod explicit. Recompensa nu se materializează niciodată; este implicită în log-probabilitățile proprii ale politicii.

Impact strategic

Viteză și scară

Fluxurile de lucru lingvistice se pot deplasa mai rapid fără a sacrifica consistența.

Acces și acoperire

Extinde accesul în diferite limbi și stiluri de comunicare.

Decizii mai clare

Echipele pot petrece mai mult timp jucând în timp ce automatizarea se ocupă de repetiție.

Viitorul optimizării preferințelor directe

DPO a devenit o metodă de aliniere implicită, deoarece este ieftină și reproductibilă și a dat naștere unei familii de variante: IPO remediază supraadaptarea pe preferințe aproape deterministe, KTO învață din etichete simple bune sau rele în loc de perechi, iar ORPO transformă învățarea preferințelor în reglaj fin fără model de referință. Așteptați-vă la continuarea muncii privind combinarea DPO cu datele referitoare la politică și debiasarea duratei/calității, reducând decalajul rămas cu RLHF online complet.

Implementare în lumea reală

Reglarea fină a modelelor de chat deschise, cum ar fi Zephyr și multe derivate Llama și Mistral, care au fost aliniate cu DPO pe seturi de date de preferințe

Reducerea rezultatelor dăunătoare sau inutile folosind perechi în care răspunsul sigur și util este „ales” în locul unuia problematic

Învățarea unui asistent de codificare să prefere soluțiile corecte și bine documentate față de cele cu erori, folosind comparații evaluate de dezvoltatori

Ajustați stilul de rezumare, astfel încât modelele să prefere rezumatele concise și fidele în detrimentul celor cu caracter pronunțat sau halucinat

Riscuri și balustrade

Faptele halucinate pot intra în liniște în rapoarte, fluxuri de sprijin sau rezultate ale cercetării.

Sensibilitatea promptă poate crea rezultate inconsecvente pentru solicitări similare.

Datele text sensibile pot fi expuse dacă controalele de acces sunt slabe.

Foaia de parcurs de implementare

1

Definiți formatul de ieșire, tonul și standardele de calitate înainte de lansare.

2

Răspunsurile la sol cu ​​surse de încredere ori de câte ori acuratețea contează.

3

Păstrați un punct de control uman pentru rezultate cu mize mari.

4

Urmăriți tiparele de eșec și reantrenați în mod regulat solicitările sau fluxurile de lucru.

Continuați să explorați

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Direct Preference Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz Start

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Următorul ghid

Optimizarea preferințelor raportului de cote

Întrebări frecvente

What is Direct Preference Optimization?

Optimizarea directă a preferințelor (DPO) este o modalitate de a alinia modelele lingvistice cu preferințele umane fără a antrena un model de recompensă separat sau a rula învățarea prin întărire. Prăbușește o conductă complexă în mai multe etape într-o singură pierdere de antrenament stabilă.

Ce elimină DPO în comparație cu RLHF tradițională?

Principalul avantaj al DPO este eliminarea modelului de recompensă explicit și a buclei de eșantionare RL, optimizând politica direct pe perechile de preferințe.

Din ce date constă un singur exemplu de formare DPO?

DPO se antrenează pe perechi de preferințe: un prompt plus un răspuns preferat („ales”) și unul nepreferat („respins”).

Ce rol joacă modelul de referință în DPO?

O referință înghețată (de obicei, modelul SFT) ancorează pierderea; parametrul beta controlează cât de departe se poate deplasa politica instruită de la acesta.

În DPO, unde este reprezentată „recompensa”?

Derivarea DPO arată că recompensa este implicită în raportul log-probabilitate dintre politică și referință, deci nu este necesar un model de recompensă explicit.

Ce controlează parametrul beta (temperatura) din DPO?

Beta guvernează constrângerea implicită KL: beta mai mare menține politica mai aproape de referință, beta mai mică permite mai multe abateri.