Învățare de consolidare din feedbackul uman
RLHF este tehnica care transformă un model de limbaj brut într-un asistent util și politicos, instruindu-l pe preferințele umane.
Prezentare generală
It matters because it aligns model behavior with what people actually want, not just what is statistically likely.
Scufundare în profunzime
Un model de limbaj pre-antrenat prezice text plauzibil, dar plauzibil nu este același lucru cu util, sincer sau sigur. RLHF rezolvă acest lucru în etape. În primul rând, reglarea fină supravegheată învață modelul să urmeze instrucțiuni folosind exemple de răspunsuri scrise de oameni. Apoi, oamenii compară perechi de răspunsuri model la același prompt și îl aleg pe cel mai bun; aceste comparații antrenează un model de recompensă separat care punctează orice răspuns. În cele din urmă, modelul de limbă este optimizat cu învățare prin întărire pentru a produce răspunsuri pe care modelul de recompensă este foarte apreciat. O penalizare îl împiedică să se îndepărteze prea mult de modelul original, astfel încât să rămână fluent și să nu exploateze ciudateniile modelului de recompensă. RLHF a fost esențial pentru a face utilizabili asistenții în stil ChatGPT.
Perspectivă tehnică
Modelul de recompensă este de obicei antrenat pe perechi de preferințe cu o pierdere în stilul Bradley-Terry, învățând să ofere răspunsului preferat de om un scor scalar mai mare. Politica este apoi actualizată cu PPO (Proximal Policy Optimization), care maximizează recompensa, în timp ce o penalizare de divergență KL față de modelul de referință previne supraoptimizarea și „piratarea recompensă”. Deoarece PPO este complicat, metode mai noi precum DPO (Direct Preference Optimization) omit modelul explicit de recompensă și bucla de întărire, optimizând politica direct din perechile de preferințe.
Impact strategic
Cost și buget
Deciziile de arhitectură generează performanța și costurile de operare de ani de zile.
Decizii mai clare
Educația tehnică ajută echipele să aleagă stiva potrivită, nu doar cea mai nouă.
Controlul calității
Opțiuni de inginerie mai bune reduc incidentele de fiabilitate în producție.
Viitorul învățării prin întărire din feedbackul uman
RLHF este simplificat și parțial automatizat. DPO și metodele de preferință directă aferente înlocuiesc conducta grea PPO pentru multe echipe, iar RLAIF folosește feedback-ul generat de AI (ca în AI Constituțional) pentru a reduce costurile de etichetare. Cercetarea abordează hacking-ul de recompense, părtinirea adnotatorilor și dificultatea de a judeca răspunsurile lungi sau ale experților, cu tehnici precum supravegherea procesului și dezbaterea. Așteptați-vă ca alinierea să combină feedbackul uman și AI, semnale de recompensă mai bogate dincolo de un singur degetul în sus și o analiză din ce în ce mai mare a celor care furnizează preferințele și ce valori le codifică.
Implementare în lumea reală
Reglați un asistent de chat astfel încât să refuze cererile dăunătoare și să ofere răspunsuri utile și bine structurate, mai degrabă decât doar text plauzibil.
Clasificarea perechilor de rezumate după preferința umană pentru a antrena un model care scrie rezumate pe care oamenii le consideră utile.
Reducerea rezultatelor toxice sau părtinitoare prin răsplătirea răspunsurilor pe care evaluatorii umani le consideră respectuoase și sigure.
Utilizarea DPO pe un set de date de răspunsuri preferate vs. respinse pentru a alinia un model open-source fără a rula o buclă PPO completă.
Riscuri și balustrade
Optimizarea unui punct de referință poate ascunde slăbiciunile mai largi ale sistemului.
Costurile de infrastructură și întreținere sunt adesea subestimate.
Lacunele de securitate și observabilitate pot crește pe măsură ce sistemele devin mai complexe.
Foaia de parcurs de implementare
Definiți obiectivele de latență, calitate și cost înainte de implementare.
Benchmark în condiții realiste de încărcare și date.
Monitorizarea instrumentelor pentru erori, deriva și impactul utilizatorului.
Pregătiți căile de retragere și răspuns la incident înainte de scalare.
Continuați să explorați
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Reinforcement Learning From Human Feedback quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Următorul ghid
Învățare prin întărire
Întrebări frecvente
What is Reinforcement Learning From Human Feedback?
RLHF este tehnica care transformă un model de limbaj brut într-un asistent util și politicos, instruindu-l pe preferințele umane. Contează pentru că aliniază comportamentul modelului cu ceea ce își doresc oamenii de fapt, nu doar cu ceea ce este probabil statistic.
Care este scopul principal al RLHF pentru un model de limbă?
RLHF orientează un model către răspunsurile pe care oamenii le preferă, făcându-l mai util, onest și sigur, mai degrabă decât pur și simplu plauzibil.
Ce învață de fapt să facă modelul de recompensă din RLHF?
Modelul de recompensă este antrenat pe comparații ale preferințelor umane pentru a nota răspunsurile, oferind semnalul pe care politica se optimizează.
De ce este folosită o penalizare de divergență KL față de modelul original în timpul pasului RL?
Penalizarea KL menține politica optimizată aproape de modelul de referință, protejând împotriva hackingului de recompense și a pierderii fluenței.
Cum sunt colectate de obicei datele despre preferințe pentru modelul de recompensă?
Adnotatorii aleg răspunsul preferat în comparații în perechi, care antrenează modelul de recompensă printr-o pierdere în stil Bradley-Terry.
Ce avantaj oferă DPO (Direct Preference Optimization) față de conducta clasică RLHF?
DPO derivă obiectivul direct din preferințe, evitând modelul de recompensă separat și pasul dificil de învățare prin întărire.