GHID AI limbaj

Reglaj fin de eșantionare de respingere

Rejection Sampling Fine-Tuning (RFT) generează multe răspunsuri candidate, le păstrează doar pe cele cu cel mai bun punctaj și reantrenează modelul pe acei câștigători.

2 minute de lecturăUltima actualizare

Prezentare generală

Este important pentru că oferă o mare parte din beneficiile RLHF folosind învățarea supervizată simplă în loc de învățare complexă de întărire.

Scufundare în profunzime

Reglajul fin de eșantionare de respingere, denumit uneori reglajul fin cel mai bun din N, este un ingredient cheie în modul în care au fost aliniate modele precum Llama 2 și Llama 3 de la Meta. Rețeta este simplă: pentru fiecare prompt, eșantionați mai multe răspunsuri (să zicem de la 4 la 64) din modelul curent, punctați fiecare cu un model de recompensă sau un verificator automat, apoi eliminați („respinge”) toate rezultatele, cu excepția celor de top. Mostrele de înaltă calitate care au supraviețuit devin un set de date proaspăt supravegheat de reglare fină, iar modelul este antrenat pe ele cu o pierdere obișnuită de următor token. Repetarea acestei bucle determină în mod iterativ modelul să genereze singur răspunsuri mai bune. Deoarece modelul învață din propriile sale ieșiri filtrate, RFT evită instabilitatea și durerile de cap de reglare ale RL cu gradient de politică, utilizând totuși un semnal de recompensă.

Perspectivă tehnică

RFT exploatează faptul că eșantionarea de mai multe ori și păstrarea răspunsului de recompensă maximă aproximează alegerea dintr-o distribuție clară, de calitate superioară. Antrenamentul pe acești câștigători prin intermediul entropiei încrucișate standard distilează în mod eficient acel comportament cel mai bun din N înapoi în rezultatele unui singur eșantion ale modelului. Pentru domenii verificabile, cum ar fi matematica sau codul, „recompensa” poate fi pur și simplu dacă răspunsul final sau testul unitar trece, eliminând în totalitate necesitatea unui model de recompensă învățat.

Impact strategic

Viteză și scară

Fluxurile de lucru lingvistice se pot deplasa mai rapid fără a sacrifica consistența.

Acces și acoperire

Extinde accesul în diferite limbi și stiluri de comunicare.

Decizii mai clare

Echipele pot petrece mai mult timp jucând în timp ce automatizarea se ocupă de repetiție.

Viitorul reglajului fin al eșantionării de respingere

RFT este esențial pentru post-training modern, adesea folosit înainte sau alături de metodele RL precum PPO și DPO. Atractia sa crește cu inferențe ieftine și verificatoare automate puternice: pe măsură ce modelele devin mai bune la auto-generare și auto-verificare, eșantionarea repetată de respingere acceptă buclele de date sintetice și de auto-îmbunătățire. Așteptați-vă la o integrare mai strânsă cu modele de raționament care produc lanțuri de gândire verificabile și la un studiu continuu despre cum să evitați hacking-ul recompenselor și colapsul diversității atunci când vă antrenați în mod repetat pe propriile rezultate ale unui model.

Implementare în lumea reală

Alinierea modelelor în stil lama prin eșantionarea mai multor răspunsuri per prompt, păstrând cele mai mari scoruri ale modelului de recompensă, apoi SFT pe acelea

Îmbunătățirea unui rezolvator de matematică prin generarea mai multor soluții și păstrarea doar a celor care ajung la răspunsul corect, verificabil

Generarea de cod în care candidații sunt păstrați numai dacă trec testele unitare, apoi sunt utilizați ca date de instruire

Construirea de seturi de date de instrucțiuni sintetice prin filtrarea celor mai bune răspunsuri autogenerate ale unui model pentru următoarea rundă de antrenament

Riscuri și balustrade

Faptele halucinate pot intra în liniște în rapoarte, fluxuri de sprijin sau rezultate ale cercetării.

Sensibilitatea promptă poate crea rezultate inconsecvente pentru solicitări similare.

Datele text sensibile pot fi expuse dacă controalele de acces sunt slabe.

Foaia de parcurs de implementare

1

Definiți formatul de ieșire, tonul și standardele de calitate înainte de lansare.

2

Răspunsurile la sol cu ​​surse de încredere ori de câte ori acuratețea contează.

3

Păstrați un punct de control uman pentru rezultate cu mize mari.

4

Urmăriți tiparele de eșec și reantrenați în mod regulat solicitările sau fluxurile de lucru.

Continuați să explorați

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Rejection Sampling Fine-Tuning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz Start

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Următorul ghid

QLoRA și reglaj fin pe 4 biți

Întrebări frecvente

Ce este reglarea fină a eșantionării de respingere?

Rejection Sampling Fine-Tuning (RFT) generează multe răspunsuri candidate, le păstrează doar pe cele cu cel mai bun punctaj și reantrenează modelul pe acei câștigători. Este important pentru că oferă o mare parte din beneficiile RLHF folosind învățarea supervizată simplă în loc de învățare complexă de întărire.

Care este ideea de bază a reglajului fin al eșantionării de respingere?

RFT eșantionează răspunsurile multiple, filtrează pe cele cu scoruri de top și ajustează modelul pentru acești câștigători.

În domenii verificabile, cum ar fi matematica sau codul, ce poate servi drept recompensă?

Pentru sarcinile verificabile, RFT poate folosi corectitudinea exactă sau trece testele unitare, evitând un model de recompensă învățat.

Ce familie de modele a folosit eșantionarea de respingere în timpul alinierii?

Meta a descris utilizarea eșantionării de respingere ca parte a rețetei post-antrenament pentru modelele Llama 2 și Llama 3.

De ce ar putea echipele să prefere RFT în detrimentul RL cu gradient de politici, cum ar fi PPO?

RFT se reantrenează cu pierderea standard de următor token pe mostrele filtrate, ocolind dificultatea de reglare și instabilitatea metodelor de gradient de politică.

Ce face efectiv antrenamentul pe eșantioanele cu recompensă maximă?

Învățând din răspunsurile de top filtrate, modelul internalizează comportamentul de calitate superioară într-o singură generație.