Språk AI GUIDE

Finjustering av avslagssampling

Rejection Sampling Fine-Tuning (RFT) genererar många kandidatsvar, behåller bara de som får bäst poäng och tränar om modellen på dessa vinnare.

2 min readSenast uppdaterad

Översikt

It matters because it offers much of RLHF's benefit using straightforward supervised learning instead of complex reinforcement learning.

Djupdykning

Rejection Sampling Fine-Tuning, ibland kallad best-of-N-finjustering, är en nyckelingrediens i hur modeller som Metas Llama 2 och Llama 3 anpassades. Receptet är enkelt: för varje prompt, prova flera svar (t.ex. 4 till 64) från den aktuella modellen, poängsätt var och en med en belöningsmodell eller en automatisk kontrollör och kassera ('avvisa') sedan alla utom de högst rankade utdata. De överlevande högkvalitativa proverna blir en ny övervakad finjusteringsdatauppsättning, och modellen tränas på dem med vanlig nästa token-förlust. Att upprepa denna loop iterativt knuffar modellen mot att generera bättre svar på egen hand. Eftersom modellen lär sig av sina egna filtrerade utgångar undviker RFT instabiliteten och inställningshuvudvärken från policygradient RL samtidigt som den utnyttjar en belöningssignal.

Teknisk insikt

RFT utnyttjar det faktum att sampling många gånger och bibehåller den maximala belöningsresponsen ungefärligt att välja från en skärpt distribution av högre kvalitet. Träning på dessa vinnare via standard korsentropi destillerar effektivt det bästa-av-N-beteendet tillbaka till modellens ensamplingsutgångar. För verifierbara domäner som matematik eller kod kan "belöningen" helt enkelt vara om det slutliga svaret eller enhetstestet blir godkänt, vilket helt och hållet tar bort behovet av en inlärd belöningsmodell.

Strategisk inverkan

Speed and scale

Språkarbetsflöden kan gå snabbare utan att offra konsekvens.

Access and reach

Det utökar åtkomsten över språk och kommunikationsstilar.

Clearer decisions

Team kan lägga mer tid på bedömning medan automatisering hanterar upprepning.

Future of Rejection Sampling Fine-Tuning

RFT är centralt för modern efterträning, som ofta används före eller tillsammans med RL-metoder som PPO och DPO. Dess dragningskraft växer med billiga slutsatser och starka automatiska verifierare: när modellerna blir bättre på att generera och kontrollera själv, stöder upprepad avvisningssampling syntetiska data och självförbättringsloopar. Förvänta dig tätare integration med resonemangsmodeller som producerar verifierbara tankekedjor, och pågående studier av hur man undviker belöningshackning och mångfaldskollaps när man tränar upprepade gånger på en modells egna resultat.

Real-World Implementation

Justera modeller i lama-stil genom att ta ett urval av flera svar per prompt, behålla de högsta poängen för belöningsmodellen och sedan SFT på dessa

Förbättra en matematiklösare genom att generera många lösningar och bara behålla de som når det korrekta, kontrollerbara svaret

Kodgenerering där kandidater endast behålls om de klarar enhetstester och används sedan som träningsdata

Bygga syntetiska instruktionsdatauppsättningar genom att filtrera en modells egna bästa självgenererade svar för nästa träningsomgång

Risker & skyddsräcken

Hallucinerade fakta kan tyst lägga in rapporter, stödflöden eller forskningsresultat.

Snabb känslighet kan skapa inkonsekventa resultat över liknande förfrågningar.

Känsliga textdata kan exponeras om åtkomstkontrollerna är svaga.

Färdplan för genomförande

1

Definiera utdataformat, ton och kvalitetsstandarder innan lansering.

2

Marksvar med pålitliga källor närhelst noggrannhet är viktig.

3

Håll en kontrollpunkt för mänsklig granskning för höga insatser.

4

Spåra felmönster och träna om uppmaningar eller arbetsflöden regelbundet.

Fortsätt utforska

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Rejection Sampling Fine-Tuning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Starta frågesport

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

QLoRA och 4-bitars finjustering

Frequently asked questions

What is Rejection Sampling Fine-Tuning?

Rejection Sampling Fine-Tuning (RFT) genererar många kandidatsvar, behåller bara de som får bäst poäng och tränar om modellen på dessa vinnare. Det är viktigt eftersom det erbjuder mycket av RLHF:s fördelar att använda enkel övervakad inlärning istället för komplex förstärkningsinlärning.

Vad är kärnidén med Finjustering av Rejection Sampling?

RFT samplar flera svar, filtrerar till de som får högsta poäng och finjusterar modellen på dessa vinnare.

Vad kan tjäna som belöning på verifierbara domäner som matematik eller kod?

För kontrollerbara uppgifter kan RFT använda exakt korrekthet eller klara enhetstester och undvika en inlärd belöningsmodell.

Vilken modellfamilj använde känd avvisningssampling under justering?

Meta beskrivs med avslagsprovtagning som en del av receptet efter träningen för modellerna Llama 2 och Llama 3.

Varför kanske team föredrar RFT framför policygradient RL som PPO?

RFT omtränar med standard nästa-token-förlust på filtrerade prover, vilket kringgår inställningssvårigheten och instabiliteten hos metoder med policygradient.

Vad gör träning på proverna med maximal belöning effektivt?

Genom att lära av de mest filtrerade svaren internaliserar modellen ett beteende av högre kvalitet i en enda generation.