Finjustering av avslagssampling
Rejection Sampling Fine-Tuning (RFT) genererar många kandidatsvar, behåller bara de som får bäst poäng och tränar om modellen på dessa vinnare.
Översikt
It matters because it offers much of RLHF's benefit using straightforward supervised learning instead of complex reinforcement learning.
Djupdykning
Rejection Sampling Fine-Tuning, ibland kallad best-of-N-finjustering, är en nyckelingrediens i hur modeller som Metas Llama 2 och Llama 3 anpassades. Receptet är enkelt: för varje prompt, prova flera svar (t.ex. 4 till 64) från den aktuella modellen, poängsätt var och en med en belöningsmodell eller en automatisk kontrollör och kassera ('avvisa') sedan alla utom de högst rankade utdata. De överlevande högkvalitativa proverna blir en ny övervakad finjusteringsdatauppsättning, och modellen tränas på dem med vanlig nästa token-förlust. Att upprepa denna loop iterativt knuffar modellen mot att generera bättre svar på egen hand. Eftersom modellen lär sig av sina egna filtrerade utgångar undviker RFT instabiliteten och inställningshuvudvärken från policygradient RL samtidigt som den utnyttjar en belöningssignal.
Teknisk insikt
RFT utnyttjar det faktum att sampling många gånger och bibehåller den maximala belöningsresponsen ungefärligt att välja från en skärpt distribution av högre kvalitet. Träning på dessa vinnare via standard korsentropi destillerar effektivt det bästa-av-N-beteendet tillbaka till modellens ensamplingsutgångar. För verifierbara domäner som matematik eller kod kan "belöningen" helt enkelt vara om det slutliga svaret eller enhetstestet blir godkänt, vilket helt och hållet tar bort behovet av en inlärd belöningsmodell.
Strategisk inverkan
Speed and scale
Språkarbetsflöden kan gå snabbare utan att offra konsekvens.
Access and reach
Det utökar åtkomsten över språk och kommunikationsstilar.
Clearer decisions
Team kan lägga mer tid på bedömning medan automatisering hanterar upprepning.
Future of Rejection Sampling Fine-Tuning
RFT är centralt för modern efterträning, som ofta används före eller tillsammans med RL-metoder som PPO och DPO. Dess dragningskraft växer med billiga slutsatser och starka automatiska verifierare: när modellerna blir bättre på att generera och kontrollera själv, stöder upprepad avvisningssampling syntetiska data och självförbättringsloopar. Förvänta dig tätare integration med resonemangsmodeller som producerar verifierbara tankekedjor, och pågående studier av hur man undviker belöningshackning och mångfaldskollaps när man tränar upprepade gånger på en modells egna resultat.
Real-World Implementation
Justera modeller i lama-stil genom att ta ett urval av flera svar per prompt, behålla de högsta poängen för belöningsmodellen och sedan SFT på dessa
Förbättra en matematiklösare genom att generera många lösningar och bara behålla de som når det korrekta, kontrollerbara svaret
Kodgenerering där kandidater endast behålls om de klarar enhetstester och används sedan som träningsdata
Bygga syntetiska instruktionsdatauppsättningar genom att filtrera en modells egna bästa självgenererade svar för nästa träningsomgång
Risker & skyddsräcken
Hallucinerade fakta kan tyst lägga in rapporter, stödflöden eller forskningsresultat.
Snabb känslighet kan skapa inkonsekventa resultat över liknande förfrågningar.
Känsliga textdata kan exponeras om åtkomstkontrollerna är svaga.
Färdplan för genomförande
Definiera utdataformat, ton och kvalitetsstandarder innan lansering.
Marksvar med pålitliga källor närhelst noggrannhet är viktig.
Håll en kontrollpunkt för mänsklig granskning för höga insatser.
Spåra felmönster och träna om uppmaningar eller arbetsflöden regelbundet.
Fortsätt utforska
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Rejection Sampling Fine-Tuning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
QLoRA och 4-bitars finjustering
Frequently asked questions
What is Rejection Sampling Fine-Tuning?
Rejection Sampling Fine-Tuning (RFT) genererar många kandidatsvar, behåller bara de som får bäst poäng och tränar om modellen på dessa vinnare. Det är viktigt eftersom det erbjuder mycket av RLHF:s fördelar att använda enkel övervakad inlärning istället för komplex förstärkningsinlärning.
Vad är kärnidén med Finjustering av Rejection Sampling?
RFT samplar flera svar, filtrerar till de som får högsta poäng och finjusterar modellen på dessa vinnare.
Vad kan tjäna som belöning på verifierbara domäner som matematik eller kod?
För kontrollerbara uppgifter kan RFT använda exakt korrekthet eller klara enhetstester och undvika en inlärd belöningsmodell.
Vilken modellfamilj använde känd avvisningssampling under justering?
Meta beskrivs med avslagsprovtagning som en del av receptet efter träningen för modellerna Llama 2 och Llama 3.
Varför kanske team föredrar RFT framför policygradient RL som PPO?
RFT omtränar med standard nästa-token-förlust på filtrerade prover, vilket kringgår inställningssvårigheten och instabiliteten hos metoder med policygradient.
Vad gör träning på proverna med maximal belöning effektivt?
Genom att lära av de mest filtrerade svaren internaliserar modellen ett beteende av högre kvalitet i en enda generation.