Regolazione fine del campionamento del rifiuto
Il Rejection Sampling Fine-Tuning (RFT) genera molte risposte candidate, mantiene solo quelle con il punteggio migliore e riqualifica il modello su quei vincitori.
Panoramica
It matters because it offers much of RLHF's benefit using straightforward supervised learning instead of complex reinforcement learning.
Immersione profonda
La messa a punto del campionamento del rifiuto, a volte chiamata messa a punto del meglio di N, è un ingrediente chiave nel modo in cui modelli come Llama 2 e Llama 3 di Meta sono stati allineati. La ricetta è semplice: per ogni richiesta, campiona diverse risposte (diciamo da 4 a 64) dal modello corrente, assegna un punteggio a ciascuna con un modello di ricompensa o un controllo automatico, quindi scarta ("rifiuta") tutti tranne gli output con il punteggio più alto. I campioni di alta qualità sopravvissuti diventano un nuovo set di dati di messa a punto supervisionato e il modello viene addestrato su di essi con la normale perdita del token successivo. La ripetizione di questo ciclo spinge iterativamente il modello a generare da solo risposte migliori. Poiché il modello apprende dai propri output filtrati, RFT evita l’instabilità e i problemi di regolazione del RL con gradiente politico, sfruttando al tempo stesso un segnale di ricompensa.
Approfondimento tecnico
RFT sfrutta il fatto che campionare molte volte e mantenere la risposta della ricompensa massima si avvicina alla scelta da una distribuzione più precisa e di qualità superiore. L'addestramento su questi vincitori tramite entropia incrociata standard distilla efficacemente il comportamento migliore di N negli output a campione singolo del modello. Per ambiti verificabili come la matematica o il codice, la "ricompensa" può semplicemente essere il superamento della risposta finale o del test unitario, eliminando completamente la necessità di un modello di ricompensa appreso.
Impatto strategico
Velocità e scala
I flussi di lavoro linguistici possono muoversi più velocemente senza sacrificare la coerenza.
Accedere e raggiungere
Espande l'accesso attraverso lingue e stili di comunicazione.
Decisioni più chiare
I team possono dedicare più tempo al giudizio mentre l'automazione gestisce la ripetizione.
Il futuro della messa a punto del campionamento del rifiuto
La RFT è fondamentale per il moderno post-formazione, spesso utilizzata prima o insieme ai metodi RL come PPO e DPO. Il suo fascino cresce con inferenze a basso costo e potenti verificatori automatici: man mano che i modelli migliorano nell’autogenerazione e nell’autocontrollo, il campionamento del rifiuto iterato supporta i cicli di dati sintetici e di auto-miglioramento. Aspettatevi un'integrazione più stretta con modelli di ragionamento che producano catene di pensiero verificabili e uno studio continuo su come evitare l'hacking della ricompensa e il collasso della diversità quando si forma ripetutamente sui risultati di un modello.
Implementazione nel mondo reale
Allineamento dei modelli in stile lama campionando più risposte per richiesta, mantenendo i punteggi più alti del modello di ricompensa, quindi SFT su quelli
Migliorare un risolutore matematico generando molte soluzioni e conservando solo quelle che raggiungono la risposta corretta e verificabile
Generazione di codice in cui i candidati vengono conservati solo se superano i test unitari, quindi utilizzati come dati di training
Costruire set di dati di istruzioni sintetiche filtrando le migliori risposte autogenerate di un modello per il successivo ciclo di addestramento
Rischi e guardrail
Fatti allucinati possono tranquillamente entrare nei rapporti, nei flussi di supporto o nei risultati della ricerca.
La sensibilità tempestiva può creare risultati incoerenti tra richieste simili.
I dati di testo sensibili potrebbero essere esposti se i controlli di accesso sono deboli.
Tabella di marcia per l'implementazione
Definisci il formato di output, il tono e gli standard di qualità prima dell'implementazione.
Risposte concrete con fonti attendibili ogni volta che la precisione è importante.
Mantenere un checkpoint di revisione umana per i risultati ad alto rischio.
Tieni traccia dei modelli di errore e riqualifica regolarmente le richieste o i flussi di lavoro.
Continua a esplorare
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Rejection Sampling Fine-Tuning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Prossima guida
QLoRA e regolazione fine a 4 bit
Domande frequenti
What is Rejection Sampling Fine-Tuning?
Il Rejection Sampling Fine-Tuning (RFT) genera molte risposte candidate, mantiene solo quelle con il punteggio migliore e riqualifica il modello su quei vincitori. È importante perché offre molti dei vantaggi di RLHF utilizzando un semplice apprendimento supervisionato invece di un complesso apprendimento per rinforzo.
Qual è l'idea centrale del fine tuning del campionamento di reiezione?
RFT campiona risposte multiple, filtra quelle con il punteggio più alto e perfeziona il modello su quei vincitori.
In ambiti verificabili come la matematica o il codice, cosa può servire come ricompensa?
Per le attività verificabili, RFT può utilizzare la correttezza esatta o il superamento dei test unitari, evitando un modello di ricompensa appreso.
Quale famiglia di modelli utilizzava notoriamente il campionamento del rifiuto durante l'allineamento?
Meta ha descritto l'utilizzo del campionamento del rifiuto come parte della ricetta post-addestramento per i modelli Llama 2 e Llama 3.
Perché i team potrebbero preferire RFT rispetto a RL con gradiente politico come PPO?
RFT si riqualifica con la perdita standard del token successivo sui campioni filtrati, evitando la difficoltà di ottimizzazione e l'instabilità dei metodi basati sul gradiente politico.
Cosa fa efficacemente la formazione sui campioni con la ricompensa massima?
Imparando dalle risposte filtrate principali, il modello interiorizza comportamenti di qualità superiore in una singola generazione.