Ajustement précis de l’échantillonnage de rejet
Le Rejection Sampling Fine-Tuning (RFT) génère de nombreuses réponses candidates, ne conserve que les meilleures réponses et recycle le modèle sur ces gagnants.
Aperçu
C'est important car il offre une grande partie des avantages du RLHF en utilisant un apprentissage supervisé simple au lieu d'un apprentissage par renforcement complexe.
Plongée profonde
Le réglage fin de l'échantillonnage de rejet, parfois appelé réglage fin du meilleur des N, est un ingrédient clé dans la façon dont des modèles tels que Llama 2 et Llama 3 de Meta ont été alignés. La recette est simple : pour chaque invite, échantillonnez plusieurs réponses (disons 4 à 64) du modèle actuel, notez chacune avec un modèle de récompense ou un vérificateur automatique, puis rejetez (« rejetez ») toutes les sorties sauf les premières. Les échantillons survivants de haute qualité deviennent un nouvel ensemble de données de réglage fin supervisé, et le modèle est formé sur eux avec une perte ordinaire du prochain jeton. La répétition de cette boucle incite le modèle à générer lui-même de meilleures réponses. Parce que le modèle apprend de ses propres sorties filtrées, RFT évite l'instabilité et les problèmes de réglage du RL à gradient de politique tout en continuant à exploiter un signal de récompense.
Aperçu technique
RFT exploite le fait qu'échantillonner plusieurs fois et conserver la réponse de récompense maximale se rapproche d'une sélection parmi une distribution plus précise et de meilleure qualité. La formation sur ces gagnants via l'entropie croisée standard distille efficacement ce comportement du meilleur des N dans les sorties à échantillon unique du modèle. Pour des domaines vérifiables comme les mathématiques ou le code, la « récompense » peut simplement être la réussite de la réponse finale ou du test unitaire, éliminant ainsi entièrement le besoin d'un modèle de récompense appris.
Impact stratégique
Vitesse et échelle
Les flux de travail linguistiques peuvent évoluer plus rapidement sans sacrifier la cohérence.
Accès et portée
Il étend l’accès à toutes les langues et styles de communication.
Décisions plus claires
Les équipes peuvent consacrer plus de temps au jugement tandis que l’automatisation gère les répétitions.
L’avenir du réglage fin de l’échantillonnage des rejets
Le RFT est au cœur de la post-formation moderne, souvent utilisé avant ou parallèlement aux méthodes RL telles que PPO et DPO. Son attrait grandit grâce à l'inférence bon marché et aux vérificateurs automatiques puissants : à mesure que les modèles s'améliorent en termes d'auto-génération et d'auto-vérification, l'échantillonnage de rejet itéré prend en charge les données synthétiques et les boucles d'auto-amélioration. Attendez-vous à une intégration plus étroite avec des modèles de raisonnement qui produisent des chaînes de pensée vérifiables, et à une étude continue sur la manière d'éviter le piratage des récompenses et l'effondrement de la diversité lors d'un entraînement répété sur les propres résultats d'un modèle.
Mise en œuvre dans le monde réel
Aligner les modèles de style Lama en échantillonnant plusieurs réponses par invite, en conservant les scores de modèle de récompense les plus élevés, puis en SFT sur celles-ci
Améliorer un solveur mathématique en générant de nombreuses solutions et en ne conservant que celles qui atteignent la réponse correcte et vérifiable
Génération de code où les candidats ne sont conservés que s'ils réussissent les tests unitaires, puis utilisés comme données de formation
Créer des ensembles de données d'instructions synthétiques en filtrant les meilleures réponses auto-générées d'un modèle pour le prochain cycle de formation
Risques et garde-fous
Les faits hallucinés peuvent discrètement entrer dans des rapports, des flux de support ou des résultats de recherche.
La sensibilité des invites peut créer des résultats incohérents pour des demandes similaires.
Les données textuelles sensibles peuvent être exposées si les contrôles d’accès sont faibles.
Feuille de route de mise en œuvre
Définissez le format de sortie, le ton et les normes de qualité avant le déploiement.
Établissez des réponses auprès de sources fiables chaque fois que la précision est importante.
Gardez un point de contrôle d’examen humain pour les résultats à enjeux élevés.
Suivez les modèles de défaillance et recyclez régulièrement les invites ou les flux de travail.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Rejection Sampling Fine-Tuning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
QLoRA et réglage fin 4 bits
Questions fréquemment posées
Qu’est-ce que le réglage fin de l’échantillonnage de rejet ?
Le Rejection Sampling Fine-Tuning (RFT) génère de nombreuses réponses candidates, ne conserve que les meilleures réponses et recycle le modèle sur ces gagnants. C'est important car il offre une grande partie des avantages du RLHF en utilisant un apprentissage supervisé simple au lieu d'un apprentissage par renforcement complexe.
Quelle est l’idée centrale du réglage fin de l’échantillonnage de rejet ?
RFT échantillonne plusieurs réponses, filtre celles qui obtiennent les meilleurs scores et affine le modèle sur ces gagnants.
Dans des domaines vérifiables comme les mathématiques ou le code, qu’est-ce qui peut servir de récompense ?
Pour les tâches vérifiables, RFT peut utiliser l'exactitude exacte ou réussir des tests unitaires, évitant ainsi un modèle de récompense appris.
Quelle famille de modèles a utilisé l'échantillonnage par rejet lors de l'alignement ?
Meta a décrit l'utilisation de l'échantillonnage par rejet dans le cadre de la recette post-formation pour les modèles Llama 2 et Llama 3.
Pourquoi les équipes pourraient-elles préférer le RFT au RL à gradient politique comme le PPO ?
RFT se recycle avec la perte standard du jeton suivant sur les échantillons filtrés, évitant ainsi la difficulté de réglage et l'instabilité des méthodes de gradient de politique.
La formation sur les échantillons à récompense maximale fait effectivement quoi ?
En apprenant des réponses les plus filtrées, le modèle internalise un comportement de meilleure qualité en une seule génération.