GUIDE IA du langage

Ajustement précis de l’échantillonnage de rejet

Le Rejection Sampling Fine-Tuning (RFT) génère de nombreuses réponses candidates, ne conserve que les meilleures réponses et recycle le modèle sur ces gagnants.

2 minutes de lectureDernière mise à jour

Aperçu

C'est important car il offre une grande partie des avantages du RLHF en utilisant un apprentissage supervisé simple au lieu d'un apprentissage par renforcement complexe.

Plongée profonde

Le réglage fin de l'échantillonnage de rejet, parfois appelé réglage fin du meilleur des N, est un ingrédient clé dans la façon dont des modèles tels que Llama 2 et Llama 3 de Meta ont été alignés. La recette est simple : pour chaque invite, échantillonnez plusieurs réponses (disons 4 à 64) du modèle actuel, notez chacune avec un modèle de récompense ou un vérificateur automatique, puis rejetez (« rejetez ») toutes les sorties sauf les premières. Les échantillons survivants de haute qualité deviennent un nouvel ensemble de données de réglage fin supervisé, et le modèle est formé sur eux avec une perte ordinaire du prochain jeton. La répétition de cette boucle incite le modèle à générer lui-même de meilleures réponses. Parce que le modèle apprend de ses propres sorties filtrées, RFT évite l'instabilité et les problèmes de réglage du RL à gradient de politique tout en continuant à exploiter un signal de récompense.

Aperçu technique

RFT exploite le fait qu'échantillonner plusieurs fois et conserver la réponse de récompense maximale se rapproche d'une sélection parmi une distribution plus précise et de meilleure qualité. La formation sur ces gagnants via l'entropie croisée standard distille efficacement ce comportement du meilleur des N dans les sorties à échantillon unique du modèle. Pour des domaines vérifiables comme les mathématiques ou le code, la « récompense » peut simplement être la réussite de la réponse finale ou du test unitaire, éliminant ainsi entièrement le besoin d'un modèle de récompense appris.

Impact stratégique

Vitesse et échelle

Les flux de travail linguistiques peuvent évoluer plus rapidement sans sacrifier la cohérence.

Accès et portée

Il étend l’accès à toutes les langues et styles de communication.

Décisions plus claires

Les équipes peuvent consacrer plus de temps au jugement tandis que l’automatisation gère les répétitions.

L’avenir du réglage fin de l’échantillonnage des rejets

Le RFT est au cœur de la post-formation moderne, souvent utilisé avant ou parallèlement aux méthodes RL telles que PPO et DPO. Son attrait grandit grâce à l'inférence bon marché et aux vérificateurs automatiques puissants : à mesure que les modèles s'améliorent en termes d'auto-génération et d'auto-vérification, l'échantillonnage de rejet itéré prend en charge les données synthétiques et les boucles d'auto-amélioration. Attendez-vous à une intégration plus étroite avec des modèles de raisonnement qui produisent des chaînes de pensée vérifiables, et à une étude continue sur la manière d'éviter le piratage des récompenses et l'effondrement de la diversité lors d'un entraînement répété sur les propres résultats d'un modèle.

Mise en œuvre dans le monde réel

Aligner les modèles de style Lama en échantillonnant plusieurs réponses par invite, en conservant les scores de modèle de récompense les plus élevés, puis en SFT sur celles-ci

Améliorer un solveur mathématique en générant de nombreuses solutions et en ne conservant que celles qui atteignent la réponse correcte et vérifiable

Génération de code où les candidats ne sont conservés que s'ils réussissent les tests unitaires, puis utilisés comme données de formation

Créer des ensembles de données d'instructions synthétiques en filtrant les meilleures réponses auto-générées d'un modèle pour le prochain cycle de formation

Risques et garde-fous

Les faits hallucinés peuvent discrètement entrer dans des rapports, des flux de support ou des résultats de recherche.

La sensibilité des invites peut créer des résultats incohérents pour des demandes similaires.

Les données textuelles sensibles peuvent être exposées si les contrôles d’accès sont faibles.

Feuille de route de mise en œuvre

1

Définissez le format de sortie, le ton et les normes de qualité avant le déploiement.

2

Établissez des réponses auprès de sources fiables chaque fois que la précision est importante.

3

Gardez un point de contrôle d’examen humain pour les résultats à enjeux élevés.

4

Suivez les modèles de défaillance et recyclez régulièrement les invites ou les flux de travail.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Rejection Sampling Fine-Tuning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

QLoRA et réglage fin 4 bits

Questions fréquemment posées

Qu’est-ce que le réglage fin de l’échantillonnage de rejet ?

Le Rejection Sampling Fine-Tuning (RFT) génère de nombreuses réponses candidates, ne conserve que les meilleures réponses et recycle le modèle sur ces gagnants. C'est important car il offre une grande partie des avantages du RLHF en utilisant un apprentissage supervisé simple au lieu d'un apprentissage par renforcement complexe.

Quelle est l’idée centrale du réglage fin de l’échantillonnage de rejet ?

RFT échantillonne plusieurs réponses, filtre celles qui obtiennent les meilleurs scores et affine le modèle sur ces gagnants.

Dans des domaines vérifiables comme les mathématiques ou le code, qu’est-ce qui peut servir de récompense ?

Pour les tâches vérifiables, RFT peut utiliser l'exactitude exacte ou réussir des tests unitaires, évitant ainsi un modèle de récompense appris.

Quelle famille de modèles a utilisé l'échantillonnage par rejet lors de l'alignement ?

Meta a décrit l'utilisation de l'échantillonnage par rejet dans le cadre de la recette post-formation pour les modèles Llama 2 et Llama 3.

Pourquoi les équipes pourraient-elles préférer le RFT au RL à gradient politique comme le PPO ?

RFT se recycle avec la perte standard du jeton suivant sur les échantillons filtrés, évitant ainsi la difficulté de réglage et l'instabilité des méthodes de gradient de politique.

La formation sur les échantillons à récompense maximale fait effectivement quoi ?

En apprenant des réponses les plus filtrées, le modèle internalise un comportement de meilleure qualité en une seule génération.