GUIDE IA du langage

Échantillonnage et reclassement du meilleur des N

L'échantillonnage Best-of-N génère plusieurs réponses candidates à partir d'un modèle, puis sélectionne la meilleure à l'aide d'une étape de notation distincte.

2 minutes de lectureDernière mise à jour

Aperçu

C’est l’un des moyens les plus simples et fiables d’échanger un calcul supplémentaire au moment de l’inférence contre une meilleure qualité de réponse.

Plongée profonde

Un modèle de langage avec échantillonnage produit des sorties différentes à chaque fois que vous l'exécutez. Best-of-N exploite cela : vous dessinez N réponses candidates, puis vous les reclassez et renvoyez la première. Le reclasseur peut être un modèle de récompense appris (courant dans l'apprentissage par renforcement à partir de commentaires humains), un vérificateur qui vérifie l'exactitude ou une simple heuristique comme un accord de réponse via un vote majoritaire. Étant donné que le modèle n'a besoin que d'une bonne tentative parmi tant d'autres, la qualité augmente souvent fortement à mesure que N augmente, en particulier pour les tâches de raisonnement et de code pour lesquelles un chemin correct existe mais n'est pas toujours le premier échantillon. Le coût est linéaire en N, et les gains finissent par plafonner, voire s'inverser si le buteur est imparfait, un mode d'échec appelé piratage de récompense ou sur-optimisation de récompense.

Aperçu technique

La qualité du meilleur des N dépend entièrement du buteur. Avec un vérificateur parfait, la précision se rapproche de la probabilité qu'au moins un des N échantillons soit correct, qui augmente rapidement avec N. Avec un modèle de récompense bruyant, la sélection peut être trompée : pousser N très haut amplifie les résultats qui obtiennent un score élevé mais qui sont en réalité faux, puisque vous optimisez par rapport aux angles morts du marqueur. C’est pourquoi des modèles de récompense calibrés et robustes sont importants pour que la technique continue à porter ses fruits.

Impact stratégique

Vitesse et échelle

Les flux de travail linguistiques peuvent évoluer plus rapidement sans sacrifier la cohérence.

Accès et portée

Il étend l’accès à toutes les langues et styles de communication.

Décisions plus claires

Les équipes peuvent consacrer plus de temps au jugement tandis que l’automatisation gère les répétitions.

L’avenir de l’échantillonnage et du reclassement Best-of-N

Le Best-of-N devient un élément essentiel de la mise à l'échelle du temps d'inférence, aux côtés de la chaîne de pensée et de la recherche arborescente. Attendez-vous à des variantes plus intelligentes : vote à la majorité pondérée, modèles de récompense de processus qui notent chaque étape de raisonnement et N adaptatif qui arrête l'échantillonnage une fois que la confiance est élevée. À mesure que les vérificateurs s'améliorent, en particulier pour le code et les mathématiques dont l'exactitude est vérifiable, le reclassement de nombreux échantillons deviendra un moyen standard de convertir les calculs de réserve en fiabilité sans recycler le modèle de base.

Mise en œuvre dans le monde réel

Échantillonner 64 solutions à un problème mathématique et sélectionner la réponse sur laquelle le plus grand nombre d'échantillons s'accordent (auto-cohérence / vote majoritaire).

Générer plusieurs complétions de code et conserver celui qui réussit le plus de tests unitaires en tant que vérificateur automatique.

Dessiner plusieurs réponses dans un pipeline RLHF et choisir la réponse ayant obtenu la note de modèle la plus élevée à proposer aux utilisateurs.

Produire plusieurs projets de résumés et les reclasser avec un modèle de qualité pour restituer le plus fidèle et le plus concis.

Risques et garde-fous

Les faits hallucinés peuvent discrètement entrer dans des rapports, des flux de support ou des résultats de recherche.

La sensibilité des invites peut créer des résultats incohérents pour des demandes similaires.

Les données textuelles sensibles peuvent être exposées si les contrôles d’accès sont faibles.

Feuille de route de mise en œuvre

1

Définissez le format de sortie, le ton et les normes de qualité avant le déploiement.

2

Établissez des réponses auprès de sources fiables chaque fois que la précision est importante.

3

Gardez un point de contrôle d’examen humain pour les résultats à enjeux élevés.

4

Suivez les modèles de défaillance et recyclez régulièrement les invites ou les flux de travail.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Best-of-N Sampling and Reranking quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Température et échantillonnage

Questions fréquemment posées

Qu’est-ce que l’échantillonnage et le reclassement des meilleurs de n ?

L'échantillonnage Best-of-N génère plusieurs réponses candidates à partir d'un modèle, puis sélectionne la meilleure à l'aide d'une étape de notation distincte. Il s’agit de l’un des moyens les plus simples et les plus fiables d’échanger des calculs supplémentaires au moment de l’inférence contre une qualité de réponse supérieure.

Quelle est l’idée centrale de l’échantillonnage Best-of-N ?

Best-of-N sélectionne plusieurs réponses de candidats, puis les reclasse, renvoyant celle ayant obtenu le score le plus élevé.

Sur quels types de tâches le best-of-N a-t-il tendance à être le plus utile ?

Lorsqu'il existe une réponse correcte vérifiable que le modèle ne trouve que de temps en temps, l'échantillonnage d'un plus grand nombre de candidats augmente les chances que l'un d'entre eux ait raison.

Qu’est-ce qui détermine en grande partie si le meilleur des N améliore réellement les résultats ?

La sélection est aussi bonne que le reranker ; un correcteur faible ou biaisé peut choisir de mauvaises réponses.

Quel mode d’échec peut apparaître lorsque N est poussé très haut avec un modèle de récompense imparfait ?

Optimiser durement contre un buteur défectueux amplifie les résultats qui exploitent ses angles morts, de sorte que la précision peut stagner ou chuter.

Quelle stratégie de reclassement simple est également appelée auto-cohérence ?

L'auto-cohérence échantillonne de nombreuses chaînes de raisonnement et sélectionne la réponse finale sur laquelle la plupart des chaînes s'accordent.