GUIDE des fondamentaux

Réglage fin en mode autonome

Le réglage fin de l'auto-jeu améliore un modèle en le faisant rivaliser ou en apprenant de ses propres résultats passés, générant ainsi son propre signal d'entraînement.

2 minutes de lectureDernière mise à jour

Aperçu

It matters because it can push performance beyond the supervised data using little or no extra human labeling.

Plongée profonde

Le jeu personnel a des racines profondes dans l'IA des jeux : AlphaGo Zero et AlphaZero ont atteint le niveau de jeu surhumain simplement en jouant des millions de parties contre eux-mêmes, sans aucun record de jeu humain. Le même esprit apparaît désormais dans la mise au point du modèle linguistique. Dans SPIN (Self-Play fIne-tuNing), le modèle actuel génère des réponses aux invites, et l'entraînement pousse le modèle à distinguer ses propres réponses générées de celles originales écrites par l'homme, se traitant à la fois comme le joueur et l'adversaire. Au fil des itérations successives, « l'adversaire » (le point de contrôle précédent) devient plus fort, le modèle doit donc continuer à s'améliorer, réduisant progressivement l'écart avec la distribution cible. Le grand attrait réside dans l’efficacité des données : un ensemble de données supervisées fixes peut être extrait pour obtenir davantage de gains sans collecter de nouvelles démonstrations ou préférences humaines.

Aperçu technique

Les cadres SPIN s'ajustent comme un jeu à deux joueurs avec une perte de type DPO : le modèle est entraîné pour attribuer une plus grande probabilité aux réponses de référence humaines qu'à ses propres réponses auto-générées à partir de l'itération précédente. Étant donné que le point de contrôle précédent fournit les points négatifs, la difficulté évolue automatiquement à mesure que le modèle s'améliore. Dans les systèmes de jeu, le jeu personnel est associé à la recherche (par exemple, MCTS) et à un réseau de valeurs, générant un programme sans fin d'adversaires de plus en plus coriaces, sans données externes.

Impact stratégique

Décisions plus claires

Il vous aide à séparer les affirmations techniques claires du langage marketing.

Coût et budget

Vous pouvez poser de meilleures questions de mise en œuvre avant de dépenser de l'argent ou du temps.

Équipe et flux de travail

Les équipes partageant une compréhension commune prennent de meilleures décisions en matière de produits, de politiques et d’apprentissage.

L'avenir du réglage fin du jeu personnel

Le jeu personnel est l’un des principaux candidats pour briser le mur des données, car il fabrique son propre programme plutôt que de dépendre des rares étiquettes humaines. Attendez-vous à une croissance dans des domaines vérifiables tels que les mathématiques, le code et la preuve de théorèmes, où les vérificateurs automatiques notent les tentatives auto-générées. Les risques incluent le piratage des récompenses et l'effondrement du modèle dû à une formation sur trop de résultats synthétiques, de sorte que les futurs systèmes mélangeront probablement le jeu autonome avec des signaux de mise à la terre, des vérificateurs et des commentaires périodiques humains ou réels.

Mise en œuvre dans le monde réel

AlphaGo Zero et AlphaZero atteignent le Go, les échecs et le shogi surhumains entièrement grâce au jeu personnel, sans jeux humains.

SPIN améliore les scores de référence d'un LLM en distinguant de manière itérative ses propres résultats des réponses de référence humaines

Modèles mathématiques et de codage générant des tentatives de solutions, puis formation sur celles vérifiées par des vérificateurs automatiques ou des tests unitaires

Les agents de négociation et de dialogue améliorent leur stratégie en jouant de manière répétée contre eux-mêmes les deux côtés d’une conversation.

Risques et garde-fous

Différentes équipes peuvent utiliser le même terme différemment, alors définissez la portée dès le début.

Les benchmarks peuvent paraître solides alors que les performances réelles sont inégales.

Ignorer la qualité des données et les plans d’évaluation crée souvent des résultats fragiles.

Feuille de route de mise en œuvre

1

Commencez par une définition en langage simple du résultat dont vous avez besoin.

2

Choisissez une mesure de réussite et une condition d’échec avant de tester.

3

Exécutez un petit pilote avec des données représentatives, pas un ensemble de démonstration raffiné.

4

Documentez où le réglage fin du Self-Play est utile et où les méthodes plus simples sont meilleures.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Self-Play Fine-Tuning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Questions fréquemment posées

What is Self-Play Fine-Tuning?

Le réglage fin de l'auto-jeu améliore un modèle en le faisant rivaliser ou en apprenant de ses propres résultats passés, générant ainsi son propre signal d'entraînement. C’est important car cela peut pousser les performances au-delà des données supervisées en utilisant peu ou pas d’étiquetage humain supplémentaire.

Quel système célèbre a atteint le niveau de jeu surhumain au Go en utilisant uniquement le jeu personnel et aucun enregistrement de jeu humain ?

AlphaGo Zero a entièrement appris des jeux auxquels il a joué contre lui-même, en commençant par le jeu aléatoire et en surpassant les versions précédentes entraînées sur des jeux humains.

Dans SPIN, qu'est-ce qui joue le rôle de « l'adversaire » que le modèle doit battre ?

SPIN traite le réglage fin comme un jeu autonome dans lequel les sorties auto-générées de l'itération précédente servent de points négatifs que le modèle apprend à surpasser.

Quel est le principal avantage en termes d'efficacité des données du réglage fin de l'auto-jeu ?

Le jeu autonome fabrique son propre signal d'entraînement, de sorte qu'un ensemble fixe et supervisé peut apporter d'autres améliorations sans nécessiter de nouvelles démonstrations.

Dans l'objectif de formation de SPIN, à quoi le modèle est-il poussé ?

SPIN utilise une perte de style DPO qui récompense la distinction des réponses de référence humaines (positives) des réponses auto-générées antérieures du modèle (négatives).

Pourquoi la difficulté de réglage fin du jeu personnel augmente-t-elle automatiquement au fil des itérations ?

Étant donné que les points négatifs de chaque itération proviennent d'un modèle antérieur plus solide, le modèle est confronté à un défi de plus en plus difficile sans conception manuelle du programme.