GUIDE DES ENTREPRISES

AlphaGo et AlphaZéro

AlphaGo était le programme DeepMind qui a battu les meilleurs joueurs de Go du monde, une étape importante que l'on pensait depuis des décennies.

2 minutes de lectureDernière mise à jour

Aperçu

AlphaZero then mastered Go, chess, and shogi entirely through self-play, learning superhuman skill from scratch.

Plongée profonde

Go a plus de positions possibles sur le tableau que d'atomes dans l'univers observable, ce qui rend la recherche par force brute désespérée et l'intuition essentielle. En 2016, AlphaGo a battu le légendaire champion Lee Sedol 4-1, avec son célèbre « Move 37 » étourdissant les experts comme étant non-humains sur le plan créatif. AlphaGo a appris des jeux d'experts humains et du jeu personnel. En 2017, AlphaZero est allé plus loin : en partant uniquement des règles et sans données humaines, il a appris tout seul en jouant des millions de parties contre lui-même, surpassant les meilleurs programmes de Go, d'échecs et de shogi en quelques heures, voire quelques jours. Un système ultérieur, MuZero, a même appris les règles du jeu par lui-même. Ces jalons ont montré comment l'apprentissage par renforcement et la recherche peuvent découvrir des stratégies au-delà de la connaissance humaine.

Aperçu technique

AlphaZero combine un réseau neuronal profond avec Monte Carlo Tree Search (MCTS). Le réseau produit une politique (qui semble prometteuse) et une valeur (qui est susceptible de gagner), guidant la recherche pour explorer uniquement les lignes les plus pertinentes au lieu de chaque branche. Grâce à l'apprentissage par renforcement par le jeu autonome, les prédictions du réseau et les résultats de recherche se renforcent mutuellement et s'améliorent régulièrement. Aucun jeu humain ou fonction d'évaluation artisanale n'est nécessaire, juste les règles et une récompense pour gagner.

Impact stratégique

Stratégie du fournisseur

Les feuilles de route des fournisseurs influencent les fonctionnalités que votre équipe peut ensuite créer.

Coût et budget

Les conditions commerciales et les options de déploiement affectent les coûts et les risques à long terme.

Risques et sécurité

Les incitations des entreprises façonnent les défauts des produits, la posture de sécurité et l’ouverture.

L'avenir d'AlphaGo et d'AlphaZero

La recette AlphaZero, l'apprentissage par le jeu autonome guidé par la recherche, influence désormais la robotique, la découverte scientifique et le raisonnement sur des modèles de langage étendu, où les modèles « recherchent » les étapes de la solution. Des descendants comme MuZero et AlphaProof appliquent ces idées à la planification sans règles connues et aux mathématiques. Attendez-vous à ce que le jeu autonome et la recherche arborescente continuent d’alimenter les systèmes qui doivent planifier, élaborer des stratégies et découvrir de nouvelles solutions, de plus en plus fusionnées avec les techniques de raisonnement apparaissant désormais dans les modèles d’IA frontières.

Mise en œuvre dans le monde réel

Vaincre les champions du monde de Go Lee Sedol (2016) et Ke Jie (2017) dans des matchs marquants

AlphaZero apprend lui-même les échecs surhumains en quelques heures, révélant de nouvelles idées d'ouverture et de sacrifice étudiées par les grands maîtres.

MuZero maîtrise les jeux de Go, d'échecs, de shogi et d'Atari sans connaître les règles

Des méthodes inspirantes d'auto-jeu et de recherche désormais utilisées en robotique, en mathématiques (AlphaProof) et en raisonnement LLM.

Risques et garde-fous

Les annonces de lancement peuvent dépasser la stabilité des flux de production réels.

La tarification des API ou les changements de politique peuvent briser les hypothèses du jour au lendemain.

La dépendance à un seul fournisseur augmente les coûts de verrouillage et de migration.

Feuille de route de mise en œuvre

1

Évaluez les fournisseurs à l’aide de vos propres tâches et ensembles de données.

2

Vérifiez les conditions de confidentialité, de sécurité et juridiques avant l’intégration.

3

Maintenez un plan de secours entre les modèles ou les fournisseurs.

4

Surveillez les notes de version afin que les modifications de la feuille de route ne surprennent pas les équipes.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AlphaGo and AlphaZero quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Questions fréquemment posées

What is AlphaGo and AlphaZero?

AlphaGo était le programme DeepMind qui a battu les meilleurs joueurs de Go du monde, une étape importante que l'on pensait depuis des décennies. AlphaZero a ensuite maîtrisé le Go, les échecs et le shogi entièrement en jouant seul, apprenant des compétences surhumaines à partir de zéro.

Pourquoi le jeu de Go était-il considéré comme particulièrement difficile pour les ordinateurs ?

L'énorme facteur de branchement de Go rend la recherche par force brute impossible, le succès nécessitait donc une intuition apprise.

Qui AlphaGo a-t-il battu 4-1 en 2016 ?

AlphaGo a battu le meilleur champion de Go Lee Sedol 4-1 lors d'un match largement regardé en 2016.

Comment AlphaZero a-t-il appris à jouer, contrairement à AlphaGo ?

AlphaZero est parti uniquement des règles et a appris uniquement en jouant contre lui-même, sans données de jeu humaines.

Quelle méthode de recherche AlphaZero associe-t-il à son réseau neuronal ?

AlphaZero utilise Monte Carlo Tree Search guidé par la politique et les prédictions de valeur d'un réseau neuronal.

Quelles sont les deux choses que le réseau neuronal d’AlphaZero prédit pour guider sa recherche ?

Les résultats du réseau qui évoluent semblent prometteurs (politique) et une estimation de qui va gagner (valeur), concentrant la recherche.