AlphaGo en AlphaZero
AlphaGo was het DeepMind-programma dat de beste Go-spelers ter wereld versloeg, een mijlpaal waar al tientallen jaren over wordt nagedacht.
Overzicht
AlphaZero then mastered Go, chess, and shogi entirely through self-play, learning superhuman skill from scratch.
Diepe duik
Go heeft meer mogelijke bordposities dan atomen in het waarneembare universum, waardoor zoeken met brute kracht hopeloos is en intuïtie essentieel. In 2016 versloeg AlphaGo de legendarische kampioen Lee Sedol met 4-1, waarbij de beroemde 'Move 37' experts op creatief vlak niet-menselijk noemden. AlphaGo leerde van menselijke expertspellen plus zelfspel. In 2017 ging AlphaZero verder: beginnend met alleen de regels en zonder menselijke gegevens, leerde het zichzelf door miljoenen spellen tegen zichzelf te spelen, waarbij het binnen enkele uren tot dagen de beste Go-, schaak- en shogi-programma's overtrof. Een later systeem, MuZero, leerde zelfs zelfstandig de spelregels. Deze mijlpalen lieten zien hoe versterkend leren en zoeken strategieën kunnen ontdekken die verder gaan dan menselijke kennis.
Technisch inzicht
AlphaZero combineert een diep neuraal netwerk met Monte Carlo Tree Search (MCTS). Het netwerk voert een beleid uit (welke bewegingen er veelbelovend uitzien) en een waarde (wie zal waarschijnlijk winnen), waardoor de zoektocht wordt begeleid om alleen de meest relevante lijnen te verkennen in plaats van elke tak. Door zelf spelend leren versterken de voorspellingen van het netwerk en de zoekresultaten elkaar, waardoor ze gestaag verbeteren. Er zijn geen menselijke spelletjes of handgemaakte evaluatiefuncties nodig, alleen de regels en een beloning voor het winnen.
Strategische impact
Vendor strategy
Roadmaps van leveranciers beïnvloeden welke functies uw team vervolgens kan bouwen.
Cost and budget
Commerciële voorwaarden en implementatieopties zijn van invloed op de kosten en risico's op de lange termijn.
Risk and safety
Bedrijfsprikkels bepalen productgebreken, veiligheidshouding en openheid.
De toekomst van AlphaGo en AlphaZero
Het AlphaZero-recept, leren door zelf te spelen, geleid door zoeken, beïnvloedt nu robotica, wetenschappelijke ontdekkingen en redeneren in grote taalmodellen, waarbij modellen over oplossingsstappen 'zoeken'. Afstammelingen als MuZero en AlphaProof passen deze ideeën toe op planning zonder bekende regels en op wiskunde. Verwacht dat zelfspel en het zoeken naar bomen systemen blijven voeden die nieuwe oplossingen moeten plannen, strategiseren en ontdekken, steeds meer gecombineerd met de redeneringstechnieken die nu in grensverleggende AI-modellen verschijnen.
Implementatie in de echte wereld
Versla wereldkampioenen Go Lee Sedol (2016) en Ke Jie (2017) in historische wedstrijden
AlphaZero leert zichzelf binnen enkele uren bovenmenselijk schaken en onthult nieuwe openings- en opofferingsideeën die door grootmeesters zijn bestudeerd
MuZero beheerst Go-, schaak-, shogi- en Atari-spellen zonder dat de regels hem worden verteld
Inspirerende zelfspel- en zoekmethoden die nu worden gebruikt in robotica, wiskunde (AlphaProof) en LLM-redeneren
Risico's en vangrails
Lanceringsaankondigingen kunnen de stabiliteit in echte productieworkflows overtreffen.
API-prijzen of beleidswijzigingen kunnen van de ene op de andere dag de aannames doorbreken.
De afhankelijkheid van één leverancier verhoogt de lock-in- en migratiekosten.
Implementatie routekaart
Evalueer providers met behulp van uw eigen taken en datasets.
Controleer de privacy-, beveiligings- en juridische voorwaarden vóór de integratie.
Onderhoud een noodplan voor alle modellen of leveranciers.
Houd de release-opmerkingen in de gaten, zodat wijzigingen in de routekaart teams niet verrassen.
Blijf verkennen
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the AlphaGo and AlphaZero quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Zhipu GLM-modellen
Frequently asked questions
What is AlphaGo and AlphaZero?
AlphaGo was het DeepMind-programma dat de beste Go-spelers ter wereld versloeg, een mijlpaal waar al tientallen jaren over wordt nagedacht. AlphaZero beheerste vervolgens Go, schaken en shogi volledig door zelf te spelen, waarbij hij vanaf het begin bovenmenselijke vaardigheden leerde.
Waarom werd het spel Go als bijzonder moeilijk voor computers beschouwd?
De enorme vertakkingsfactor van Go maakt zoeken met brute kracht onhaalbaar, dus succes vereiste aangeleerde intuïtie.
Wie versloeg AlphaGo in 2016 met 4-1?
AlphaGo versloeg top Go-kampioen Lee Sedol met 4-1 in een veel bekeken wedstrijd van 2016.
Hoe heeft AlphaZero leren spelen, in tegenstelling tot AlphaGo?
AlphaZero begon alleen met de regels en leerde uitsluitend door tegen zichzelf te spelen, zonder menselijke spelgegevens.
Welke zoekmethode koppelt AlphaZero aan zijn neurale netwerk?
AlphaZero maakt gebruik van Monte Carlo Tree Search, geleid door het beleid en de waardevoorspellingen van een neuraal netwerk.
Welke twee dingen voorspelt het neurale netwerk van AlphaZero als leidraad voor de zoektocht?
De netwerkoutputs die bewegen zien er veelbelovend uit (beleid) en een schatting van wie zal winnen (waarde), waarbij de zoektocht wordt gefocust.