AlphaGo och AlphaZero
AlphaGo var DeepMind-programmet som slog världens bästa Go-spelare, en milstolpe som länge trodde decennier bort.
Översikt
AlphaZero then mastered Go, chess, and shogi entirely through self-play, learning superhuman skill from scratch.
Djupdykning
Go har fler möjliga styrelsepositioner än atomer i det observerbara universum, vilket gör brute-force-sökning hopplös och intuition viktig. 2016 besegrade AlphaGo den legendariske mästaren Lee Sedol med 4-1, med sina berömda "Move 37" fantastiska experter som kreativt icke-mänskliga. AlphaGo lärde sig från mänskliga expertspel plus självspel. Under 2017 gick AlphaZero längre: började med bara reglerna och inga mänskliga data, den lärde sig själv genom att spela miljontals spel mot sig själv och överträffade de bästa Go-, schack- och shogiprogrammen inom några timmar till dagar. Ett senare system, MuZero, lärde sig till och med spelreglerna på egen hand. Dessa milstolpar visade hur förstärkningsinlärning plus sökning kan upptäcka strategier bortom mänsklig kunskap.
Teknisk insikt
AlphaZero kombinerar ett djupt neuralt nätverk med Monte Carlo Tree Search (MCTS). Nätverket matar ut en policy (vilka rörelser ser lovande ut) och ett värde (vem som sannolikt vinner), som vägleder sökningen för att bara utforska de mest relevanta linjerna istället för varje gren. Genom självspelsförstärkningsinlärning förstärker nätverkets förutsägelser och sökresultaten varandra och förbättras stadigt. Inga mänskliga spel eller handgjorda utvärderingsfunktioner behövs, bara reglerna och en belöning för att vinna.
Strategisk inverkan
Vendor strategy
Leverantörsfärdplaner påverkar vilka funktioner ditt team kan bygga härnäst.
Cost and budget
Kommersiella villkor och distributionsalternativ påverkar långsiktiga kostnader och risker.
Risk and safety
Företagsincitament formar produktstandarder, säkerhetsställning och öppenhet.
Framtiden för AlphaGo och AlphaZero
AlphaZero-receptet, inlärning genom självspel guidad av sökning, påverkar nu robotik, vetenskaplig upptäckt och resonemang för stora språkmodeller, där modeller "söker" över lösningssteg. Ättlingar som MuZero och AlphaProof tillämpar dessa idéer på planering utan kända regler och på matematik. Förvänta dig självspel och trädsökning för att fortsätta driva system som måste planera, planera och upptäcka nya lösningar, allt mer sammansmälta med de resonemangstekniker som nu förekommer i frontier AI-modeller.
Real-World Implementation
Besegra världsmästarna i Go, Lee Sedol (2016) och Ke Jie (2017) i landmärken
AlphaZero lär sig själv övermänskligt schack på timmar och avslöjar nya öppnings- och offeridéer som studerats av stormästare
MuZero behärskar Go-, schack-, shogi- och Atari-spel utan att få veta reglerna
Inspirerande självspel och sökmetoder som nu används inom robotik, matematik (AlphaProof) och LLM-resonemang
Risker & skyddsräcken
Lanseringsmeddelanden kan överträffa stabiliteten i verkliga produktionsarbetsflöden.
API-prissättning eller policyförskjutningar kan bryta antaganden över en natt.
Beroende av en leverantör ökar inlåsnings- och migreringskostnaderna.
Färdplan för genomförande
Utvärdera leverantörer med dina egna uppgifter och datauppsättningar.
Granska sekretess, säkerhet och juridiska villkor innan integration.
Upprätthåll en reservplan över modeller eller leverantörer.
Övervaka release notes så att förändringar i färdplanen inte överraskar team.
Fortsätt utforska
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the AlphaGo and AlphaZero quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Zhipu GLM-modeller
Frequently asked questions
What is AlphaGo and AlphaZero?
AlphaGo var DeepMind-programmet som slog världens bästa Go-spelare, en milstolpe som länge trodde decennier bort. AlphaZero bemästrade sedan Go, schack och shogi helt och hållet genom självspel och lärde sig övermänskliga färdigheter från grunden.
Varför ansågs spelet Go vara särskilt svårt för datorer?
Gos enorma förgreningsfaktor gör sökning med brute-force omöjlig, så framgång krävde inlärd intuition.
Vem var det som AlphaGo besegrade med 4-1 2016?
AlphaGo slog topp Go-mästaren Lee Sedol med 4-1 i en mycket sedd match 2016.
Hur lärde sig AlphaZero att spela, till skillnad från AlphaGo?
AlphaZero utgick från bara reglerna och lärde sig enbart genom att spela mot sig själv, utan mänskliga speldata.
Vilken sökmetod kopplar AlphaZero ihop med sitt neurala nätverk?
AlphaZero använder Monte Carlo Tree Search som styrs av ett neuralt nätverks policy och värdeförutsägelser.
Vilka två saker förutspår AlphaZeros neurala nätverk att vägleda dess sökning?
Nätverkets utdata som flyttar ser lovande ut (policy) och en uppskattning av vem som kommer att vinna (värde), vilket fokuserar sökningen.