FöretagsGUIDE

AlphaGo och AlphaZero

AlphaGo var DeepMind-programmet som slog världens bästa Go-spelare, en milstolpe som länge trodde decennier bort.

2 min readSenast uppdaterad

Översikt

AlphaZero then mastered Go, chess, and shogi entirely through self-play, learning superhuman skill from scratch.

Djupdykning

Go har fler möjliga styrelsepositioner än atomer i det observerbara universum, vilket gör brute-force-sökning hopplös och intuition viktig. 2016 besegrade AlphaGo den legendariske mästaren Lee Sedol med 4-1, med sina berömda "Move 37" fantastiska experter som kreativt icke-mänskliga. AlphaGo lärde sig från mänskliga expertspel plus självspel. Under 2017 gick AlphaZero längre: började med bara reglerna och inga mänskliga data, den lärde sig själv genom att spela miljontals spel mot sig själv och överträffade de bästa Go-, schack- och shogiprogrammen inom några timmar till dagar. Ett senare system, MuZero, lärde sig till och med spelreglerna på egen hand. Dessa milstolpar visade hur förstärkningsinlärning plus sökning kan upptäcka strategier bortom mänsklig kunskap.

Teknisk insikt

AlphaZero kombinerar ett djupt neuralt nätverk med Monte Carlo Tree Search (MCTS). Nätverket matar ut en policy (vilka rörelser ser lovande ut) och ett värde (vem som sannolikt vinner), som vägleder sökningen för att bara utforska de mest relevanta linjerna istället för varje gren. Genom självspelsförstärkningsinlärning förstärker nätverkets förutsägelser och sökresultaten varandra och förbättras stadigt. Inga mänskliga spel eller handgjorda utvärderingsfunktioner behövs, bara reglerna och en belöning för att vinna.

Strategisk inverkan

Vendor strategy

Leverantörsfärdplaner påverkar vilka funktioner ditt team kan bygga härnäst.

Cost and budget

Kommersiella villkor och distributionsalternativ påverkar långsiktiga kostnader och risker.

Risk and safety

Företagsincitament formar produktstandarder, säkerhetsställning och öppenhet.

Framtiden för AlphaGo och AlphaZero

AlphaZero-receptet, inlärning genom självspel guidad av sökning, påverkar nu robotik, vetenskaplig upptäckt och resonemang för stora språkmodeller, där modeller "söker" över lösningssteg. Ättlingar som MuZero och AlphaProof tillämpar dessa idéer på planering utan kända regler och på matematik. Förvänta dig självspel och trädsökning för att fortsätta driva system som måste planera, planera och upptäcka nya lösningar, allt mer sammansmälta med de resonemangstekniker som nu förekommer i frontier AI-modeller.

Real-World Implementation

Besegra världsmästarna i Go, Lee Sedol (2016) och Ke Jie (2017) i landmärken

AlphaZero lär sig själv övermänskligt schack på timmar och avslöjar nya öppnings- och offeridéer som studerats av stormästare

MuZero behärskar Go-, schack-, shogi- och Atari-spel utan att få veta reglerna

Inspirerande självspel och sökmetoder som nu används inom robotik, matematik (AlphaProof) och LLM-resonemang

Risker & skyddsräcken

Lanseringsmeddelanden kan överträffa stabiliteten i verkliga produktionsarbetsflöden.

API-prissättning eller policyförskjutningar kan bryta antaganden över en natt.

Beroende av en leverantör ökar inlåsnings- och migreringskostnaderna.

Färdplan för genomförande

1

Utvärdera leverantörer med dina egna uppgifter och datauppsättningar.

2

Granska sekretess, säkerhet och juridiska villkor innan integration.

3

Upprätthåll en reservplan över modeller eller leverantörer.

4

Övervaka release notes så att förändringar i färdplanen inte överraskar team.

Fortsätt utforska

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AlphaGo and AlphaZero quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Starta frågesport

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Zhipu GLM-modeller

Frequently asked questions

What is AlphaGo and AlphaZero?

AlphaGo var DeepMind-programmet som slog världens bästa Go-spelare, en milstolpe som länge trodde decennier bort. AlphaZero bemästrade sedan Go, schack och shogi helt och hållet genom självspel och lärde sig övermänskliga färdigheter från grunden.

Varför ansågs spelet Go vara särskilt svårt för datorer?

Gos enorma förgreningsfaktor gör sökning med brute-force omöjlig, så framgång krävde inlärd intuition.

Vem var det som AlphaGo besegrade med 4-1 2016?

AlphaGo slog topp Go-mästaren Lee Sedol med 4-1 i en mycket sedd match 2016.

Hur lärde sig AlphaZero att spela, till skillnad från AlphaGo?

AlphaZero utgick från bara reglerna och lärde sig enbart genom att spela mot sig själv, utan mänskliga speldata.

Vilken sökmetod kopplar AlphaZero ihop med sitt neurala nätverk?

AlphaZero använder Monte Carlo Tree Search som styrs av ett neuralt nätverks policy och värdeförutsägelser.

Vilka två saker förutspår AlphaZeros neurala nätverk att vägleda dess sökning?

Nätverkets utdata som flyttar ser lovande ut (policy) och en uppskattning av vem som kommer att vinna (värde), vilket fokuserar sökningen.