BedriftsGUIDE

AlphaGo og AlphaZero

AlphaGo var DeepMind-programmet som slo verdens beste Go-spillere, en milepæl mange tiår unna.

2 min lesingSist oppdatert

Oversikt

AlphaZero then mastered Go, chess, and shogi entirely through self-play, learning superhuman skill from scratch.

Dypdykk

Go har flere mulige styreposisjoner enn atomer i det observerbare universet, noe som gjør brute-force-søk håpløst og intuisjon avgjørende. I 2016 beseiret AlphaGo den legendariske mesteren Lee Sedol 4-1, med sine berømte 'Move 37' fantastiske eksperter som kreativt ikke-menneskelige. AlphaGo lærte av menneskelige ekspertspill pluss selvspill. I 2017 gikk AlphaZero videre: fra kun reglene og ingen menneskelige data, lærte den seg selv ved å spille millioner av spill mot seg selv, og overgikk de beste Go-, sjakk- og shogi-programmene i løpet av timer til dager. Et senere system, MuZero, lærte til og med spillereglene på egen hånd. Disse milepælene viste hvordan forsterkende læring pluss søk kan oppdage strategier utover menneskelig kunnskap.

Teknisk innsikt

AlphaZero kombinerer et dypt nevralt nettverk med Monte Carlo Tree Search (MCTS). Nettverket sender ut en policy (hvilke bevegelser ser lovende ut) og en verdi (hvem som sannsynligvis vinner), og veileder søket til å utforske bare de mest relevante linjene i stedet for hver gren. Gjennom selvspillforsterkende læring forsterker nettverkets spådommer og søkeresultatene hverandre, og blir stadig bedre. Ingen menneskelige spill eller håndlagde evalueringsfunksjoner er nødvendig, bare reglene og en belønning for å vinne.

Strategisk innvirkning

Vendor strategy

Leverandørveikart påvirker hvilke funksjoner teamet ditt kan bygge videre.

Cost and budget

Kommersielle vilkår og distribusjonsalternativer påvirker langsiktige kostnader og risiko.

Risiko og sikkerhet

Selskapets insentiver former produktstandarder, sikkerhetsstilling og åpenhet.

Fremtiden til AlphaGo og AlphaZero

AlphaZero-oppskriften, læring ved selvspill guidet av søk, påvirker nå robotikk, vitenskapelig oppdagelse og storspråklige modellresonnement, der modeller "søker" over løsningstrinn. Etterkommere som MuZero og AlphaProof bruker disse ideene til planlegging uten kjente regler og på matematikk. Forvent selvspill og tresøk for å fortsette å drive systemer som må planlegge, legge strategier og oppdage nye løsninger, i økende grad smeltet sammen med resonneringsteknikkene som nå vises i frontier AI-modeller.

Real-World Implementering

Beseiret verdensmesterne Lee Sedol (2016) og Ke Jie (2017) i landemerkekamper

AlphaZero lærer seg selv overmenneskelig sjakk på timer, og avslører nye åpnings- og ofringsideer studert av stormestere

MuZero mestrer Go-, sjakk-, shogi- og Atari-spill uten å bli fortalt reglene

Inspirerende selvspilling og søkemetoder som nå brukes i robotikk, matematikk (AlphaProof) og LLM-resonnement

Risikoer og rekkverk

Lanseringskunngjøringer kan overgå stabiliteten i ekte produksjonsarbeidsflyter.

API-priser eller endringer i retningslinjene kan bryte antagelser over natten.

Avhengighet av én leverandør øker kostnadene for innlåsing og migrering.

Veikart for implementering

1

Evaluer leverandører ved å bruke dine egne oppgaver og datasett.

2

Se gjennom personvern, sikkerhet og juridiske vilkår før integrering.

3

Oppretthold en reserveplan på tvers av modeller eller leverandører.

4

Overvåk utgivelsesnotater slik at endringer i veikart ikke overrasker teamene.

Fortsett å utforske

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AlphaGo and AlphaZero quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Ofte stilte spørsmål

What is AlphaGo and AlphaZero?

AlphaGo var DeepMind-programmet som slo verdens beste Go-spillere, en milepæl mange tiår unna. AlphaZero mestret deretter Go, sjakk og shogi helt gjennom selvspill, og lærte overmenneskelige ferdigheter fra bunnen av.

Hvorfor ble spillet Go ansett som spesielt vanskelig for datamaskiner?

Gos enorme forgreningsfaktor gjør brute-force-søk umulig, så suksess krevde innlært intuisjon.

Hvem beseiret AlphaGo som kjent 4-1 i 2016?

AlphaGo slo topp Go-mester Lee Sedol 4-1 i en mye sett 2016-kamp.

Hvordan lærte AlphaZero å spille, i motsetning til AlphaGo?

AlphaZero startet fra kun reglene og lærte utelukkende ved å spille mot seg selv, uten menneskelige spilldata.

Hvilken søkemetode parer AlphaZero med sitt nevrale nettverk?

AlphaZero bruker Monte Carlo Tree Search veiledet av et nevralt nettverks policy og verdispådommer.

Hvilke to ting spår AlphaZeros nevrale nettverk for å lede søket?

Nettverksutgangene som trekk ser lovende ut (policy) og et anslag på hvem som vil vinne (verdi), og fokuserer søket.