GHID Firme

AlphaGo și AlphaZero

AlphaGo a fost programul DeepMind care i-a învins pe cei mai buni jucători de Go din lume, o piatră de hotar gândită la zeci de ani distanță.

2 minute de lecturăUltima actualizare

Prezentare generală

AlphaZero then mastered Go, chess, and shogi entirely through self-play, learning superhuman skill from scratch.

Scufundare în profunzime

Go are mai multe poziții posibile de tablă decât atomii în universul observabil, ceea ce face că căutarea cu forța brută este fără speranță și intuiția esențială. În 2016, AlphaGo l-a învins pe legendarul campion Lee Sedol cu ​​4-1, cu faimoșii săi experți uimitori „Move 37” ca fiind non-umani din punct de vedere creativ. AlphaGo a învățat din jocurile experților umani, plus jocul propriu. În 2017, AlphaZero a mers mai departe: începând doar cu regulile și fără date umane, a învățat singur jucând milioane de jocuri împotriva sa, depășind cele mai bune programe Go, șah și shogi în câteva ore sau zile. Un sistem mai târziu, MuZero, a învățat chiar și singur regulile jocurilor. Aceste repere au arătat modul în care învățarea prin consolidare plus căutarea pot descoperi strategii dincolo de cunoștințele umane.

Perspectivă tehnică

AlphaZero combină o rețea neuronală profundă cu Monte Carlo Tree Search (MCTS). Rețeaua emite o politică (care mișcările arată promițătoare) și o valoare (care este probabil câștigătoare), ghidând căutarea pentru a explora doar liniile cele mai relevante în loc de fiecare ramură. Prin învățare prin întărire prin auto-play, predicțiile rețelei și rezultatele căutării se întăresc reciproc, îmbunătățindu-se constant. Nu sunt necesare jocuri umane sau funcții de evaluare realizate manual, doar regulile și o recompensă pentru câștig.

Impact strategic

Strategia furnizorului

Foile de parcurs ale furnizorilor influențează caracteristicile pe care echipa ta le poate construi în continuare.

Cost și buget

Condițiile comerciale și opțiunile de implementare afectează costurile și riscurile pe termen lung.

Risc și siguranță

Stimulentele companiei modelează valorile implicite ale produselor, postura de siguranță și deschiderea.

Viitorul AlphaGo și AlphaZero

Rețeta AlphaZero, care învață prin joc propriu ghidat de căutare, influențează acum robotica, descoperirea științifică și raționamentul în limbaj mare, în care modelele „căută” peste pașii soluției. Descendenți precum MuZero și AlphaProof aplică aceste idei la planificarea fără reguli cunoscute și la matematică. Așteptați-vă ca auto-play-ul și căutarea în arbore să mențină sistemele de alimentare care trebuie să planifice, să stabilească strategii și să descopere soluții noi, din ce în ce mai îmbinate cu tehnicile de raționament care apar acum în modelele AI de frontieră.

Implementare în lumea reală

Învingând campionii mondiali la Go Lee Sedol (2016) și Ke Jie (2017) în meciuri de referință

AlphaZero se învață șah supraomenesc în câteva ore, dezvăluind idei proaspete de deschidere și sacrificiu studiate de marii maeștri

MuZero stăpânește jocurile Go, șah, shogi și Atari fără să i se spună regulile

Metode inspiratoare de auto-play și de căutare utilizate acum în robotică, matematică (AlphaProof) și raționament LLM

Riscuri și balustrade

Anunțurile de lansare pot depăși stabilitatea în fluxurile de producție reale.

Prețurile API sau schimbările de politică pot rupe ipoteze peste noapte.

Dependența de un singur furnizor crește costurile de blocare și migrare.

Foaia de parcurs de implementare

1

Evaluați furnizorii folosind propriile sarcini și seturi de date.

2

Examinați confidențialitatea, securitatea și condițiile legale înainte de integrare.

3

Mențineți un plan alternativ pentru modele sau furnizori.

4

Monitorizați notele de lansare, astfel încât modificările foii de parcurs să nu surprindă echipele.

Continuați să explorați

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AlphaGo and AlphaZero quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz Start

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Întrebări frecvente

What is AlphaGo and AlphaZero?

AlphaGo a fost programul DeepMind care i-a învins pe cei mai buni jucători de Go din lume, o piatră de hotar gândită la zeci de ani distanță. AlphaZero a stăpânit apoi Go, șah și shogi în întregime prin joc propriu, învățând abilități supraomenești de la zero.

De ce jocul Go a fost considerat deosebit de greu pentru computere?

Factorul enorm de ramificare al lui Go face că căutarea prin forță brută nu este posibilă, așa că succesul a necesitat intuiție învățată.

Cine a învins AlphaGo cu 4-1 în 2016?

AlphaGo l-a învins cu 4-1 pe campionul de top al Go, Lee Sedol, într-un meci urmărit pe scară largă din 2016.

Cum a învățat AlphaZero să joace, spre deosebire de AlphaGo?

AlphaZero a pornit doar de la reguli și a învățat doar jucând împotriva lui însuși, fără date de joc umane.

Ce metodă de căutare se asociază AlphaZero cu rețeaua sa neuronală?

AlphaZero folosește Căutarea arborelui Monte Carlo ghidată de politica unei rețele neuronale și predicțiile de valoare.

Ce două lucruri prezice rețeaua neuronală AlphaZero pentru a-și ghida căutarea?

Ieșirile rețelei care se mișcă arată promițătoare (politică) și o estimare a cine va câștiga (valoare), concentrând căutarea.