AlphaGo a AlphaZero
AlphaGo byl program DeepMind, který porazil nejlepší světové hráče Go, což je milník, který je vzdálený desítky let.
Přehled
AlphaZero then mastered Go, chess, and shogi entirely through self-play, learning superhuman skill from scratch.
Hluboký ponor
Go má více možných pozic na desce než atomy v pozorovatelném vesmíru, takže hledání hrubou silou je beznadějné a intuice je nezbytná. V roce 2016 AlphaGo porazila legendárního šampiona Lee Sedola 4-1, přičemž jeho slavný 'Move 37' ohromující experti byli kreativně nelidští. AlphaGo se poučil z lidských expertních her a vlastní hry. V roce 2017 šel AlphaZero ještě dále: začal pouze s pravidly a žádnými lidskými daty, učil se tím, že hrál miliony her sám proti sobě, přičemž během hodin až dnů překonal nejlepší programy Go, šachy a shogi. Pozdější systém, MuZero, se dokonce sám naučil pravidla her. Tyto milníky ukázaly, jak posílení učení a hledání může objevit strategie, které přesahují lidské znalosti.
Technický přehled
AlphaZero kombinuje hlubokou neuronovou síť s Monte Carlo Tree Search (MCTS). Síť vytváří politiku (které pohyby vypadají slibně) a hodnotu (která pravděpodobně vyhraje), což vede hledání k prozkoumání pouze nejrelevantnějších linií namísto každé větve. Prostřednictvím posilování učení formou self-play se předpovědi sítě a výsledky vyhledávání vzájemně posilují a neustále se zlepšují. Nejsou potřeba žádné lidské hry ani ručně vytvořené hodnotící funkce, pouze pravidla a odměna za výhru.
Strategický dopad
Strategie dodavatelů
Plány dodavatelů ovlivňují, jaké funkce může váš tým dále vybudovat.
Cena a rozpočet
Komerční podmínky a možnosti nasazení ovlivňují dlouhodobé náklady a rizika.
Riziko a bezpečnost
Firemní pobídky utvářejí výchozí produkty, bezpečný postoj a otevřenost.
Budoucnost AlphaGo a AlphaZero
Recept AlphaZero, učení samočinnou hrou vedenou hledáním, nyní ovlivňuje robotiku, vědecké objevy a uvažování pomocí velkojazyčných modelů, kde modely „hledají“ kroky řešení. Potomci jako MuZero a AlphaProof aplikují tyto myšlenky na plánování bez známých pravidel a na matematiku. Očekávejte samočinné hraní a hledání ve stromech, které udrží napájení systémů, které musí plánovat, strategicky a objevovat nová řešení, stále více splývající s technikami uvažování, které se nyní objevují v modelech hraniční umělé inteligence.
Real-World Implementace
Porážka mistrů světa Go Lee Sedol (2016) a Ke Jie (2017) v důležitých zápasech
AlphaZero se během hodin učí nadlidské šachy a odhaluje nové nápady na otevření a obětování, které studovali velmistři
MuZero ovládá hry Go, šachy, shogi a Atari, aniž by mu byla sdělena pravidla
Inspirativní metody sebehraní a vyhledávání, které se nyní používají v robotice, matematice (AlphaProof) a uvažování LLM
Rizika a zábradlí
Oznámení o uvedení mohou předstihnout stabilitu v reálných výrobních pracovních postupech.
Změny cen API nebo politik mohou přes noc narušit předpoklady.
Závislost na jediném dodavateli zvyšuje náklady na uzamčení a migraci.
Plán implementace
Vyhodnoťte poskytovatele pomocí vlastních úkolů a datových sad.
Před integrací si přečtěte podmínky ochrany soukromí, zabezpečení a právní podmínky.
Udržujte záložní plán napříč modely nebo dodavateli.
Sledujte poznámky k vydání, aby změny plánu nepřekvapily týmy.
Pokračujte v objevování
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the AlphaGo and AlphaZero quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Další průvodce
Modely Zhipu GLM
Často kladené otázky
What is AlphaGo and AlphaZero?
AlphaGo byl program DeepMind, který porazil nejlepší světové hráče Go, což je milník, který je vzdálený desítky let. AlphaZero pak ovládl Go, šachy a shogi zcela prostřednictvím sebe-hry a naučil se od nuly nadlidské dovednosti.
Proč byla hra Go považována za zvlášť náročnou pro počítače?
Obrovský faktor větvení Go činí hledání hrubou silou neproveditelným, takže úspěch vyžadoval naučenou intuici.
Koho AlphaGo slavně porazil 4-1 v roce 2016?
AlphaGo porazil nejlepšího šampiona Go Lee Sedola 4-1 v široce sledovaném zápase roku 2016.
Jak se AlphaZero naučil hrát, na rozdíl od AlphaGo?
AlphaZero začal pouze z pravidel a učil se pouze hraním sám proti sobě, bez lidských herních dat.
Kterou vyhledávací metodu AlphaZero spáruje se svou neuronovou sítí?
AlphaZero používá Monte Carlo Tree Search vedené politikou a předpovědí hodnot neuronové sítě.
Jaké dvě věci předpovídá neuronová síť AlphaZero jako vodítko při jejím hledání?
Síťové výstupy, které se pohybují, vypadají slibně (politika) a odhad, kdo vyhraje (hodnota), se zaměřením na vyhledávání.