AlphaGo és AlphaZero
Az AlphaGo a DeepMind program volt, amely legyőzte a világ legjobb Go-játékosait, ami évtizedekkel távolabbi mérföldkő volt.
Áttekintés
AlphaZero then mastered Go, chess, and shogi entirely through self-play, learning superhuman skill from scratch.
Mély merülés
A Go-nak több lehetséges táblapozíciója van, mint az atomoknak a megfigyelhető univerzumban, ami reménytelenné teszi a nyers erejű keresést, az intuíció pedig elengedhetetlen. 2016-ban az AlphaGo 4-1-re legyőzte a legendás bajnokot, Lee Sedolt, a híres „Move 37” lenyűgöző szakértőivel pedig kreatívan nem emberként. Az AlphaGo az emberi szakértői játékokból és az önálló játékból tanult. 2017-ben az AlphaZero tovább ment: csak a szabályokkal és emberi adatok nélkül, több millió játszmát játszott önmaga ellen, órákon vagy napokon belül felülmúlva a legjobb Go, sakk és shogi programokat. Egy későbbi rendszer, a MuZero még a játékszabályokat is megtanulta magától. Ezek a mérföldkövek bemutatták, hogy a megerősített tanulás és a keresés hogyan fedezhet fel az emberi tudáson túlmutató stratégiákat.
Technikai betekintés
Az AlphaZero egy mély neurális hálózatot egyesít a Monte Carlo Tree Search (MCTS) szolgáltatással. A hálózat kiad egy irányelvet (amely a mozgások ígéretesnek tűnnek) és egy értéket (aki valószínűleg nyer), és arra irányítja a keresést, hogy minden ág helyett csak a legrelevánsabb vonalakat fedezze fel. Az önjátékot megerősítő tanulás révén a hálózat előrejelzései és a keresési eredmények erősítik egymást, és folyamatosan javulnak. Nincs szükség emberi játékokra vagy kézzel készített értékelési funkciókra, csak a szabályokra és a nyereményért járó jutalomra.
Stratégiai hatás
Szállítói stratégia
A szállítói ütemterv befolyásolja, hogy csapata milyen funkciókat építhet fel legközelebb.
Költség és költségvetés
A kereskedelmi feltételek és a telepítési lehetőségek befolyásolják a hosszú távú költségeket és kockázatokat.
Kockázat és biztonság
A vállalati ösztönzők alakítják a termék alapértelmezett beállításait, a biztonsági testtartást és a nyitottságot.
Az AlphaGo és az AlphaZero jövője
Az AlphaZero receptje, amely a keresés által irányított önjátékon tanul, immár hatással van a robotikára, a tudományos felfedezésekre és a nagy nyelvű modellek gondolkodására, ahol a modellek „keresnek” a megoldás lépései között. Az olyan leszármazottak, mint a MuZero és az AlphaProof, alkalmazzák ezeket az ötleteket az ismert szabályok nélküli tervezésben és a matematikában. Az önjátéktól és a fakereséstől azt várják, hogy továbbra is olyan rendszereket hajtsanak végre, amelyeknek meg kell tervezniük, stratégiát kell készíteniük és új megoldásokat kell felfedezniük, egyre inkább összeolvadva a határ menti AI-modellekben most megjelenő érvelési technikákkal.
Valós megvalósítás
Lee Sedol (2016) és Ke Jie (2017) legyőzése mérföldkőnek számító mérkőzéseken.
Az AlphaZero órák alatt tanítja meg magának az emberfeletti sakkot, felfedve a nagymesterek által tanulmányozott friss nyitási és áldozati ötleteket
A MuZero elsajátítja a Go-, sakk-, shogi- és Atari-játékokat anélkül, hogy elmondanák neki a szabályokat
Inspiráló önjáték és keresési módszerek, amelyeket ma már használnak a robotikában, a matematikában (AlphaProof) és az LLM gondolkodásban
Kockázatok és védőkorlátok
Az indítási bejelentések meghaladhatják a valódi termelési munkafolyamatok stabilitását.
Az API-árazás vagy az irányelvváltások egyik napról a másikra megdönthetik a feltételezéseket.
Az egyszállítótól való függőség növeli a bezárási és migrációs költségeket.
Végrehajtási ütemterv
Értékelje a szolgáltatókat saját feladatai és adatkészletei segítségével.
Az integráció előtt tekintse át az adatvédelmi, biztonsági és jogi feltételeket.
Tartsa fenn a tartalék tervet a modellek vagy szállítók között.
Figyelje a kiadási megjegyzéseket, hogy az ütemterv változásai ne lepjék meg a csapatokat.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the AlphaGo and AlphaZero quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
Zhipu GLM modellek
Gyakran ismételt kérdések
What is AlphaGo and AlphaZero?
Az AlphaGo a DeepMind program volt, amely legyőzte a világ legjobb Go-játékosait, ami évtizedekkel távolabbi mérföldkő volt. Az AlphaZero ezután teljesen saját játékon keresztül sajátította el a Go-t, a sakkot és a shogit, emberfeletti képességeket tanulva a semmiből.
Miért tartották a Go játékot különösen nehéznek a számítógépek számára?
A Go hatalmas elágazási tényezője lehetetlenné teszi a nyers erejű keresést, így a sikerhez tanult intuíció kellett.
Kit győzött le az AlphaGo 4-1-re 2016-ban?
Az AlphaGo 4-1-re legyőzte a Go-bajnok Lee Sedolt egy széles körben nézett 2016-os mérkőzésen.
Hogyan tanult meg az AlphaZero játszani, ellentétben az AlphaGóval?
Az AlphaZero a szabályokból indult ki, és kizárólag önmaga ellen játszott, emberi játékadatok nélkül.
Melyik keresési módszert párosítja az AlphaZero a neurális hálózatával?
Az AlphaZero a Monte Carlo Tree Search szolgáltatást használja, amelyet egy neurális hálózat szabályzata és értékbecslései vezérelnek.
Milyen két dolgot jósol az AlphaZero neurális hálózata, amelyek irányítják a keresést?
A hálózati kimenetek, amelyek mozognak, ígéretesnek tűnnek (irányelv), és becslések arra vonatkozóan, hogy ki fog nyerni (érték), a keresés fókuszában.