Фирми РЪКОВОДСТВО

AlphaGo и AlphaZero

AlphaGo беше програмата DeepMind, която победи най-добрите играчи на Go в света, крайъгълен камък, смятан отдавна след десетилетия.

2 min readПоследна актуализация

Преглед

AlphaZero then mastered Go, chess, and shogi entirely through self-play, learning superhuman skill from scratch.

Дълбоко гмуркане

Go има повече възможни позиции на дъската, отколкото атомите в наблюдаваната вселена, което прави търсенето с груба сила безнадеждно и интуицията е от съществено значение. През 2016 г. AlphaGo победи легендарния шампион Лий Седол с 4-1, със своя прочут „Ход 37“ зашеметяващи експерти като творчески нечовеци. AlphaGo се учи от човешки експертни игри плюс самостоятелна игра. През 2017 г. AlphaZero отиде по-далеч: като започна само с правилата и без човешки данни, той се научи, като играеше милиони игри срещу себе си, надминавайки най-добрите Go, шах и шоги програми за часове до дни. По-късна система, MuZero, дори научи правилата на игрите сама. Тези важни етапи показаха как ученето с подсилване плюс търсенето може да открие стратегии отвъд човешкото познание.

Техническа информация

AlphaZero съчетава дълбока невронна мрежа с търсене на дърво в Монте Карло (MCTS). Мрежата извежда политика (кои ходове изглеждат обещаващи) и стойност (кой вероятно печели), насочвайки търсенето да изследва само най-подходящите линии вместо всеки клон. Чрез обучение за подсилване на самостоятелна игра, прогнозите на мрежата и резултатите от търсенето се подсилват взаимно, като непрекъснато се подобряват. Не са необходими човешки игри или ръчно изработени функции за оценка, само правила и награда за победа.

Стратегическо въздействие

Vendor strategy

Пътните карти на доставчиците влияят на това какви функции вашият екип може да изгради по-нататък.

Cost and budget

Търговските условия и опциите за внедряване влияят върху дългосрочните разходи и риск.

Risk and safety

Стимулите на компанията оформят продуктовите стандарти, безопасността и откритостта.

Бъдещето на AlphaGo и AlphaZero

Рецептата AlphaZero, учене чрез самостоятелна игра, ръководена от търсене, сега влияе върху роботиката, научните открития и разсъжденията на модела на голям език, където моделите „търсят“ над стъпките на решение. Наследници като MuZero и AlphaProof прилагат тези идеи към планирането без известни правила и към математиката. Очаквайте самостоятелна игра и търсене в дърво, за да продължат да захранват системите, които трябва да планират, изготвят стратегии и да откриват нови решения, все повече съчетани с техниките за разсъждение, които сега се появяват в граничните AI модели.

Внедряване в реалния свят

Побеждавайки световните шампиони по Go Lee Sedol (2016) и Ke Jie (2017) в забележителни мачове

AlphaZero се обучава на свръхчовешки шах за часове, разкривайки свежи идеи за отваряне и жертване, изучавани от гросмайстори

MuZero овладява игрите Go, шах, шоги и Atari, без да му се казват правилата

Вдъхновяващи методи за самостоятелна игра и търсене, които сега се използват в роботиката, математиката (AlphaProof) и LLM разсъжденията

Рискове и предпазни огради

Съобщенията за стартиране може да изпреварят стабилността в реалните производствени работни процеси.

Ценообразуването на API или промените в политиката могат да разбият предположенията за една нощ.

Зависимостта от един доставчик увеличава разходите за заключване и миграция.

Пътна карта за изпълнение

1

Оценявайте доставчиците, като използвате вашите собствени задачи и набори от данни.

2

Прегледайте поверителността, сигурността и правните условия преди интегриране.

3

Поддържайте резервен план за модели или доставчици.

4

Наблюдавайте бележките по изданието, така че промените в пътната карта да не изненадват екипите.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AlphaGo and AlphaZero quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Zhipu GLM модели

Frequently asked questions

What is AlphaGo and AlphaZero?

AlphaGo беше програмата DeepMind, която победи най-добрите играчи на Go в света, крайъгълен камък, смятан отдавна след десетилетия. След това AlphaZero усвои го, шах и шоги изцяло чрез самостоятелна игра, научавайки свръхчовешки умения от нулата.

Защо играта Go беше смятана за особено трудна за компютрите?

Огромният фактор на разклоняване на Go прави търсенето с груба сила невъзможно, така че успехът изисква научена интуиция.

Кого победи AlphaGo с 4-1 през 2016 г.?

AlphaGo победи топ шампиона в Go Lee Sedol с 4-1 в много гледан мач от 2016 г.

Как AlphaZero се научи да играе, за разлика от AlphaGo?

AlphaZero започна само от правилата и се научи единствено като играеше срещу себе си, без данни за човешки игри.

Кой метод за търсене свързва AlphaZero със своята невронна мрежа?

AlphaZero използва Monte Carlo Tree Search, ръководен от политиката на невронната мрежа и прогнозите за стойността.

Какви две неща прогнозира невронната мрежа на AlphaZero, за да ръководи търсенето?

Мрежовите изходи, които изглеждат обещаващи (политика) и прогноза за това кой ще спечели (стойност), фокусирайки търсенето.