ГІД компаній

AlphaGo і AlphaZero

AlphaGo була програмою DeepMind, яка перемогла найкращих у світі гравців у го, і до цієї віхи ще довго думали через десятиліття.

2 хвилини читанняОстаннє оновлення

Огляд

AlphaZero then mastered Go, chess, and shogi entirely through self-play, learning superhuman skill from scratch.

Глибоке занурення

Go має більше можливих позицій на дошці, ніж атоми у спостережуваному всесвіті, що робить пошук грубою силою безнадійним, а інтуїція необхідна. У 2016 році AlphaGo переміг легендарного чемпіона Лі Седола з рахунком 4-1, завдяки своєму знаменитому «Хіду 37», який приголомшував експертів як творчо нелюдей. AlphaGo навчився в іграх експертів, а також у грі самостійно. У 2017 році AlphaZero пішов далі: починаючи лише з правил і без даних про людей, він навчився, граючи проти себе в мільйони ігор, перевершивши найкращі програми Го, шахи та сьогі за кілька годин до днів. Більш пізня система, MuZero, навіть самостійно вивчала правила гри. Ці віхи продемонстрували, як навчання з підкріпленням і пошук можуть виявити стратегії за межами людського знання.

Технічне розуміння

AlphaZero поєднує глибоку нейронну мережу з пошуком дерев Монте-Карло (MCTS). Мережа виводить політику (які кроки виглядають багатообіцяючими) і значення (хто, швидше за все, виграє), спрямовуючи пошук на дослідження лише найбільш релевантних ліній замість кожної гілки. Завдяки самостійному навчанню з підкріпленням прогнози мережі та результати пошуку підсилюють один одного, постійно покращуючись. Не потрібні жодні людські ігри чи ручні функції оцінювання, лише правила та нагорода за перемогу.

Стратегічний вплив

Стратегія постачальника

Дорожні карти постачальників впливають на те, які функції ваша команда може створити далі.

Вартість і бюджет

Комерційні умови та варіанти розгортання впливають на довгострокову вартість і ризик.

Ризики та безпека

Стимули компанії формують стандарти продукту, безпеку та відкритість.

Майбутнє AlphaGo та AlphaZero

Рецепт AlphaZero, який навчається шляхом самостійної гри під керівництвом пошуку, тепер впливає на робототехніку, наукові відкриття та міркування на основі моделі великою мовою, де моделі «шукають» кроки рішення. Такі нащадки, як MuZero та AlphaProof, застосовують ці ідеї до планування без відомих правил і до математики. Очікуйте, що самостійна гра та пошук по дереву будуть підтримувати системи, які повинні планувати, розробляти стратегії та відкривати нові рішення, що все більше поєднуються з методами міркування, які зараз з’являються в передових моделях ШІ.

Реалізація в реальному світі

Перемога над чемпіонами світу з го Лі Седолем (2016) і Ке Джі (2017) у знакових матчах

AlphaZero навчає себе надлюдських шахів за години, розкриваючи свіжі ідеї відкриття та жертви, вивчені гросмейстерами

MuZero освоює ігри Go, шахи, сьогі та Atari, не повідомляючи правил

Надихаючі самостійні ігри та методи пошуку, які зараз використовуються в робототехніці, математиці (AlphaProof) і міркуванні LLM

Ризики та огорожі

Оголошення про запуск можуть випереджати стабільність у реальних робочих процесах виробництва.

Зміни в ціноутворенні API або в політиці можуть миттєво порушити припущення.

Залежність від одного постачальника збільшує витрати на блокування та міграцію.

Дорожня карта впровадження

1

Оцініть постачальників за допомогою власних завдань і наборів даних.

2

Перегляньте умови конфіденційності, безпеки та юридичні умови перед інтеграцією.

3

Підтримуйте запасний план для різних моделей або постачальників.

4

Слідкуйте за примітками до випуску, щоб зміни дорожньої карти не здивували команди.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AlphaGo and AlphaZero quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Часті запитання

What is AlphaGo and AlphaZero?

AlphaGo була програмою DeepMind, яка перемогла найкращих у світі гравців у го, і до цієї віхи ще довго думали через десятиліття. Тоді AlphaZero повністю опанував го, шахи та сьогі через самостійну гру, вивчаючи надлюдські навички з нуля.

Чому гру Го вважали особливо важкою для комп’ютерів?

Величезний коефіцієнт розгалуження Go робить пошук грубою силою неможливим, тому для успіху потрібна навчена інтуїція.

Кого AlphaGo переграла з рахунком 4-1 у 2016 році?

AlphaGo переміг найкращого чемпіона Го Лі Седола з рахунком 4-1 у матчі 2016 року, який користувався широкою аудиторією.

Як AlphaZero навчився грати на відміну від AlphaGo?

AlphaZero починав лише з правил і навчався, граючи проти самого себе, без людських даних.

Який метод пошуку AlphaZero поєднує зі своєю нейронною мережею?

AlphaZero використовує пошук дерева за методом Монте-Карло, керуючись політикою нейронної мережі та прогнозами вартості.

Які дві речі прогнозує нейронна мережа AlphaZero, щоб керувати її пошуком?

Мережа показує, які кроки виглядають багатообіцяючими (політика), і оцінка того, хто виграє (значення), зосереджуючи пошук.