АльфаГо и АльфаЗеро
AlphaGo была программой DeepMind, которая обыграла лучших игроков в го в мире, и это стало важной вехой, которую ждали десятилетия.
Обзор
AlphaZero then mastered Go, chess, and shogi entirely through self-play, learning superhuman skill from scratch.
Глубокое погружение
В го больше возможных позиций на доске, чем атомов в наблюдаемой вселенной, что делает поиск методом грубой силы безнадежным и необходимой интуицией. В 2016 году AlphaGo победила легендарного чемпиона Ли Седоля со счетом 4:1, используя свой знаменитый «Move 37», ошеломляющий мастеров, творчески нечеловеческих. AlphaGo училась на опытных играх, а также на самостоятельной игре. В 2017 году AlphaZero пошла дальше: начав только с правил и без человеческих данных, она научилась, сыграв миллионы игр против себя, превзойдя лучшие программы го, шахмат и сёги за часы или дни. Более поздняя система MuZero даже самостоятельно выучила правила игр. Эти вехи продемонстрировали, как обучение с подкреплением и поиск могут обнаруживать стратегии, выходящие за рамки человеческого знания.
Техническая информация
AlphaZero сочетает в себе глубокую нейронную сеть с поиском по дереву Монте-Карло (MCTS). Сеть выводит политику (движения которой выглядят многообещающе) и значение (кто, скорее всего, победит), направляя поиск на изучение только наиболее релевантных строк, а не каждой ветви. Благодаря самостоятельному обучению с подкреплением прогнозы сети и результаты поиска усиливают друг друга, постоянно улучшаясь. Никаких человеческих игр или созданных вручную функций оценки не требуется, только правила и награда за победу.
Стратегическое воздействие
Стратегия поставщика
Дорожные карты поставщиков влияют на то, какие функции ваша команда может создать дальше.
Стоимость и бюджет
Коммерческие условия и варианты развертывания влияют на долгосрочные затраты и риски.
Риски и безопасность
Стимулы компании влияют на невыполнение обязательств по продукту, безопасность и открытость.
Будущее AlphaGo и AlphaZero
Рецепт AlphaZero, обучение посредством самостоятельной игры, управляемой поиском, теперь влияет на робототехнику, научные открытия и рассуждения на основе моделей большого языка, где модели «ищут» этапы решения. Потомки, такие как MuZero и AlphaProof, применяют эти идеи к планированию без известных правил и к математике. Ожидайте, что самостоятельная игра и поиск по дереву будут продолжать обеспечивать работу систем, которые должны планировать, разрабатывать стратегии и находить новые решения, все больше объединяясь с методами рассуждения, которые сейчас появляются в передовых моделях искусственного интеллекта.
Реальная реализация
Победа над чемпионами мира по го Ли Седолем (2016) и Ке Цзе (2017) в знаковых матчах
AlphaZero за часы учится сверхчеловеческим шахматам, раскрывая свежие идеи дебюта и жертвы, изученные гроссмейстерами
MuZero осваивает игры в го, шахматы, сёги и Atari, не зная правил
Вдохновляющие методы самостоятельной игры и поиска, которые сейчас используются в робототехнике, математике (AlphaProof) и рассуждениях LLM.
Риски и ограничения
Объявления о запуске могут опережать стабильность реальных производственных процессов.
Цены на API или изменения в политике могут в одночасье разрушить предположения.
Зависимость от одного поставщика увеличивает затраты на привязку и миграцию.
Дорожная карта реализации
Оценивайте поставщиков, используя собственные задачи и наборы данных.
Перед интеграцией ознакомьтесь с условиями конфиденциальности, безопасности и юридическими условиями.
Поддерживайте резервный план для разных моделей или поставщиков.
Отслеживайте примечания к выпуску, чтобы изменения в дорожной карте не удивили команды.
Продолжайте исследовать
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the AlphaGo and AlphaZero quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Следующее руководство
Модели Жипу GLM
Часто задаваемые вопросы
What is AlphaGo and AlphaZero?
AlphaGo была программой DeepMind, которая обыграла лучших игроков в го в мире, и это стало важной вехой, которую ждали десятилетия. Затем AlphaZero освоила го, шахматы и сёги исключительно посредством самостоятельной игры, изучая сверхчеловеческие навыки с нуля.
Почему игра Го считалась особенно сложной для компьютеров?
Огромный фактор ветвления Go делает невозможным поиск методом грубой силы, поэтому для успеха требуется развитая интуиция.
Кого AlphaGo одержала победу со счетом 4:1 в 2016 году?
AlphaGo обыграла лучшего чемпиона по го Ли Седоля со счетом 4:1 в широко популярном матче 2016 года.
Как AlphaZero научилась играть в отличие от AlphaGo?
AlphaZero начинала с правил и училась исключительно, играя против себя, без использования данных об играх с участием людей.
Какой метод поиска сочетается с AlphaZero со своей нейронной сетью?
AlphaZero использует поиск по дереву Монте-Карло, руководствуясь политикой нейронной сети и прогнозами значений.
Какие две вещи прогнозирует нейронная сеть AlphaZero, чтобы направлять поиск?
Результаты деятельности сети выглядят многообещающе (политика), а оценка того, кто победит (ценность), фокусирует поиск.