AlphaGo 和 AlphaZero
AlphaGo 是 DeepMind 的程序,它击败了世界上最好的围棋棋手,这是几十年后人们一直认为的一个里程碑。
概述
AlphaZero then mastered Go, chess, and shogi entirely through self-play, learning superhuman skill from scratch.
深入探讨
围棋的棋局位置比可观测宇宙中的原子还要多,这使得暴力搜索毫无希望,直觉至关重要。 2016年,AlphaGo以4-1击败传奇冠军李世石,其著名的“37步棋”让专家惊叹不已,创造性地非人类。 AlphaGo 是从人类专家对弈加上自我对弈中学习的。 2017 年,AlphaZero 更进一步:从只有规则、没有人类数据的情况下开始,它通过与自己进行数百万局游戏自学,在几小时到几天内超越了最好的围棋、国际象棋和将棋程序。后来的系统 MuZero 甚至可以自己学习游戏规则。这些里程碑展示了强化学习加上搜索如何发现人类知识之外的策略。
技术洞察
AlphaZero 将深度神经网络与蒙特卡罗树搜索 (MCTS) 相结合。网络输出一个策略(看起来有希望的行动)和一个值(谁可能获胜),引导搜索仅探索最相关的线路而不是每个分支。通过自我对弈强化学习,网络的预测和搜索结果相互促进,稳步提高。不需要人类游戏或手工制作的评估函数,只需要规则和获胜奖励。
战略影响
供应商策略
供应商路线图会影响您的团队接下来可以构建的功能。
成本与预算
商业条款和部署选项会影响长期成本和风险。
风险与安全
公司激励措施塑造了产品默认、安全态势和开放性。
AlphaGo 和 AlphaZero 的未来
AlphaZero 配方通过搜索引导的自我游戏学习,现在影响着机器人技术、科学发现和大语言模型推理,其中模型在解决方案步骤上进行“搜索”。 MuZero 和 AlphaProof 等后代将这些想法应用于没有已知规则的规划和数学中。预计自我对弈和树搜索将继续为必须规划、制定策略和发现新颖解决方案的系统提供动力,并越来越多地与前沿人工智能模型中出现的推理技术融合。
现实世界的实施
在具有里程碑意义的比赛中击败世界围棋冠军李世石(2016 年)和柯洁(2017 年)
AlphaZero 在数小时内自学超人国际象棋,揭示了大师研究的新鲜开局和牺牲思想
MuZero 在不了解规则的情况下掌握围棋、国际象棋、将棋和 Atari 游戏
鼓舞人心的自我对弈和搜索方法现在用于机器人、数学 (AlphaProof) 和 LLM 推理
风险与防护栏
发布公告可能会超过实际生产工作流程的稳定性。
API 定价或政策转变可能会在一夜之间打破假设。
单一供应商依赖性增加了锁定和迁移成本。
实施路线图
使用您自己的任务和数据集评估提供商。
在集成之前查看隐私、安全和法律条款。
维护跨模型或供应商的后备计划。
监控发行说明,以便路线图的更改不会让团队感到意外。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the AlphaGo and AlphaZero quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is AlphaGo and AlphaZero?
AlphaGo 是 DeepMind 的程序,它击败了世界上最好的围棋棋手,这是几十年后人们一直认为的一个里程碑。随后,AlphaZero 完全通过自我对弈掌握了围棋、国际象棋和将棋,从头开始学习超人的技能。
为什么围棋游戏被认为对计算机来说特别难?
Go 巨大的分支因素使得暴力搜索变得不可行,因此成功需要习得的直觉。
2016 年 AlphaGo 4-1 击败谁?
AlphaGo 在 2016 年一场广受关注的比赛中以 4-1 击败围棋冠军李世石。
与 AlphaGo 不同,AlphaZero 是如何学习下棋的?
AlphaZero 仅从规则开始,仅通过与自身对战来学习,没有人类游戏数据。
AlphaZero 与其神经网络配对的搜索方法是什么?
AlphaZero 使用由神经网络的策略和值预测引导的蒙特卡罗树搜索。
AlphaZero 的神经网络预测哪两件事来指导其搜索?
网络输出的移动看起来很有希望(政策)和对谁将获胜的估计(价值),集中搜索。