公司指南

AlphaGo 和 AlphaZero

AlphaGo 是 DeepMind 的程序,它擊敗了世界上最好的圍棋棋手,這是幾十年後人們一直認為的一個里程碑。

閱讀時間約2分鐘最後更新

概述

AlphaZero then mastered Go, chess, and shogi entirely through self-play, learning superhuman skill from scratch.

深入探討

圍棋的棋局位置比可觀測宇宙中的原子還要多,這使得暴力搜索毫無希望,直覺至關重要。 2016年,AlphaGo以4-1擊敗傳奇冠軍李世石,其著名的「37步棋」讓專家驚嘆不已,創造性地非人類。 AlphaGo 是從人類專家對弈加上自我對弈學習的。 2017 年,AlphaZero 更進一步:從只有規則、沒有人類數據的情況下開始,它通過與自己進行數百萬局遊戲自學,在幾小時到幾天內超越了最好的圍棋、國際象棋和將棋程序。後來的系統 MuZero 甚至可以自己學習遊戲規則。這些里程碑展示了強化學習加上搜尋如何發現人類知識之外的策略。

技術洞察

AlphaZero 將深度神經網路與蒙特卡羅樹搜尋 (MCTS) 結合。網路輸出一個策略(看起來有希望的行動)和一個值(誰可能獲勝),引導搜尋僅探索最相關的線路而不是每個分支。透過自我對弈強化學習,網路的預測和搜尋結果相互促進,穩定提升。不需要人類遊戲或手工製作的評估函數,只需要規則和獲勝獎勵。

戰略影響

供應商策略

供應商路線圖會影響您的團隊接下來可以建立的功能。

成本與預算

商業條款和部署選項會影響長期成本和風險。

風險與安全

公司激勵措施塑造了產品預設、安全態勢和開放性。

AlphaGo 和 AlphaZero 的未來

AlphaZero 配方透過搜尋引導的自我遊戲學習,現在影響著機器人技術、科學發現和大語言模型推理,其中模型在解決方案步驟上進行「搜尋」。 MuZero 和 AlphaProof 等後代將這些想法應用於沒有已知規則的規劃和數學中。預計自我對弈和樹搜尋將繼續為必須規劃、制定策略和發現新穎解決方案的系統提供動力,並越來越多地與前沿人工智慧模型中出現的推理技術融合。

現實世界的實施

在具有里程碑意義的比賽中擊敗世界圍棋冠軍李世石(2016 年)和柯潔(2017 年)

AlphaZero 在幾個小時內自學超人國際象棋,揭示了大師研究的新鮮開局和犧牲思想

MuZero 在不了解規則的情況下掌握圍棋、西洋棋、將棋和 Atari 遊戲

鼓舞人心的自我對弈和搜尋方法現在用於機器人、數學 (AlphaProof) 和 LLM 推理

風險與防護欄

發佈公告可能會超過實際生產工作流程的穩定性。

API 定價或政策轉變可能會在一夜之間打破假設。

單一供應商依賴性增加了鎖定和遷移成本。

實施路線圖

1

使用您自己的任務和資料集評估提供者。

2

在整合之前查看隱私、安全和法律條款。

3

維護跨模型或供應商的後備計劃。

4

監控發行說明,以便路線圖的變更不會讓團隊感到意外。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AlphaGo and AlphaZero quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

智浦GLM模型

常見問題

What is AlphaGo and AlphaZero?

AlphaGo 是 DeepMind 的程序,它擊敗了世界上最好的圍棋棋手,這是幾十年後人們一直認為的一個里程碑。隨後,AlphaZero 完全透過自我對弈掌握了圍棋、西洋棋和將棋,從頭開始學習超人的技能。

為什麼圍棋遊戲被認為對電腦來說特別難?

Go 巨大的分支因素使得暴力搜尋變得不可行,因此成功需要習得的直覺。

2016 年 AlphaGo 4-1 擊敗誰?

AlphaGo 在 2016 年一場廣受關注的比賽中以 4-1 擊敗圍棋冠軍李世石。

與 AlphaGo 不同,AlphaZero 是如何學習下棋的?

AlphaZero 僅從規則開始,僅透過與自身對戰來學習,沒有人類遊戲數據。

AlphaZero 與其神經網路配對的搜尋方法是什麼?

AlphaZero 使用由神經網路的策略和值預測引導的蒙特卡羅樹搜尋。

AlphaZero 的神經網路預測哪兩件事來引導其搜尋?

網路輸出的移動看起來很有希望(政策)和對誰將獲勝的估計(價值),集中搜尋。