發生了什麼事
麻省理工學院、卡內基美隆大學、紐約大學和史丹佛大學的研究人員宣布推出名為 Ataraxos 的新人工智慧系統,該系統在隱藏資訊棋盤遊戲 Stratego 中實現了超人的表現。使用自我對弈強化學習與決策時間規劃和生成模型相結合來推斷隱藏棋子身份,Ataraxos 以 15-1-4 擊敗了最強的人類玩家,並在 Stratego 世界錦標賽上創下了 39-2 的記錄。該系統還在多個相關的不完全資訊遊戲中擊敗了人類專家,包括彈幕策略、花火和鬥地主。至關重要的是,Ataraxos 在使用 DeepMind 之前的 DeepNash 系統所需的不到百分之一的訓練樣本和三分之一的自玩遊戲的情況下達到了這一水平,這表明效率得到了顯著提升。
團隊透過自我對弈強化學習來訓練 Ataraxos,讓 AI 在沒有人類監督的情況下為 Stratego 產生「藍圖策略」。與早期系統相比,高效的訓練演算法大大減少了所需的自玩遊戲數量。
在遊戲過程中,Ataraxos 採用決策時規劃:產生模型預測隱藏的對手棋子的可能身份,然後在選擇行動之前評估這些假設下可能的移動。這種方法用機率推理取代了詳盡的枚舉,從而能夠做出快速、明智的決策。
績效指標顯示,Ataraxos 以 15-1-4 勝負平局記錄擊敗了世界頂級 Stratego 玩家,並以 39-2 的戰績擊敗了其他精英選手。該系統還在彈幕策略、花火和斗地主中超越了人類專家,證實了該方法在不完美資訊遊戲中的通用性。
與 DeepMind 的 DeepNash 相比,Ataraxos 需要不到 1% 的訓練樣本和大約 3% 的自玩遊戲,這意味著計算費用和能耗大幅降低。
為什麼這很重要
這項突破表明,人工智慧現在可以處理具有天文數字般巨大的隱藏狀態空間的遊戲,而其計算成本只是以前認為必要的一小部分。這為資訊不完整領域的實際應用打開了大門,例如商業談判、網路安全威脅評估和軍事規劃。透過表明使用生成模型的決策時規劃可以可靠地推斷隱藏變量,該研究為建立更具成本效益的現實決策支援工具提供了一個範本。此外,效率的提高降低了沒有大量計算預算的機構開發類似人工智慧功能的障礙,從而可能使高階戰略推理的獲取民主化。
Stratego 的隱藏資訊複雜性(超過 10^66 個可能的棋子配置)長期以來一直是 AI 策略推理的基準。 Ataraxos 的成功表明人工智慧現在可以有效地駕馭如此巨大的不確定性空間,這種能力以前僅限於國際象棋或圍棋等簡單遊戲。
在不確定性下推斷隱藏資訊和計劃的能力與決策者缺乏完全可見性的現實場景直接相關,例如市場談判、網路威脅偵測和戰術軍事行動。
透過以低得多的培訓成本實現這些結果,該研究降低了組織開發類似人工智慧系統的進入門檻,有可能加速無法承擔數百萬美元計算預算的行業的創新。
互動機制:它實際上是如何運作的
以互動方式探索這項發展背後的基礎技術。
A route planner searches possible journeys using explicit rules. What does this illustrate about AI?
接下來看什麼
未來的工作將專注於添加可解釋層,以便 Ataraxos 可以向人類使用者解釋其推理,這是在高風險環境中採用的先決條件。研究人員還將探索將該方法擴展到更大、更複雜的現實世界問題,並與這些領域的人類專家相比來衡量其表現。來自海軍研究辦公室和其他機構的資金表明可能進行與國防相關的部署,引發了有關透明度、監督和道德使用的問題。監控系統如何整合到決策流程中以及它是否在受控遊戲環境之外保持其效率優勢至關重要。
可解釋性:團隊計劃嵌入一些機制,讓 Ataraxos 解釋其推斷的隱藏狀態和選擇的操作,這對於高風險應用程式中的信任和責任至關重要。
現實世界的部署:海軍研究辦公室的資助暗示了可能的國防用途,促使人們對道德準則、監督和潛在的雙重用途問題進行審查。
可擴展性:研究人員將測試當擴展到棋盤遊戲之外的更大、更複雜的領域(例如多智能體模擬或即時戰略規劃)時,效率增益是否保持不變。
採用障礙:即使提高了效率,實際整合也需要使用者友善的介面、領域專家的驗證以及強大的安全測試,然後才能在操作環境中信任該技術。