基礎知識指南

多智能體強化學習

多智能體強化學習 (MARL) 訓練多個共享環境的學習智能體,每個智能體都適應自己的行為,而其他智能體也會適應。

閱讀時間約2分鐘最後更新

概述

It matters because most real-world problems — traffic, markets, teams of robots — involve many decision-makers, not one.

深入探討

在單一代理強化學習中,一個代理人透過在固定環境中最大化獎勵來學習策略。 MARL 增加了更多代理,這改變了一切:從每個代理的角度來看,環境是非靜態的,因為其他代理不斷改變他們的策略。智能體可以是合作型的(分享團隊獎勵,例如踢足球的機器人),也可以是競爭型的(零和遊戲,例如撲克或追逃),或是混合型的。研究人員使用諸如馬可夫博弈(隨機博弈)之類的形式來概括單智能體馬可夫決策過程。著名的成果包括 DeepMind 的 AlphaStar 在《星海爭霸 II》中達到大師級水平,以及 OpenAI 五支擊敗職業 Dota 2 隊伍的成績,兩者都依賴於透過自我對戰相互訓練的智能體群體。

技術洞察

一個核心挑戰是非平穩性:當每個智能體更新其策略時,其他智能體面臨一個移動目標,因此天真的獨立學習可能無法收斂。一種流行的解決方案是採用分散式執行的集中式訓練 (CTDE),由 MADDPG 和 QMIX 等演算法使用。在訓練期間,批評者會看到所有代理的觀察和操作來計算穩定的梯度,但在部署時,每個代理僅使用自己的本地觀察進行操作 - 將協調學習與實際的獨立操作相結合。

戰略影響

更明確的決策

它可以幫助您將清晰的技術聲明與行銷語言分開。

成本與預算

在花費金錢或時間之前,您可以提出更好的實施問題。

團隊與工作流程

具有共同理解的團隊可以做出更好的產品、政策和學習決策。

多智能體強化學習的未來

MARL 正在走向更大、更開放的系統(代理人可在其中進出),以及基於 LLM 的代理人團隊,共同協商、委派和使用工具。預計在可擴展的信用分配(誰應該在大團隊中得到獎勵)、緊急通訊協議以及競爭代理的安全保證方面取得進展。隨著自動駕駛汽車、能源網路和交易系統日益互動,強大的多主體協調——並避免串通或破壞穩定的回饋循環——成為一個核心的實踐和監管問題。

現實世界的實施

協調倉庫機器人車隊,以便它們在運送包裹時不會在過道中發生碰撞或僵局

交通號誌控制,每個路口都是一個學習減少全市壅塞的代理

透過多個智能體之間的自我對弈來訓練遊戲 AI,如 OpenAI Five (Dota 2) 和 AlphaStar (StarCraft II)

管理智慧電網中分散式電池和家庭之間的投標和需求響應

風險與防護欄

不同的團隊可能會以不同的方式使用相同術語,因此請儘早定義範圍。

基準測試可能看起來很強大,但實際效能卻參差不齊。

忽視數據品質和評估計劃通常會產生脆弱的結果。

實施路線圖

1

從您需要的結果的簡單語言定義開始。

2

在測試之前選擇一種成功指標和一種失敗條件。

3

使用代表性資料運行小型試點,而不是完善的演示集。

4

記錄多智能體強化學習在哪些方面有幫助以及在哪些方面較簡單的方法較好。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Agent Reinforcement Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

常見問題

What is Multi-Agent Reinforcement Learning?

多智能體強化學習 (MARL) 訓練多個共享環境的學習智能體,每個智能體都適應自己的行為,而其他智能體也會適應。這很重要,因為大多數現實世界的問題——交通、市場、機器人團隊——都涉及許多決策者,而不是一個人。

從 MARL 中一個智能體的角度來看,是什麼使得環境「不穩定」?

由於每個智能體在訓練期間都會更新其策略,因此每個智能體實際上都面臨著一個移動目標——環境的動態隨著其他智能體的學習而變化。

「集中培訓分散執行」(CTDE)是什麼意思?

MADDPG 和 QMIX 等 CTDE 方法利用全域資訊進行穩定學習,而每個代理程式僅使用自己的觀察結果執行。

哪一種數學框架將單智能體 MDP 推廣到多智能體?

馬可夫博弈(也稱為隨機博弈)透過跨多個決策者的聯合行動和每個智能體獎勵來擴展 MDP。

在純粹合作的 MARL 環境中,獎勵通常是如何構成的?

合作設定為代理商提供了共同的目標,因此挑戰變成了協調行動並在團隊內分配信用。

哪種技術可以讓 OpenAI Five 和 AlphaStar 這樣的系統在沒有人類遊戲資料的情況下得到改進?

自我博弈讓智能體與自己不斷進化的版本進行對抗,從而為日益強大的對手創建了一個自動課程。