基础知识指南

多智能体强化学习

多智能体强化学习 (MARL) 训练多个共享环境的学习智能体,每个智能体都适应自己的行为,而其他智能体也会适应。

阅读时间:2分钟最后更新

概述

It matters because most real-world problems — traffic, markets, teams of robots — involve many decision-makers, not one.

深入探讨

在单代理强化学习中,一个代理通过在固定环境中最大化奖励来学习策略。 MARL 添加了更多代理,这改变了一切:从每个代理的角度来看,环境是非静态的,因为其他代理不断改变他们的策略。智能体可以是合作型的(分享团队奖励,比如踢足球的机器人),也可以是竞争型的(零和游戏,比如扑克或追逃),或者是混合型的。研究人员使用诸如马尔可夫博弈(随机博弈)之类的形式来概括单智能体马尔可夫决策过程。著名的成果包括 DeepMind 的 AlphaStar 在《星际争霸 II》中达到大师级水平,以及 OpenAI 五支击败职业 Dota 2 队伍的成绩,两者都依赖于通过自我对战相互训练的智能体群体。

技术洞察

一个核心挑战是非平稳性:当每个智能体更新其策略时,其他智能体面临一个移动目标,因此天真的独立学习可能无法收敛。一种流行的解决方案是采用分散执行的集中式训练 (CTDE),由 MADDPG 和 QMIX 等算法使用。在训练期间,批评者会看到所有代理的观察和操作来计算稳定的梯度,但在部署时,每个代理仅使用自己的本地观察进行操作 - 将协调学习与实际的独立操作相结合。

战略影响

更清晰的判决

它可以帮助您将清晰的技术声明与营销语言分开。

成本与预算

在花费金钱或时间之前,您可以提出更好的实施问题。

团队与工作流程

具有共同理解的团队可以做出更好的产品、政策和学习决策。

多智能体强化学习的未来

MARL 正在走向更大、更开放的系统(代理人可在其中进出),以及基于 LLM 的代理人团队,共同协商、委派和使用工具。预计在可扩展的信用分配(谁应该在大团队中得到奖励)、紧急通信协议以及竞争代理的安全保证方面取得进展。随着自动驾驶汽车、能源网络和交易系统日益互动,强大的多主体协调——并避免串通或破坏稳定的反馈循环——成为一个核心的实践和监管问题。

现实世界的实施

协调仓库机器人车队,以便它们在运送包裹时不会在过道中发生碰撞或僵局

交通信号控制,每个路口都是一个学习减少全市拥堵的代理

通过多个智能体之间的自我对弈来训练游戏 AI,如 OpenAI Five (Dota 2) 和 AlphaStar (StarCraft II)

管理智能电网中分布式电池和家庭之间的投标和需求响应

风险与防护栏

不同的团队可能会以不同的方式使用同一术语,因此请尽早定义范围。

基准测试可能看起来很强大,但实际性能却参差不齐。

忽视数据质量和评估计划通常会产生脆弱的结果。

实施路线图

1

从您需要的结果的简单语言定义开始。

2

在测试之前选择一种成功指标和一种失败条件。

3

使用代表性数据运行小型试点,而不是完善的演示集。

4

记录多智能体强化学习在哪些方面有帮助以及在哪些方面更简单的方法更好。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Agent Reinforcement Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

常见问题

What is Multi-Agent Reinforcement Learning?

多智能体强化学习 (MARL) 训练多个共享环境的学习智能体,每个智能体都适应自己的行为,而其他智能体也会适应。这很重要,因为大多数现实世界的问题——交通、市场、机器人团队——都涉及许多决策者,而不是一个人。

从 MARL 中一个智能体的角度来看,是什么使得环境“不稳定”?

由于每个智能体在训练期间都会更新其策略,因此每个智能体实际上都面临着一个移动目标——环境的动态随着其他智能体的学习而变化。

“集中培训分散执行”(CTDE)是什么意思?

MADDPG 和 QMIX 等 CTDE 方法利用全局信息进行稳定学习,而每个代理仅使用自己的观察结果执行。

哪种数学框架将单智能体 MDP 推广到多智能体?

马尔可夫博弈(也称为随机博弈)通过跨多个决策者的联合行动和每个智能体奖励来扩展 MDP。

在纯粹合作的 MARL 环境中,奖励通常是如何构成的?

合作设置为代理提供了共同的目标,因此挑战变成了协调行动并在团队内分配信用。

哪种技术可以让 OpenAI Five 和 AlphaStar 这样的系统在没有人类游戏数据的情况下得到改进?

自我博弈让智能体与自己不断进化的版本进行对抗,从而为日益强大的对手创建了一个自动课程。