GUIA de fundamentos

Aprendizado por reforço multiagente

O Multi-Agent Reinforcement Learning (MARL) treina vários agentes de aprendizagem que compartilham um ambiente, cada um adaptando seu comportamento enquanto os outros também se adaptam.

2 minutos de leituraÚltima atualização

Visão geral

It matters because most real-world problems — traffic, markets, teams of robots — involve many decision-makers, not one.

Mergulho profundo

Na aprendizagem por reforço de agente único, um agente aprende uma política maximizando a recompensa em um ambiente fixo. O MARL adiciona mais agentes, e isso muda tudo: do ponto de vista de cada agente, o ambiente não é estacionário porque os outros continuam mudando suas políticas. Os agentes podem ser cooperativos (compartilhando uma recompensa de equipe, como robôs jogadores de futebol), competitivos (soma zero, como pôquer ou evasão de perseguição) ou mistos. Os pesquisadores usam formalismos como jogos de Markov (jogos estocásticos) que generalizam o Processo de Decisão de Markov de agente único. Resultados famosos incluem AlphaStar da DeepMind alcançando Grandmaster em StarCraft II e OpenAI Five derrotando equipes profissionais de Dota 2, ambos contando com populações de agentes treinados uns contra os outros por meio do jogo autônomo.

Visão Técnica

Um desafio central é a não estacionariedade: à medida que cada agente actualiza a sua política, os outros enfrentam um alvo móvel, pelo que a aprendizagem independente ingénua pode não conseguir convergir. Uma solução popular é o treinamento centralizado com execução descentralizada (CTDE), usado por algoritmos como MADDPG e QMIX. Durante o treinamento, um crítico vê todas as observações e ações dos agentes para calcular gradientes estáveis, mas na implantação cada agente atua usando apenas suas próprias observações locais — combinando aprendizado coordenado com operação prática e independente.

Impacto Estratégico

Decisões mais claras

Ajuda a separar afirmações técnicas claras da linguagem de marketing.

Custo e orçamento

Você pode fazer perguntas melhores sobre implementação antes de gastar dinheiro ou tempo.

Equipe e fluxo de trabalho

Equipes com entendimento compartilhado tomam melhores decisões sobre produtos, políticas e aprendizado.

O futuro da aprendizagem por reforço multiagente

O MARL está avançando em direção a sistemas maiores e mais abertos, onde os agentes entram e saem, e em direção a equipes de agentes baseados em LLM que negociam, delegam e usam ferramentas em conjunto. Espere progressos na atribuição de crédito escalonável (quem merece recompensa numa grande equipa), protocolos de comunicação emergentes e garantias de segurança para agentes concorrentes. À medida que os veículos autónomos, as redes de energia e os sistemas de comércio interagem cada vez mais, a coordenação robusta entre vários agentes — e a prevenção de conluios ou ciclos de feedback desestabilizadores — torna-se uma preocupação prática e regulamentar central.

Implementação no mundo real

Coordenar frotas de robôs de armazém para que eles encaminhem os pacotes sem colisões ou impasses nos corredores

Controle de semáforos onde cada interseção é um agente aprendendo a reduzir o congestionamento em toda a cidade

Treine IA de jogos como OpenAI Five (Dota 2) e AlphaStar (StarCraft II) por meio de autojogo entre vários agentes

Gerenciando licitações e resposta à demanda entre baterias distribuídas e residências em uma rede elétrica inteligente

Riscos e guarda-corpos

Equipes diferentes podem usar o mesmo termo de maneira diferente, portanto, defina o escopo com antecedência.

Os benchmarks podem parecer fortes, enquanto o desempenho no mundo real é irregular.

Ignorar a qualidade dos dados e os planos de avaliação cria frequentemente resultados frágeis.

Roteiro de implementação

1

Comece com uma definição em linguagem simples do resultado que você precisa.

2

Escolha uma métrica de sucesso e uma condição de falha antes de testar.

3

Execute um pequeno piloto com dados representativos, não um conjunto de demonstração sofisticado.

4

Documente onde o aprendizado por reforço multiagente ajuda e onde métodos mais simples são melhores.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Agent Reinforcement Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Perguntas frequentes

What is Multi-Agent Reinforcement Learning?

O Multi-Agent Reinforcement Learning (MARL) treina vários agentes de aprendizagem que compartilham um ambiente, cada um adaptando seu comportamento enquanto os outros também se adaptam. É importante porque a maioria dos problemas do mundo real – tráfego, mercados, equipas de robôs – envolve muitos decisores, e não um.

O que torna o ambiente “não estacionário” da perspectiva de um agente no MARL?

Como cada agente atualiza sua política durante o treinamento, cada agente enfrenta efetivamente um alvo em movimento – a dinâmica do ambiente muda à medida que outros aprendem.

O que significa “formação centralizada com execução descentralizada” (CTDE)?

Métodos CTDE como MADDPG e QMIX exploram informações globais para aprendizagem estável, enquanto cada agente executa usando apenas suas próprias observações.

Qual estrutura matemática generaliza o MDP de agente único para vários agentes?

Os jogos de Markov (também chamados de jogos estocásticos) estendem os MDPs ao ter ações conjuntas e recompensas por agente entre vários tomadores de decisão.

Em um ambiente MARL puramente cooperativo, como a recompensa normalmente é estruturada?

Os ambientes cooperativos dão aos agentes um objetivo compartilhado, então o desafio passa a ser coordenar ações e atribuir créditos dentro da equipe.

Qual técnica permite que sistemas como OpenAI Five e AlphaStar melhorem sem dados de jogo humanos?

O autojogo coloca os agentes contra versões em evolução deles mesmos, criando um currículo automático de oponentes cada vez mais fortes.