Voltar às notícias
InovaçãoInstruções AI Understanding

O sistema de IA do MIT, Ataraxos, vence os principais jogadores humanos do Stratego

Pesquisadores do MIT e de universidades parceiras revelaram o Ataraxos, uma IA que superou os melhores jogadores de Stratego do mundo por uma grande margem, usando muito menos recursos de treinamento.

4 min readRead the primary source
Source-provided image accompanying MIT AI system Ataraxos beats top human Stratego players
Documento de origem primáriaFonte registrada
Editora
news.mit.edu
Link da fonte
news.mit.eduhttps://news.mit.edu/2026/game-playing-ai-stratego-new-champ-0930
Tipo de fonte
Documento primário - um anúncio oficial, papel, arquivamento ou página original que lemos diretamente.
ContextoEntenda isso em 60 segundos

Comece aqui

Termos-chave

Aprendizagem por Reforço
Treinamento por sinais de recompensa onde um agente aprende ações que maximizam o retorno a longo prazo.
Referência
Um teste padronizado ou conjunto de dados usado para medir e comparar o desempenho do modelo.
Inferência
A fase de tempo de execução em que um modelo treinado gera previsões ou resultados.
Teste você mesmoO que é IA? Questionário

O que aconteceu

Pesquisadores do MIT, Carnegie Mellon, NYU e Stanford anunciaram um novo sistema de IA chamado Ataraxos que alcançou desempenho sobre-humano no jogo de tabuleiro de informações ocultas Stratego. Usando a aprendizagem por reforço de autojogo combinada com o planejamento do tempo de decisão e um modelo generativo para inferir identidades de peças ocultas, Ataraxos derrotou o jogador humano mais forte por 15‑1‑4 e registrou um recorde de 39‑2 no campeonato mundial de Stratego. O sistema também superou os especialistas humanos em vários jogos de informação imperfeita relacionados, incluindo Barrage Stratego, Hanabi e Dou dizhu. Crucialmente, Ataraxos atingiu esse nível usando menos de um centésimo dos exemplos de treinamento e um trigésimo dos jogos autônomos exigidos pelo sistema DeepNash anterior do DeepMind, indicando um ganho dramático de eficiência.

A equipe treinou Ataraxos por meio de aprendizagem por reforço de autojogo, permitindo que a IA gerasse uma “estratégia de projeto” para Stratego sem supervisão humana. Algoritmos de treinamento eficientes reduziram drasticamente o número de jogos autônomos necessários em comparação com sistemas anteriores.

Durante o jogo, Ataraxos emprega planejamento no momento da decisão: um modelo generativo prevê as prováveis ​​identidades das peças ocultas do oponente e, em seguida, avalia possíveis movimentos sob essas hipóteses antes de selecionar uma ação. Esta abordagem substitui a enumeração exaustiva pela inferência probabilística, permitindo decisões rápidas e informadas.

As métricas de desempenho mostram que Ataraxos derrotou o melhor jogador de Stratego do mundo com um recorde de 15‑1‑4 vitórias‑derrotas‑empates e alcançando um recorde de 39‑2 contra outros competidores de elite. O sistema também superou os especialistas humanos em Barrage Stratego, Hanabi e Dou dizhu, confirmando a generalidade do método em jogos de informação imperfeita.

Comparado com o DeepNash do DeepMind, o Ataraxos exigiu menos de 1% dos exemplos de treinamento e cerca de 3% dos jogos autônomos, traduzindo-se em uma redução maciça nas despesas computacionais e no consumo de energia.

Detalhes da fonte: news.mit.edu ↗

Por que isso importa

A descoberta demonstra que a IA pode agora lidar com jogos com espaços de estados ocultos astronomicamente grandes por uma fração do custo computacional anteriormente considerado necessário. Isto abre a porta para aplicações práticas em domínios onde as informações estão incompletas, como negociações comerciais, avaliação de ameaças à segurança cibernética e planeamento militar. Ao mostrar que o planeamento do tempo de decisão com um modelo generativo pode inferir variáveis ​​ocultas de forma fiável, a investigação fornece um modelo para a construção de ferramentas de apoio à decisão mais económicas e reais. Além disso, os ganhos de eficiência reduzem a barreira para as instituições sem grandes orçamentos computacionais desenvolverem capacidades de IA comparáveis, potencialmente democratizando o acesso ao raciocínio estratégico avançado.

A complexidade da informação oculta do Stratego (mais de 10^66 configurações de peças possíveis) tem sido uma referência para o raciocínio estratégico da IA. O sucesso de Ataraxos indica que a IA pode agora navegar com eficiência em espaços tão vastos de incerteza, uma capacidade anteriormente limitada a jogos mais simples como xadrez ou Go.

A capacidade de inferir informações ocultas e planear sob incerteza é diretamente relevante para cenários do mundo real onde os decisores não têm visibilidade total, tais como negociações de mercado, deteção de ameaças cibernéticas e operações militares táticas.

Ao alcançar estes resultados com custos de formação muito mais baixos, a investigação reduz a barreira de entrada para as organizações desenvolverem sistemas de IA comparáveis, acelerando potencialmente a inovação em setores que não podem suportar orçamentos computacionais multimilionários.

Interactive Mechanism

Mecanismo interativo: como realmente funciona

Explore a tecnologia subjacente a este desenvolvimento de forma interativa.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Verificação de conceito interativo+10 Points
What is AI? Quiz

A route planner searches possible journeys using explicit rules. What does this illustrate about AI?

O que assistir a seguir

O trabalho futuro centrar-se-á na adição de camadas de interpretabilidade para que o Ataraxos possa explicar o seu raciocínio aos utilizadores humanos, um pré-requisito para a adoção em ambientes de alto risco. Os investigadores também explorarão a ampliação da abordagem para problemas maiores e mais complexos do mundo real e a medição do seu desempenho em comparação com especialistas humanos nesses domínios. O financiamento do Gabinete de Investigação Naval e de outras agências sugere possíveis destacamentos relacionados com a defesa, levantando questões sobre transparência, supervisão e utilização ética. Será essencial monitorizar a forma como o sistema está integrado nos canais de tomada de decisões e se mantém a sua vantagem de eficiência fora do ambiente de jogo controlado.

Interpretabilidade: A equipa planeia incorporar mecanismos que permitam ao Ataraxos explicar os seus estados ocultos inferidos e as ações escolhidas, o que é fundamental para a confiança e a responsabilização em aplicações de alto risco.

Implantação no mundo real: O financiamento do Gabinete de Investigação Naval sugere possíveis utilizações na defesa, solicitando um exame minucioso das orientações éticas, da supervisão e de potenciais preocupações de dupla utilização.

Escalabilidade: Os pesquisadores testarão se os ganhos de eficiência se mantêm ao expandir para domínios maiores e mais complexos além dos jogos de tabuleiro, como simulações multiagentes ou planejamento estratégico em tempo real.

Barreiras à adoção: Mesmo com maior eficiência, a integração prática exigirá interfaces fáceis de usar, validação junto a especialistas do domínio e testes de segurança robustos antes que a tecnologia possa ser confiável em ambientes operacionais.

Guias e questionários relacionados

O que é IA?Modelos de IA explicadosFuturo da IAÉtica da IATeste o que você sabe – experimente um teste gratuito de IAProcure um termo de IA em nosso glossárioSiga o rastreador de lançamento de modelo de IA
Achou isso útil?