GUIA DE EMPRESAS
AlphaGo e AlphaZero
AlphaGo foi o programa DeepMind que venceu os melhores jogadores de Go do mundo, um marco há muito pensado a décadas de distância.
Nesta página2 minutos de leitura
Visão geral
AlphaZero then mastered Go, chess, and shogi entirely through self-play, learning superhuman skill from scratch.
Mergulho profundo
Go tem mais posições possíveis no tabuleiro do que átomos no universo observável, tornando a busca pela força bruta impossível e a intuição essencial. Em 2016, AlphaGo derrotou o lendário campeão Lee Sedol por 4 a 1, com seus famosos especialistas impressionantes 'Move 37' como criativamente não-humanos. AlphaGo aprendeu com jogos de especialistas humanos e auto-jogo. Em 2017, o AlphaZero foi mais longe: começando apenas com as regras e sem dados humanos, aprendeu sozinho jogando milhões de partidas contra si mesmo, superando os melhores programas de Go, xadrez e shogi em horas ou dias. Um sistema posterior, o MuZero, até aprendeu sozinho as regras dos jogos. Esses marcos mostraram como o aprendizado por reforço somado à pesquisa podem descobrir estratégias além do conhecimento humano.
Impacto Estratégico
Estratégia do fornecedor
Os roteiros dos fornecedores influenciam quais recursos sua equipe pode construir a seguir.
Custo e orçamento
Os termos comerciais e as opções de implantação afetam os custos e riscos a longo prazo.
Risco e segurança
Os incentivos da empresa moldam os padrões de produto, a postura de segurança e a abertura.
O futuro do AlphaGo e AlphaZero
A receita do AlphaZero, aprendizagem por auto-jogo guiado pela pesquisa, agora influencia a robótica, a descoberta científica e o raciocínio de modelos de linguagem grande, onde os modelos “pesquisam” as etapas da solução. Descendentes como MuZero e AlphaProof aplicam essas ideias ao planejamento sem regras conhecidas e à matemática. Espere que o jogo autônomo e a busca em árvore continuem alimentando os sistemas que devem planejar, criar estratégias e descobrir novas soluções, cada vez mais fundidas com as técnicas de raciocínio que agora aparecem nos modelos de IA de fronteira.
Implementação no mundo real
Derrotar os campeões mundiais de Go Lee Sedol (2016) e Ke Jie (2017) em partidas marcantes
AlphaZero ensinando xadrez sobre-humano em horas, revelando novas ideias de abertura e sacrifício estudadas por grandes mestres
MuZero domina jogos de Go, xadrez, shogi e Atari sem saber as regras
Métodos inspiradores de autojogo e pesquisa agora usados em robótica, matemática (AlphaProof) e raciocínio LLM
Riscos e guarda-corpos
Os anúncios de lançamento podem superar a estabilidade em fluxos de trabalho de produção reais.
Os preços das APIs ou as mudanças nas políticas podem quebrar suposições da noite para o dia.
A dependência de um único fornecedor aumenta os custos de aprisionamento e migração.
Roteiro de implementação
Avalie os provedores usando suas próprias tarefas e conjuntos de dados.
Revise os termos legais, de privacidade e segurança antes da integração.
Mantenha um plano alternativo entre modelos ou fornecedores.
Monitore as notas de lançamento para que as mudanças no roteiro não surpreendam as equipes.
Continue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the AlphaGo and AlphaZero quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Perguntas frequentes
What is AlphaGo and AlphaZero?
AlphaGo foi o programa DeepMind que venceu os melhores jogadores de Go do mundo, um marco há muito pensado a décadas de distância. AlphaZero então dominou Go, xadrez e shogi inteiramente por meio do jogo autônomo, aprendendo habilidades sobre-humanas do zero.
Por que o jogo Go foi considerado especialmente difícil para computadores?
O enorme fator de ramificação do Go torna a busca por força bruta inviável, portanto, o sucesso exigiu intuição aprendida.
Quem derrotou o AlphaGo por 4-1 em 2016?
AlphaGo venceu o campeão Go Lee Sedol por 4 a 1 em uma partida de 2016 amplamente assistida.
Como o AlphaZero aprendeu a jogar, ao contrário do AlphaGo?
AlphaZero começou apenas com as regras e aprendeu apenas jogando contra si mesmo, sem dados de jogo humanos.
Qual método de pesquisa o AlphaZero emparelha com sua rede neural?
AlphaZero usa Monte Carlo Tree Search guiado pela política de uma rede neural e previsões de valor.
Quais são as duas coisas que a rede neural do AlphaZero prevê para orientar sua busca?
Os resultados da rede que movimentam parecem promissores (política) e uma estimativa de quem vencerá (valor), focando a busca.
Continue aprendendo
Guias relacionados
Mais guias escolhidos para este tópico