GUÍA de empresas

AlphaGo y AlphaZero

AlphaGo fue el programa DeepMind que venció a los mejores jugadores de Go del mundo, un hito que se pensó que tardaría décadas en llegar.

  • 2 minutos de lectura
  • Última actualización
En esta pagina2 minutos de lectura
  1. Descripción general
  2. Buceo profundo
  3. Impacto Estratégico
  4. El futuro de AlphaGo y AlphaZero
  5. Implementación en el mundo real
  6. Riesgos y barandillas
  7. Hoja de ruta de implementación
  8. Sigue explorando
  9. Preguntas frecuentes

Descripción general

AlphaZero then mastered Go, chess, and shogi entirely through self-play, learning superhuman skill from scratch.

Buceo profundo

Go tiene más posiciones posibles en el tablero que átomos en el universo observable, lo que hace que la búsqueda por fuerza bruta sea desesperada y la intuición sea esencial. En 2016, AlphaGo derrotó al legendario campeón Lee Sedol 4-1, con su famoso 'Move 37' que sorprendió a los expertos como creativamente no humanos. AlphaGo aprendió de los juegos de expertos humanos y del juego propio. En 2017, AlphaZero fue más allá: comenzó solo con las reglas y sin datos humanos, aprendió a sí mismo jugando millones de juegos contra sí mismo, superando a los mejores programas de Go, ajedrez y shogi en cuestión de horas o días. Un sistema posterior, MuZero, incluso aprendió las reglas de los juegos por sí solo. Estos hitos mostraron cómo el aprendizaje por refuerzo más la búsqueda pueden descubrir estrategias más allá del conocimiento humano.

Impacto Estratégico

Estrategia del proveedor

Las hojas de ruta de los proveedores influyen en las funciones que su equipo puede desarrollar a continuación.

Costo y presupuesto

Los términos comerciales y las opciones de implementación afectan los costos y riesgos a largo plazo.

Riesgo y seguridad

Los incentivos de las empresas dan forma a los incumplimientos de los productos, la postura de seguridad y la apertura.

El futuro de AlphaGo y AlphaZero

La receta AlphaZero, el aprendizaje por juego personal guiado por la búsqueda, ahora influye en la robótica, el descubrimiento científico y el razonamiento de modelos en lenguaje grande, donde los modelos "buscan" los pasos de la solución. Descendientes como MuZero y AlphaProof aplican estas ideas a la planificación sin reglas conocidas y a las matemáticas. Espere que el juego autónomo y la búsqueda en árbol sigan impulsando los sistemas que deben planificar, elaborar estrategias y descubrir soluciones novedosas, cada vez más fusionadas con las técnicas de razonamiento que ahora aparecen en los modelos de IA de vanguardia.

Implementación en el mundo real

Derrotar a los campeones mundiales de Go Lee Sedol (2016) y Ke Jie (2017) en partidos emblemáticos.

AlphaZero aprende ajedrez sobrehumano en horas, revelando nuevas ideas de apertura y sacrificio estudiadas por grandes maestros

MuZero domina los juegos de Go, ajedrez, shogi y Atari sin que le digan las reglas

Métodos inspiradores de autojuego y búsqueda que ahora se utilizan en robótica, matemáticas (AlphaProof) y razonamiento LLM

Riesgos y barandillas

  • Los anuncios de lanzamiento pueden superar la estabilidad en los flujos de trabajo de producción reales.

  • Los precios de API o los cambios de políticas pueden romper los supuestos de la noche a la mañana.

  • La dependencia de un único proveedor aumenta los costos de bloqueo y migración.

Hoja de ruta de implementación

  1. Evalúe proveedores utilizando sus propias tareas y conjuntos de datos.

  2. Revise los términos legales, de seguridad y de privacidad antes de la integración.

  3. Mantenga un plan alternativo entre modelos o proveedores.

  4. Supervise las notas de la versión para que los cambios en la hoja de ruta no sorprendan a los equipos.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AlphaGo and AlphaZero quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Preguntas frecuentes

What is AlphaGo and AlphaZero?

AlphaGo fue el programa DeepMind que venció a los mejores jugadores de Go del mundo, un hito que se pensó que tardaría décadas en llegar. Luego, AlphaZero dominó el Go, el ajedrez y el shogi completamente a través del juego personal, aprendiendo habilidades sobrehumanas desde cero.

¿Por qué el juego Go se consideró especialmente difícil para las computadoras?

El enorme factor de ramificación del Go hace que la búsqueda por fuerza bruta sea inviable, por lo que el éxito requería una intuición aprendida.

¿A quién derrotó AlphaGo 4-1 en 2016?

AlphaGo venció al máximo campeón de Go, Lee Sedol, 4-1 en un partido de 2016 ampliamente visto.

¿Cómo aprendió a jugar AlphaZero, a diferencia de AlphaGo?

AlphaZero comenzó solo con las reglas y aprendió únicamente jugando contra sí mismo, sin datos del juego humano.

¿Qué método de búsqueda empareja AlphaZero con su red neuronal?

AlphaZero utiliza Monte Carlo Tree Search guiado por la política de una red neuronal y predicciones de valores.

¿Qué dos cosas predice la red neuronal de AlphaZero para guiar su búsqueda?

Las salidas de la red en las que se mueve parecen prometedoras (política) y una estimación de quién ganará (valor), centrando la búsqueda.