A continuaciónSiguiente guía
Modelos Zhipu GLM
Empresas
GUÍA de empresas
AlphaGo fue el programa DeepMind que venció a los mejores jugadores de Go del mundo, un hito que se pensó que tardaría décadas en llegar.
AlphaZero then mastered Go, chess, and shogi entirely through self-play, learning superhuman skill from scratch.
Go tiene más posiciones posibles en el tablero que átomos en el universo observable, lo que hace que la búsqueda por fuerza bruta sea desesperada y la intuición sea esencial. En 2016, AlphaGo derrotó al legendario campeón Lee Sedol 4-1, con su famoso 'Move 37' que sorprendió a los expertos como creativamente no humanos. AlphaGo aprendió de los juegos de expertos humanos y del juego propio. En 2017, AlphaZero fue más allá: comenzó solo con las reglas y sin datos humanos, aprendió a sí mismo jugando millones de juegos contra sí mismo, superando a los mejores programas de Go, ajedrez y shogi en cuestión de horas o días. Un sistema posterior, MuZero, incluso aprendió las reglas de los juegos por sí solo. Estos hitos mostraron cómo el aprendizaje por refuerzo más la búsqueda pueden descubrir estrategias más allá del conocimiento humano.
Las hojas de ruta de los proveedores influyen en las funciones que su equipo puede desarrollar a continuación.
Los términos comerciales y las opciones de implementación afectan los costos y riesgos a largo plazo.
Los incentivos de las empresas dan forma a los incumplimientos de los productos, la postura de seguridad y la apertura.
La receta AlphaZero, el aprendizaje por juego personal guiado por la búsqueda, ahora influye en la robótica, el descubrimiento científico y el razonamiento de modelos en lenguaje grande, donde los modelos "buscan" los pasos de la solución. Descendientes como MuZero y AlphaProof aplican estas ideas a la planificación sin reglas conocidas y a las matemáticas. Espere que el juego autónomo y la búsqueda en árbol sigan impulsando los sistemas que deben planificar, elaborar estrategias y descubrir soluciones novedosas, cada vez más fusionadas con las técnicas de razonamiento que ahora aparecen en los modelos de IA de vanguardia.
Derrotar a los campeones mundiales de Go Lee Sedol (2016) y Ke Jie (2017) en partidos emblemáticos.
AlphaZero aprende ajedrez sobrehumano en horas, revelando nuevas ideas de apertura y sacrificio estudiadas por grandes maestros
MuZero domina los juegos de Go, ajedrez, shogi y Atari sin que le digan las reglas
Métodos inspiradores de autojuego y búsqueda que ahora se utilizan en robótica, matemáticas (AlphaProof) y razonamiento LLM
Los anuncios de lanzamiento pueden superar la estabilidad en los flujos de trabajo de producción reales.
Los precios de API o los cambios de políticas pueden romper los supuestos de la noche a la mañana.
La dependencia de un único proveedor aumenta los costos de bloqueo y migración.
Evalúe proveedores utilizando sus propias tareas y conjuntos de datos.
Revise los términos legales, de seguridad y de privacidad antes de la integración.
Mantenga un plan alternativo entre modelos o proveedores.
Supervise las notas de la versión para que los cambios en la hoja de ruta no sorprendan a los equipos.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
AlphaGo fue el programa DeepMind que venció a los mejores jugadores de Go del mundo, un hito que se pensó que tardaría décadas en llegar. Luego, AlphaZero dominó el Go, el ajedrez y el shogi completamente a través del juego personal, aprendiendo habilidades sobrehumanas desde cero.
El enorme factor de ramificación del Go hace que la búsqueda por fuerza bruta sea inviable, por lo que el éxito requería una intuición aprendida.
AlphaGo venció al máximo campeón de Go, Lee Sedol, 4-1 en un partido de 2016 ampliamente visto.
AlphaZero comenzó solo con las reglas y aprendió únicamente jugando contra sí mismo, sin datos del juego humano.
AlphaZero utiliza Monte Carlo Tree Search guiado por la política de una red neuronal y predicciones de valores.
Las salidas de la red en las que se mueve parecen prometedoras (política) y una estimación de quién ganará (valor), centrando la búsqueda.
sigue aprendiendo
Más guías seleccionadas para este tema.
A continuaciónSiguiente guía
Modelos Zhipu GLM
Empresas