A continuaciónSiguiente guía
Sistemas de conducción autónoma para cruceros
Empresas
GUÍA de empresas
Cerebras construye el chip de computadora más grande del mundo, el Wafer-Scale Engine, colocando un procesador de IA completo en una sola pieza de silicio del tamaño de un plato.
Es importante porque este diseño radical reduce drásticamente el tiempo que lleva entrenar y ejecutar grandes modelos de IA.
Fundada en 2015 y con sede en Sunnyvale, California, Cerebras hizo una apuesta contraria: en lugar de conectar miles de pequeñas GPU, construiría un chip gigantesco. Su motor a escala de oblea (WSE) se corta a partir de una oblea de silicio completa en lugar de cortarse en cientos de pequeños chips. El WSE-3 de tercera generación, lanzado en 2024, incluye aproximadamente 4 billones de transistores y 900.000 núcleos optimizados para IA en una sola pieza de silicio del tamaño de un plato. Cerebras los vende como sistemas CS-3 y ofrece un servicio de inferencia en la nube. En 2024-2025 se hizo conocido por sus velocidades de inferencia sin precedentes, ejecutando modelos abiertos como Llama a miles de tokens por segundo, mucho más rápido que las configuraciones típicas de GPU.
Las hojas de ruta de los proveedores influyen en las funciones que su equipo puede desarrollar a continuación.
Los términos comerciales y las opciones de implementación afectan los costos y riesgos a largo plazo.
Los incentivos de las empresas dan forma a los incumplimientos de los productos, la postura de seguridad y la apertura.
Cerebras presentó su solicitud para cotizar en bolsa y está impulsando con fuerza la inferencia de alta velocidad, apostando a que la demanda de respuestas de IA rápidas y en tiempo real rivalizará con la demanda de capacitación. Espere generaciones futuras a escala de oblea con más núcleos y memoria, asociaciones más profundas con laboratorios modelo y gobiernos, y una presión creciente sobre el mercado dominado por GPU. Su desafío es escalar la fabricación, la madurez del software y la adopción por parte de los clientes frente a rivales arraigados como Nvidia.
Ejecutar grandes modelos de lenguaje de código abierto como Llama a miles de tokens por segundo para respuestas ultrarrápidas de agentes y chatbots.
Entrene grandes modelos científicos y de lenguaje más rápido evitando los cuellos de botella de red de los clústeres de múltiples GPU
Impulsando el descubrimiento de fármacos y las simulaciones moleculares para socios de investigación farmacéutica y de laboratorios nacionales.
Servir como columna vertebral informática para proyectos soberanos de IA, como implementaciones a gran escala en Medio Oriente.
Los anuncios de lanzamiento pueden superar la estabilidad en los flujos de trabajo de producción reales.
Los precios de API o los cambios de políticas pueden romper los supuestos de la noche a la mañana.
La dependencia de un único proveedor aumenta los costos de bloqueo y migración.
Evalúe proveedores utilizando sus propias tareas y conjuntos de datos.
Revise los términos legales, de seguridad y de privacidad antes de la integración.
Mantenga un plan alternativo entre modelos o proveedores.
Supervise las notas de la versión para que los cambios en la hoja de ruta no sorprendan a los equipos.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Cerebras construye el chip de computadora más grande del mundo, el Wafer-Scale Engine, colocando un procesador de IA completo en una sola pieza de silicio del tamaño de un plato. Es importante porque este diseño radical reduce drásticamente el tiempo que lleva entrenar y ejecutar grandes modelos de IA.
Cerebras mantiene una oblea de silicio completa como un chip gigante en lugar de cortarla en muchos troqueles pequeños, creando un procesador del tamaño de un plato.
La comunicación en el chip es mucho más rápida que la conexión en red entre chips separados, lo que brinda un gran ancho de banda y baja latencia para las cargas de trabajo de IA.
El motor Wafer-Scale de tercera generación incluye del orden de 4 billones de transistores, una cantidad enorme que se consigue utilizando toda la oblea.
Cerebras ganó fama por ejecutar grandes modelos de lenguaje a miles de tokens por segundo, mucho más rápido que las implementaciones típicas de GPU.
Debido a que algunos defectos son inevitables en una oblea completa, Cerebras incorpora redundancia para que el chip pueda sortear áreas defectuosas y seguir funcionando.
sigue aprendiendo
Más guías seleccionadas para este tema.
A continuaciónSiguiente guía
Sistemas de conducción autónoma para cruceros
Empresas