A seguirPróximo guia
Sistemas autônomos de cruzeiro
Empresas
GUIA DE EMPRESAS
A Cerebras constrói o maior chip de computador do mundo, o Wafer-Scale Engine, colocando um processador de IA inteiro em um único pedaço de silício do tamanho de um prato de jantar.
É importante porque esse design radical reduz o tempo necessário para treinar e executar grandes modelos de IA.
Fundada em 2015 e com sede em Sunnyvale, Califórnia, a Cerebras fez uma aposta contrária: em vez de conectar milhares de pequenas GPUs, construiria um chip gigantesco. Seu Wafer-Scale Engine (WSE) é cortado de um wafer de silício completo, em vez de cortado em centenas de pequenos chips. O WSE-3 de terceira geração, lançado em 2024, contém cerca de 4 trilhões de transistores e 900.000 núcleos otimizados para IA em uma única peça de silício do tamanho de um prato. A Cerebras os vende como sistemas CS-3 e oferece um serviço de inferência em nuvem. Em 2024-2025, tornou-se conhecido por velocidades de inferência recordes, executando modelos abertos como o Llama a milhares de tokens por segundo, muito mais rápido do que as configurações típicas de GPU.
Os roteiros dos fornecedores influenciam quais recursos sua equipe pode construir a seguir.
Os termos comerciais e as opções de implantação afetam os custos e riscos a longo prazo.
Os incentivos da empresa moldam os padrões de produto, a postura de segurança e a abertura.
A Cerebras entrou com pedido de abertura de capital e está investindo fortemente na inferência de alta velocidade, apostando que a demanda por respostas de IA rápidas e em tempo real rivalizará com a demanda por treinamento. Espere futuras gerações em escala de wafer com mais núcleos e memória, parcerias mais profundas com laboratórios de modelos e governos e pressão crescente no mercado dominado por GPU. Seu desafio é escalar a fabricação, a maturidade do software e a adoção pelos clientes contra rivais consolidados como a Nvidia.
Executando grandes modelos de linguagem de código aberto, como o Llama, a milhares de tokens por segundo para respostas ultrarrápidas de chatbot e agentes
Treinar grandes modelos científicos e de linguagem com mais rapidez, evitando os gargalos de rede de clusters multi-GPU
Potenciando a descoberta de medicamentos e simulações moleculares para parceiros de pesquisa farmacêutica e de laboratórios nacionais
Servir como espinha dorsal de computação para projetos soberanos de IA, como implantações em larga escala no Oriente Médio
Os anúncios de lançamento podem superar a estabilidade em fluxos de trabalho de produção reais.
Os preços das APIs ou as mudanças nas políticas podem quebrar suposições da noite para o dia.
A dependência de um único fornecedor aumenta os custos de aprisionamento e migração.
Avalie os provedores usando suas próprias tarefas e conjuntos de dados.
Revise os termos legais, de privacidade e segurança antes da integração.
Mantenha um plano alternativo entre modelos ou fornecedores.
Monitore as notas de lançamento para que as mudanças no roteiro não surpreendam as equipes.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
A Cerebras constrói o maior chip de computador do mundo, o Wafer-Scale Engine, colocando um processador de IA inteiro em um único pedaço de silício do tamanho de um prato de jantar. É importante porque esse design radical reduz o tempo necessário para treinar e executar grandes modelos de IA.
A Cerebras mantém um wafer de silício inteiro como um chip gigante, em vez de cortá-lo em muitas matrizes pequenas, criando um processador do tamanho de um prato.
A comunicação no chip é muito mais rápida do que a rede entre chips separados, proporcionando enorme largura de banda e baixa latência para cargas de trabalho de IA.
O mecanismo Wafer-Scale de terceira geração contém cerca de 4 trilhões de transistores, uma contagem enorme possibilitada pelo uso de todo o wafer.
A Cerebras ganhou fama por executar grandes modelos de linguagem a milhares de tokens por segundo, muito mais rápido do que as implantações típicas de GPU.
Como alguns defeitos são inevitáveis em um wafer completo, a Cerebras cria redundância para que o chip possa contornar áreas ruins e ainda funcionar.
Continue aprendendo
Mais guias escolhidos para este tópico
A seguirPróximo guia
Sistemas autônomos de cruzeiro
Empresas