Terug naar Nieuws
ProductAI Understanding-briefing

Cerebras beschrijft de CS-4-rackarchitectuur en previews van CS-5 en CS-6

Cerebras heeft aanvullende architectuurdetails gepubliceerd voor zijn CS-4 AI-systeem en doelstellingen geschetst voor toekomstige CS-5- en CS-6-processors. Het bedrijf zegt dat zijn aanpak op waferschaal is ontworpen om dataverkeer, stroomverlies en infrastructuurcomplexiteit te verminderen, maar de claims over prestaties en roadmaps blijven door het bedrijf gerapporteerd.

6 min readRead the primary source
Primary-source image accompanying Cerebras details CS-4 rack architecture and previews CS-5 and CS-6
Primair brondocumentBron opgenomen
Uitgever
cerebras.ai
Bronlink
cerebras.aihttps://www.cerebras.ai/blog/ultrafast-frontier-inference-cerebras-deep-dive-at-hot-chips-2026
Brontype
Primair document: een officiële aankondiging, document, dossier of first-party pagina die we rechtstreeks lezen.
ContextBegrijp dit in 60 seconden

Begin hier

Sleuteltermen

Geheugen (agentgeheugen)
Opgeslagen context die een AI-agent in stappen of sessies gebruikt om de continuïteit te verbeteren.
Temperatuur
Een steekproefinstelling die de willekeur in de gegenereerde uitvoer regelt.
Gevolgtrekking
De runtimefase waarin een getraind model voorspellingen of uitvoer genereert.
Test jezelfQuiz over AI-modellen uitgelegd

Wat is er gebeurd

Cerebras zegt dat CS-4 het eerste systeem is dat is gebouwd op zijn Nexus rack-scale platform, dat drie wafer-scale motoren combineert in modulaire computerrugzakken met speciale voeding, koeling en I/O. Het bedrijf gaf ook een preview van CS-5, bedoeld voor 2027, en CS-6, dat bedoeld is om rekenkracht op waferschaal en SRAM te combineren met driedimensionaal gestapelde DRAM.

In de blog van Cerebras van 25 augustus staat dat het bedrijf aanvullende details over de CS-4-architectuur presenteerde op de Hot Chips-conferentie in Palo Alto, nadat het systeem vorige week op Supernova 2026 was geïntroduceerd. De bron beschrijft CS-4 als het eerste product dat is gebouwd op Nexus, een herbruikbaar rack-scale platform. Nexus plaatst drie motoren op waferschaal in modulaire computerrugzakken die aan de achterkant van een rek zijn gemonteerd, waarbij het voorste gedeelte een gedeelde stroominfrastructuur bevat. Cerebras zegt dat het modulaire ontwerp het mogelijk maakt om de stroom-, koeling- en I/O-componenten onafhankelijk te verbeteren en bedoeld is om toekomstige generaties van zijn systemen te ondersteunen.

Het bedrijf zegt dat elke computerrugzak één wafer-schaalmotor, een eigen waterconditioneringssysteem en speciale I/O bevat. Het koelontwerp omvat stromings- en temperatuurbewaking, instelbare stroming naar koude platen, droge snelkoppelingskleppen en lek- en condensatiesensoren die een rugzak in een veilige staat kunnen plaatsen en de stroom naar de voedingsmodules kunnen uitschakelen. Cerebras zegt dat een rugzak kan worden vervangen zonder de gedeelde waterinfrastructuur leeg te laten lopen of de netwerkinfrastructuur van het rack te verstoren. Dit zijn ontwerpclaims van de verkoper; de bron levert geen gegevens over de betrouwbaarheid in het veld, aantallen implementaties of onderhoudsgegevens.

Cerebras beschrijft ook een ontwerp voor stroomafgifte waarbij AC/DC-converters ongeveer 0,5 millimeter van de wafer worden geplaatst, vergeleken met ongeveer 50 millimeter van silicium in de conventionele GPU-systemen die door het bedrijf worden beschreven. De blog zegt dat deze opstelling een printplaat in het uiteindelijke stroomtoevoerpad vermijdt en bijna twee keer zoveel stroom mogelijk maakt bij vrijwel dezelfde spanning met weinig extra weerstandsverlies. Het rack kan maximaal 30 speciale luchtgekoelde voedingsmodules per rugzak gebruiken, met meerdere redundantieconfiguraties en maar liefst zes bedrade AC-voedingen die van bovenaf binnenkomen.

Voor de roadmap zegt Cerebras dat CS-5 gericht is op 2027 en is ontworpen om tot 10.000 outputtokens per seconde per gebruiker te genereren op modellen zoals Gemma 4 31B en gpt-oss-120b. Voor grotere modellen, inclusief de bronvoorbeelden Kimi en GPT-5.6 Sol, mikt het bedrijf op maximaal 5.000 outputtokens per seconde per gebruiker en 3 miljoen tokens per seconde per megawatt. CS-6 wordt beschreven als een 3D-integratieproject voor de langere termijn dat gebruik maakt van SRAM op waferschaal en computergebruik naast gestapelde DRAM. De bron zegt dat het werk aan dat concept in 2024 begon, maar geeft geen releasedatum.

Brongegevens: cerebras.ai ↗

Waarom het ertoe doet

De aankondiging beschrijft een alternatief voor multi-GPU-systemen voor AI-inferentie, met name workloads die veel sequentiële modelaanroepen vereisen of die met kleine batchgroottes werken. Als Cerebras de genoemde voordelen op het gebied van snelheid, efficiëntie en implementatie kan leveren, zou de architectuur van invloed kunnen zijn op de manier waarop grote AI-inferentiesystemen worden ontworpen, hoewel de bron deze resultaten niet onafhankelijk vaststelt.

Het centrale technische argument is dat AI-inferentie kan worden beperkt door communicatie tussen computerelementen, en niet alleen door rekenkundige capaciteit. Cerebras zegt dat conventionele systemen het werk verdelen over veel GPU's die zijn verbonden via externe links en switches, waardoor serialisatie-, synchronisatie- en softwarecoördinatiekosten ontstaan. Het alternatief houdt de communicatie tussen kernen op de wafer in stand. Het bedrijf stelt dat dit de latentie, het stroomverbruik, de hardwarekosten en potentiële storingspunten vermindert, vooral bij kleine batchgroottes. Deze voordelen zijn plausibele technische doelstellingen, maar de blog biedt geen onafhankelijke tests om de omvang ervan vast te stellen.

Cerebras meldt dat zijn WSE-3T 53,5 petabytes per seconde aan totale on-wafer fabric-bandbreedte heeft en vergelijkt dat cijfer met de 260 terabytes per seconde aan NVLink-bandbreedte op rackniveau die het toeschrijft aan een NVIDIA Rubin NVL72-rack. Dergelijke vergelijkingen beschrijven verschillende systeemarchitecturen en mogen niet worden beschouwd als een volledige maatstaf voor de prestaties van applicaties. De bron biedt geen overeenkomende benchmarks, testprocedures, prijzen, totaal systeemvermogen, modelkwaliteitsmetingen of resultaten van onafhankelijke beoordelaars.

De voorgestelde architectuur is vooral relevant voor agentische werkbelastingen, omdat deze systemen veel sequentiële modelaanroepen kunnen doen. Cerebras zegt dat een snellere generatie bij elke stap de totale taakvoltooiingstijd kan verkorten. Het stelt ook dat het houden van hoogvolume tensor- en expertcommunicatie binnen een wafer waardevoller wordt naarmate de modellen groter worden, de mix van experts-routing groter wordt, contextvensters langer worden en batchgroottes kleiner worden. De praktische impact zal afhangen van de manier waarop modellen worden gepartitioneerd, hoeveel gegevens tussen systemen moeten worden verplaatst en of softwaretools de hardware efficiënt kunnen gebruiken.

De routekaart suggereert dat Cerebras zowel op systeemontwerp als op processorspecificaties concurreert. Nexus is bedoeld om het bedrijf rekenkracht, geheugen, stroom, koeling en I/O als een gecoördineerd platform te laten ontwikkelen, terwijl CS-6 tot doel heeft de geheugencapaciteit te vergroten zonder de gegevenslocatie op waferschaal te verliezen. Meer geheugen in de buurt van rekenkracht zou de infrastructuur kunnen verminderen die nodig is om zeer grote modellen te draaien, zoals Cerebras beweert. De bron maakt echter geen productiepartners, verwachte systeemkosten, productiecapaciteit, klantverplichtingen of bewijs bekend dat het voorgestelde 3D-ontwerp klaar is voor commerciële inzet.

Interactive Mechanism

Interactief mechanisme: hoe het eigenlijk werkt

Ontdek interactief de onderliggende technologie achter deze ontwikkeling.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Interactieve conceptcheck+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Wat je nu moet bekijken

De belangrijkste vragen zijn of de CS-4-prestaties stand houden bij onafhankelijke workloads, configuraties en modellen; wanneer CS-5 beschikbaar zal komen; en of het 3D-geheugenontwerp van CS-6 op de aangegeven schaal kan worden vervaardigd en ingezet. Prijzen, klantbeschikbaarheid, stroomverbruik in de praktijk en geverifieerde vergelijkingen met concurrerende systemen worden niet verstrekt.

Het eerste verificatiepunt is het onafhankelijk testen van de prestaties van CS-4. Cerebras zegt dat zijn vergelijkingen mogelijk afhankelijk zijn van benchmarking door derden of interne tests en waarschuwt dat waargenomen verbeteringen in de gevolgtrekkingen kunnen variëren afhankelijk van de werklast, configuratie, datum en model. Lezers moeten zoeken naar reproduceerbare tests die latentie, doorvoer, kracht, gebruik en kosten onder vergelijkbare omstandigheden rapporteren, in plaats van te vertrouwen op een enkel tokens-per-seconde-cijfer.

Details over beschikbaarheid en implementatie blijven onduidelijk. In de blog wordt uitgelegd hoe een computerrugzak kan worden geïnstalleerd en onderhouden, maar er wordt niet vermeld wanneer CS-4-systemen algemeen verkrijgbaar zullen zijn, hoeveel er al zijn verzonden, welke datacenterwijzigingen nodig zijn of wat het systeem kost. Cerebras identificeert ook de afhankelijkheid van datacentercapaciteit, kapitaal, strategische afspraken en een beperkt aantal belangrijke klanten als bedrijfsrisico's in zijn toekomstgerichte openbaarmaking.

CS-5 vereist bijzonder onderzoek omdat de gestelde doelen voor timing en tokengeneratie voor 2027 projecties zijn en geen gerapporteerde resultaten. De bron specificeert geen definitief chipontwerp, productieproces, systeemprijs of bevestigde beschikbaarheid. Het bewijst ook niet dat de aangehaalde modellen zullen werken met de aangegeven prestaties over praktische contextlengtes, gelijktijdigheidsniveaus of productiewerklasten.

CS-6 brengt nog grotere onzekerheid met zich mee. Het voorstel om SRAM op waferschaal te combineren en te berekenen met 3D-gestapelde DRAM zou de geheugencapaciteit kunnen aanpakken, maar de bron biedt geen demonstratie, technische voorbeelden, productieschema of thermische en opbrengstgegevens. Cerebras' eigen bekendmaking zegt dat de werkelijke resultaten wezenlijk kunnen verschillen van toekomstgerichte verklaringen en dat het bedrijf geen algemene verplichting heeft om deze bij te werken. Deze beperkingen moeten centraal blijven staan ​​bij eventuele latere berichtgeving.

Gerelateerde gidsen en quizzen

AI-modellen uitgelegdAI-trainingTransformatorenToekomst van AITest wat je weet: probeer een gratis AI-quizZoek een AI-term op in onze woordenlijstVolg de AI-modelreleasetracker
Vond je dit nuttig?