Cerebras stapelt geheugen boven op de wafer
Cerebras heeft op chipconferentie Hot Chips 2026 laten zien hoe zijn wafer-scale systemen er de komende jaren uit gaan zien. Het bedrijf zette twee opvolgers op de kaart: de CS-5 voor 2027 en een CS-6 waarin voor het eerst DRAM boven op de rekenwafer wordt gestapeld. Tom’s Hardware pikte dat laatste eruit als de grootste breuk met het huidige ontwerp.
Nexus knipt het rack in losse blokken
De basis onder de plannen heet Nexus, het rack-ontwerp waarop de CS-4 met drie wafers per rack al draait. Die wafers zitten in losse compute-modules die Cerebras backpacks noemt, zodat voeding, koeling en I/O apart vernieuwd kunnen worden. In de eigen technische toelichting bij de presentatie schrijft Cerebras dat de AC/DC-omzetters op een halve millimeter van de wafer zitten, ongeveer honderd keer dichterbij dan in GPU-systemen. ServeTheHome noteerde uit dezelfde sessie dat de CS-4 twee keer zoveel tokens levert als de CS-3 bij tien keer betere energie-efficiëntie, en dat de wafers onderling praten met een vertraging van twee microseconden.

CS-5 mikt op 10.000 tokens per seconde
Voor 2027 belooft Cerebras met de CS-5 tienduizend uitvoertokens per seconde per gebruiker op open modellen als Gemma 4 31B en gpt-oss-120b. Bij de zwaarste modellen, met biljoenen parameters, houdt het bedrijf het op vijfduizend tokens per seconde per gebruiker. Het getal dat er voor datacenterplanners echt toe doet staat er iets verderop: drie miljoen tokens per seconde per megawatt. Dat weegt zwaar nu netbeheerders waarschuwen dat datacenters de komende tien jaar veel meer stroom gaan trekken. Cerebras zegt met de CS-5 modellen tot vijftig biljoen parameters te willen bedienen.
Geheugen boven op de wafer
Met de CS-6 breekt Cerebras met het principe waar het bedrijf groot mee werd. Tot nu toe zit al het geheugen als SRAM op de wafer zelf. Dat levert volgens Cerebras 53,5 petabyte per seconde aan bandbreedte op, tegenover 260 terabyte per seconde fabric-bandbreedte in een NVL72-rack van Nvidia. Snel, maar krap, want SRAM kost veel oppervlak per opgeslagen bit. Door DRAM er in drie dimensies bovenop te stapelen wil Cerebras meer van een model op één systeem houden zonder de wafer breder te maken. Aan dat ontwerp wordt naar eigen zeggen sinds 2024 gewerkt, met een systeem dat een orde van grootte kleiner uitvalt als doel.
Wat betekent dit
Voor bedrijven die AI-toepassingen bouwen gaat dit vooral over wachttijd. Redeneermodellen en agents produceren veel meer tokens per opdracht dan een gewone chatbot, en elke token kost tijd en stroom. Meer concurrentie op inferentiesnelheid drukt beide. Tegelijk is dit een roadmap en geen product: de CS-5 staat pas voor 2027 gepland en de CS-6 bestaat op papier. De cijfers komen van Cerebras zelf, gemeten op eigen hardware, dus onafhankelijke benchmarks moeten nog volgen. Wie vandaag capaciteit inkoopt komt nog altijd bij Nvidia uit, dat deze week een inferentiechip in volle productie nam en van AWS een order voor twee miljoen GPU’s binnenhaalde.
