Cerebras stopt drie wafers in een rack met de CS-4
3 mins read

Cerebras stopt drie wafers in een rack met de CS-4

Cerebras kondigde op 19 augustus de CS-4 aan, het eerste rack-scale systeem van het bedrijf. In een enkele kast zitten drie wafer-scale chips die samen 750 PFLOPS leveren. Het ontwerp mikt op een specifiek deel van de markt: inferentie waarbij de gebruiker niet op zijn tokens wil zitten wachten.

Drie wafers in een kast

De CS-4 draait op de WSE-3 Turbo, een opgevoerde versie van de bestaande wafer-scale engine. Volgens ServeTheHome zit het verschil vooral in kloksnelheid en niet in de architectuur. Het aantal transistors blijft vier biljoen, het aantal rekenkernen 900.000 en de hoeveelheid SRAM op de wafer 44 GB, maar met verdubbelde kloks komt de chip uit op 250 PFLOPS sparse FP16 tegen 125 eerder. De geheugenbandbreedte per wafer gaat van 21 naar 43,2 petabyte per seconde. TSMC bakt de chips op 5nm.

Drie van die wafers bij elkaar leveren 129,6 petabyte per seconde aan bandbreedte en 132 GB SRAM. Techzine meldt dat de latency tussen de wafers daalt van vijf naar ongeveer twee microseconden. Het onderliggende Nexus-ontwerp is modulair opgezet, met de rekeneenheid in een verticale backpack die aan het voedingsrek hangt. Cerebras wil daar later de CS-5 en CS-6 in kwijt kunnen zonder de rest van de kast te vervangen.

Handen met handschoenen houden een silicium wafer vast in een cleanroom

Tokens per seconde per gebruiker

Cerebras verkoopt zelden totale doorvoer. Het bedrijf meet snelheid per gebruiker, en in eigen tests haalt de CS-4 ruim 4.400 tokens per seconde per gebruiker op GPT-OSS-120B. In het persbericht van 19 augustus vertaalt Cerebras dat naar tot dertig keer sneller dan GPU-systemen. Dat getal komt van de fabrikant en is nog niet onafhankelijk nagemeten. Ter vergelijking: OpenAI zette eerder deze maand GPT-5.6 Sol op zo’n 750 tokens per seconde.

Voor wie een datacenter moet inrichten zijn de energiecijfers relevanter. Cerebras claimt tot tien keer meer doorvoer per watt dan bij de CS-3. ServeTheHome schat het verbruik op ongeveer 54 kW per wafer, waarmee een volle kast in dezelfde orde valt als de zwaarste GPU-racks. De eerste leveringen staan gepland voor dit kwartaal.

De inferentiemarkt raakt vol

Cerebras is niet de enige die probeert Nvidia te omzeilen op inferentie. AMD kocht deze maand Taalas, dat modellen rechtstreeks in silicium brandt. Chipstartup Fractile werd 6,5 miljard dollar waard na een deal met Anthropic, en SambaNova haalde eerder een miljard op met hetzelfde verhaal. Ondertussen ontwerpen de grote AI-labs steeds vaker hun eigen inferentiechip.

CEO Andrew Feldman mikt volgens Techzine op systemen die eind 2027 vier keer zo snel zijn en twintig keer meer doorvoer halen, bij een geïnstalleerde capaciteit van 600 MW. Het bedrijf boekte in het laatste kwartaal 180,1 miljoen dollar omzet met een aangepast verlies van 6,9 miljoen.

Wat betekent dit

Voor de meeste bedrijven verandert er op korte termijn weinig. Wafer-scale hardware koop je niet per stuk, en Cerebras levert vooral via de eigen cloud en een handvol grote klanten. Wat wel opschuift is de verwachting rond snelheid. Als redeneermodellen honderden tokens moeten produceren voordat er een antwoord verschijnt, bepaalt tokens per seconde direct hoe bruikbaar een assistent aanvoelt. Toepassingen die nu te traag zijn voor live gebruik, denk aan agents die tijdens een gesprek code schrijven of documenten doorspitten, komen daarmee in beeld. De vraag is of de dertig keer uit het persbericht overeind blijft zodra externe partijen de CS-4 zelf mogen meten.