AMD en Cerebras splitsen AI-inferentie in tweeën
AMD en Cerebras hebben op 23 juli een technische samenwerking aangekondigd die AI-inferentie opsplitst in twee delen. Het idee is simpel: laat elke chip doen waar hij het beste in is. AMD levert zijn Helios-systemen met Instinct-GPU’s, Cerebras brengt de Wafer-Scale Engine in. Samen moeten ze antwoorden sneller en zuiniger genereren dan een van beide alleen, aldus het persbericht van Cerebras.
Hoe de taakverdeling werkt
Inferentie, het draaien van een getraind model, valt uiteen in twee fasen. Eerst leest het model de prompt en de context in, een reken-intensieve klus. Daarna genereert het token voor token het antwoord, wat vooral geheugenbandbreedte vraagt. AMD en Cerebras verdelen die fasen over aparte hardware. De Helios-racks met Instinct-GPU’s verwerken de prompts en grote contextvensters; de Wafer-Scale Engine van Cerebras neemt de snelle tokengeneratie voor zijn rekening. Volgens DataCenterDynamics loopt het geheel als één workflow, waarbij data tussen beide systemen heen en weer gaat.
Cerebras mikt al langer op pure snelheid. Eerder haalde de chip 750 tokens per seconde met GPT-5.6 Sol. Door de zwaardere promptverwerking naar AMD te schuiven, zegt Cerebras zijn wafer vrij te spelen voor het stuk waar hij uitblinkt.

Wat de 5x-claim waard is
De bedrijven claimen tot vijf keer meer tokens per seconde per watt dan een opstelling met alleen de Wafer-Scale Engine. Die vergelijking komt uit modellering die AMD en Cerebras in juli zelf uitvoerden, niet uit gemeten productiecijfers. Techsite TECHi zette dat al in de kop: lees de voetnoot. Het getal zegt dus iets over de verwachte efficiëntie, niet over een gedraaide benchmark. Cerebras wil AMD Helios eerst in zijn eigen datacenters uitrollen; de gecombineerde dienst komt in de tweede helft van 2026 beschikbaar via Cerebras Cloud. De doelgroep bestaat uit softwareontwikkeling, autonome agents, robotica en wetenschappelijk onderzoek, gevallen waarin reactietijd zwaar telt.
De strijd om de inferentiemarkt
De timing valt op. De deal volgt kort op AMD’s overeenkomst met Anthropic en past in een bredere poging om Nvidia’s greep op inferentie te breken. Invezz meldde dat het aandeel AMD na de aankondiging ongeveer 3 procent zakte, deels omdat beleggers de samenwerking defensief lazen. Toch is inferentie het snelst groeiende deel van de AI-rekenmarkt. Startups als Etched proberen met gespecialiseerde inferentiechips hetzelfde: goedkoper en sneller antwoorden dan een algemene GPU. Ook de prijzenoorlog om AI-agents draait uiteindelijk op inferentiekosten. Wie tokens goedkoper genereert, wint. AMD zoekt daarvoor partners, na eerder Qualcomm dat Modular kocht om Nvidia’s softwarevoorsprong aan te vallen.
Wat betekent dit
Voor gebruikers verandert er voorlopig weinig zichtbaars. De winst zit onder de motorkap: snellere antwoorden bij lager stroomverbruik maken realtime agents en coding-assistenten betaalbaarder. Belangrijker is het signaal. Twee chipmakers die hun architecturen aan elkaar knopen, laten zien dat de volgende ronde in AI-hardware draait om slimme taakverdeling in plaats van één alleskunner. Of de beloofde vijf keer betere efficiëntie standhoudt, blijkt pas als de eerste klanten later dit jaar op Cerebras Cloud draaien.
