AI-labs bouwen steeds vaker hun eigen inferentiechip
De grootste AI-bedrijven willen niet langer afhankelijk zijn van Nvidia voor het draaien van hun modellen. In de afgelopen weken werd duidelijk dat OpenAI, Anthropic en Amazon allemaal aan eigen silicium werken, specifiek voor inferentie: het moment waarop een getraind model daadwerkelijk antwoorden genereert voor gebruikers. Dat is waar de meeste rekenkosten liggen zodra een model eenmaal draait.
OpenAI zet met Jalapeño de toon
OpenAI onthulde samen met Broadcom een eerste eigen chip, Jalapeño. Volgens TechCrunch gaat het om een ASIC die op de 3nm-technologie van TSMC wordt gemaakt, met acht HBM-geheugenstapels op een enkele die. Tom’s Hardware meldt dat het ontwerp in negen maanden van tekentafel naar tape-out ging, deels omdat OpenAI eigen modellen inzette om delen van het ontwerp te versnellen. Het bedrijf mikt op ongeveer de helft lagere inferentiekosten dan bij de huidige GPU’s en op eerste inzet tegen eind 2026.

Anthropic verkent Samsung, Amazon ontwerpt door
Ook Anthropic zoekt een uitweg. TechCrunch berichtte op 2 juli dat het bedrijf in een vroeg stadium praat met Samsung over een eigen AI-versneller, mogelijk op het 2nm-proces van de Koreaanse fabrikant. Anthropic benadrukte daarbij dat een gemengde hardwarestack met chips van Google, Amazon en Nvidia belangrijk blijft. Samsung was in mei een van de geheugenmakers die meedeed in de financieringsronde van Anthropic. Het bedrijf keek eerder al naar Microsofts Maia 200, iets waar we eerder over schreven.
De beweging past in een bredere trend. DeepSeek werkt aan een eigen inferentiechip om Nvidia te omzeilen, en Chinese partijen trainen modellen al op binnenlandse hardware, zoals Meituan met LongCat-2.0. Ondertussen halen uitdagers als SambaNova kapitaal op om Nvidia partij te bieden.
Waarom nu: de kosten van inferentie
De drijfveer is geld. Naarmate modellen groter worden en meer mensen ze dagelijks gebruiken, lopen de rekenkosten hard op. Eigen chips die alleen voor inferentie zijn ontworpen, kunnen zuiniger en goedkoper werken dan algemene GPU’s. Daar komt de aanhoudende schaarste bij: TSMC blijft records breken terwijl geavanceerde AI-chips moeilijk verkrijgbaar blijven. Wie zélf ontwerpt, is minder overgeleverd aan de wachtrij en de marges van één leverancier.
Tegelijk blijft Nvidia voorlopig onmisbaar. Anthropic zegt zelf dat het bij een gemengde aanpak blijft, en OpenAI’s Jalapeño gaat pas eind dit jaar echt draaien. Eigen silicium ontwerpen kost jaren en miljarden, en de eerste generaties zijn zelden meteen sneller dan wat Nvidia levert.
Wat betekent dit
Voor gebruikers verandert er op korte termijn weinig, maar de richting is helder: de AI-sector wil de controle over haar duurste kostenpost terugpakken. Als de eigen chips van OpenAI en Anthropic hun beloftes waarmaken, kan dat de prijs per verwerkt token op termijn drukken en de afhankelijkheid van één chipmaker verkleinen. De komende maanden laten zien of die belofte standhoudt zodra de eerste eigen versnellers in productie gaan.
