Google lanceert TPU 8t en 8i: nieuwe AI-chips moeten training en inference voor agents versnellen
Google heeft tijdens Cloud Next ’26 zijn achtste generatie TPU’s aangekondigd: de TPU 8t voor modeltraining en de TPU 8i voor inference. Daarmee kiest Google nadrukkelijk voor een tweesporenstrategie in AI-hardware. Het bedrijf positioneert de nieuwe chips als infrastructuur voor de “agentic era”, waarin AI-systemen niet alleen antwoorden geven, maar ook taken uitvoeren, samenwerken en in meerdere stappen redeneren.
Waarom Google TPU 8t en 8i nu lanceert
Volgens Google veranderen AI-workloads snel. Waar de afgelopen jaren vooral draaiden om het trainen van steeds grotere modellen, verschuift de markt nu richting grote inference-belasting en agentic workflows. In zijn keynote voor Cloud Next zei CEO Sundar Pichai dat juist daarom infrastructuur moet meebewegen. Voor AI Feiten-lezers sluit dat aan op onze eerdere stukken over de oplopende druk op TPU-infrastructuur en datacenterhonger en over hoe Alphabet AI-investeringen steeds zichtbaarder omzet in groei.
TPU 8t moet frontier-training versnellen
De TPU 8t is het trainingspaard van de nieuwe generatie. Google zegt dat één superpod kan opschalen tot 9.600 chips en 2 petabyte gedeeld high-bandwidth memory. De architectuur moet volgens het bedrijf 121 exaflops leveren en bijna 3 keer meer compute per pod bieden dan de vorige generatie. Google mikt bovendien op meer dan 97% goodput: een maat voor hoeveel rekentijd echt productief wordt gebruikt in plaats van verloren te gaan aan storingen, netwerkvertraging of herstarts.
Dat detail is belangrijk. In de AI-race telt niet alleen rauwe snelheid, maar ook hoeveel tijd een cluster echt beschikbaar blijft. Het past bij de bredere beweging die we eerder zagen in de strijd tussen OpenAI, AWS, Microsoft en Google: infrastructuur is niet langer achtergrondtechnologie, maar een concurrentiewapen.
TPU 8i richt zich op inference en AI-agents
Minstens zo interessant is de TPU 8i, die speciaal is ontworpen voor inference. Google zegt dat één pod 1.152 TPU’s koppelt en dat de chip is uitgerust met 288 GB high-bandwidth memory en 384 MB on-chip SRAM, drie keer zoveel SRAM als bij de vorige generatie. Het doel: lagere latency en hogere throughput voor toepassingen waarin veel AI-agents tegelijk actief zijn.
Die focus sluit aan op Google’s bredere agentstrategie. Tijdens hetzelfde event presenteerde het bedrijf ook nieuwe enterprise-tools rond Gemini en agentbeheer. Eerder zagen we al hoe Google Gemini praktischer maakt met functies zoals het direct genereren van documenten en pdf’s; nu wordt ook duidelijk op welke infrastructuurlaag Google die productambities wil laten draaien.
Wat betekent dit voor de AI-markt?
De aankondiging laat vooral zien dat de AI-strijd verschuift van losse modeldemo’s naar gespecialiseerde infrastructuur voor training én inference. Met TPU 8t en 8i probeert Google zich niet alleen te onderscheiden van Nvidia, maar ook van cloudrivalen die dezelfde enterprise-klanten willen bedienen. Als Google deze chips later dit jaar breed beschikbaar maakt, kan dat de prijs-prestatieverhouding van grote AI-workloads flink beïnvloeden.
Voor bedrijven betekent dit dat de keuze voor een AI-platform steeds meer afhangt van de totale stack: modellen, beveiliging, data én chips. Google maakt met TPU 8t en 8i duidelijk dat het die volledige keten zelf wil controleren.
Bronnen:
Google Blog – Our eighth generation TPUs: two chips for the agentic era
Google Blog – Cloud Next ’26: Momentum and innovation at Google scale
Google Cloud Blog – Welcome to Google Cloud Next ’26
