Google bakt Gemini in silicium met Frozen v2
3 mins read

Google bakt Gemini in silicium met Frozen v2

Google werkt aan een server-chip die de opbouw van zijn Gemini-model rechtstreeks in de hardware verwerkt. Dat meldde The Information op 21 juli 2026. Intern heet het project Frozen v2, en de inzet is fors: medewerkers die aan het ontwerp werken rekenen op zes tot tien keer meer tokens per watt dan de nieuwste versie van Google’s eigen Tensor Processing Units. Het aandeel Alphabet steeg na het bericht, schreef CNBC.

Wat Frozen v2 anders maakt

Een gewone AI-versneller, of dat nu een GPU van NVIDIA is of een TPU, laadt een model in het geheugen en schuift constant data heen en weer. Bij elke nieuwe modelversie moet de chip opnieuw uitvogelen hoe die het werk verdeelt. Frozen v2 draait dat om. De naam verwijst naar het permanent vastleggen, het bevriezen, van een deel van het model in het silicium zelf. Volgens Tom’s Hardware etst Google veel van de vaste keuzes uit de Gemini-architectuur in de schakelingen, waardoor het aantal rekenstappen en de hoeveelheid dataverkeer dalen.

Serverhal in een datacenter met rijen serverracks voor AI-inferentie

Die winst geldt alleen voor inferentie, het draaien van een afgetraind model. Precies daar zit voor Google de grootste rekenrekening, want elke vraag aan Gemini kost stroom. Hoeveel van de modelgewichten Google echt in de chip wil vastleggen, is nog niet besloten, aldus Digitaltoday.

Zes tot tien keer zuiniger, op zijn vroegst in 2028

De cijfers klinken groot, maar er zitten haken en ogen aan. The Decoder benadrukt dat Frozen v2 voorlopig een verkennend project is. Google mikt op inzet vanaf 2028, en dat is een intern streven, geen belofte. De chip komt bovendien niet in de plaats van de TPU’s. Die blijven nodig omdat ze met meerdere modellen overweg kunnen, terwijl Frozen v2 is toegesneden op Gemini. Klanten van Google Cloud krijgen de chip naar verwachting niet los te gebruiken; het is een intern instrument om kosten te drukken.

De timing is logisch als je kijkt naar Google’s rekenhonger. Het bedrijf trok zijn investeringen in datacenters op naar 205 miljard dollar en botst intern op een tekort aan rekenkracht, waardoor Google Cloud naar verluidt zelfs deals met externe klanten afwees. Zuinigere silicium verlicht die druk. Tegelijk werkt Google al aan de pretraining van Gemini 4, en een chip die op één specifieke architectuur is vastgezet, is riskant zolang die architectuur nog verandert.

Wat betekent dit

Frozen v2 is een gok dat de vorm van grote taalmodellen langzaam uitkristalliseert. Als die aanname klopt, kan Google inferentie flink goedkoper draaien dan concurrenten die generieke versnellers gebruiken, iets wat past bij de bredere prijzenslag rond goedkopere modellen als Gemini 3.6 Flash. Verandert de architectuur toch nog sterk, dan zit Google met dure hardware die te vroeg is bevroren. Het bericht laat vooral zien hoe de strijd verschuift van wie het slimste model heeft naar wie het goedkoopst kan draaien, een gevecht dat ook op de nieuwe chips van AMD wordt uitgevochten. Voor gebruikers telt straks één ding: goedkopere inferentie betekent lagere prijzen per token.