Nvidia zet inferentiechip Groq 3 LPX in productie
3 mins read

Nvidia zet inferentiechip Groq 3 LPX in productie

Nvidia heeft tijdens Hot Chips 2026 bekendgemaakt dat Groq 3 LPX in volle productie is. De versneller is samen met het Vera Rubin-platform ontworpen en richt zich op één knelpunt: het tempo waarmee een model tokens uitspuugt terwijl een agent staat te wachten op een antwoord.

Decoderen en context uit elkaar getrokken

In een gewone opstelling doet dezelfde GPU twee dingen die slecht bij elkaar passen. Een lange context verwerken vraagt vooral rekenkracht. Het antwoord genereren vraagt vooral geheugenbandbreedte en lage latency. Nvidia splitst die taken nu. De Rubin-GPU’s kauwen op de context, de LPX-versnellers nemen het latencygevoelige decodeerwerk over. Techzine noteert 256 LP30-versnellers per rack, goed voor ongeveer 315 PFLOPS aan FP8-rekenkracht en 128 GB SRAM op de chips zelf. Ze praten via directe chip-naar-chip-verbindingen met elkaar, zonder tussenliggende switch.

Dat past bij de richting die Nvidia al langer inslaat. In juli onthulde het bedrijf de Vera-CPU met eigen Olympus-kernen, bedoeld voor het werk rond een model dat je niet op een GPU wilt draaien.

Ontwikkelaar werkt s avonds achter twee schermen aan een AI-agent

3.400 tokens per seconde in de benchmark

Voor het prestatiecijfer leunt Nvidia op een meting van Artificial Analysis met Gemma 4 31B, een open agentmodel. Daarin haalde het systeem 3.400 uitgaande tokens per seconde bij een context van 100.000 tokens, volgens Nvidia vier keer zo snel als het dichtstbijzijnde alternatieve platform. SiliconANGLE tekent daarbij op dat het bedrijf ook tot tien keer meer efficiëntie claimt dan bestaande producten. Dat getal is nog door niemand anders nagerekend, dus het blijft voorlopig een cijfer van de fabrikant zelf.

Snelheid per token is dit jaar een verkoopargument geworden. Cerebras stopte drie wafers in één rack met de CS-4 om hetzelfde punt te maken, en meet zich net als Nvidia af aan de latency die een gebruiker merkt.

Nebius als eerste afnemer

Nebius wordt de eerste AI-cloud met de LPX in het aanbod, via inferentieplatform Token Factory. CoreWeave draait Spectrum-X Multiplane in productie, de netwerkarchitectuur waarmee Nvidia tot 512.000 GPU’s in een platte topologie wil koppelen en 1,6 keer meer output per AI-fabriek belooft. Valt er een plane weg, dan blijft ongeveer 90 procent van de bandbreedte overeind. SpaceXAI zet de Vera-CPU’s in voor orkestratie en simulatie, iets waar we vorige week over schreven.

Eén ding ontbreekt nog: een prijs. Nvidia en Nebius hebben geen tarief, regionale uitrol of lijst met ondersteunde modellen gepubliceerd. Nebius zegt de hardware voor het eind van 2026 bij klanten te hebben.

Wat betekent dit

Voor wie agents bouwt, verschuift het rekenwerk van “hoeveel tokens per dollar” naar “hoe lang staat mijn keten stil”. Een agent die vijftien stappen doorloopt, betaalt vijftien keer de wachttijd van het decodeerproces. Gespecialiseerde hardware voor precies dat deel maakt lange ketens werkbaar in producten waar een gebruiker naar het scherm zit te kijken.

Tegelijk zit er een rekening aan vast. Nvidia verhoogde de serverprijzen deze maand met ruim 15 procent, en zonder gepubliceerd LPX-tarief weet niemand wat die 3.400 tokens per seconde straks kosten. Tot Nebius live gaat en onafhankelijke metingen binnenkomen, blijft dit vooral een belofte op papier.