NVIDIA geeft Nemotron 3.5 Lightning vrij voor agents
NVIDIA heeft dinsdag Nemotron 3.5 Lightning uitgebracht, een open model van 30 miljard parameters dat bedoeld is voor agents die de hele dag door draaien. Daarnaast komt er een routeerbibliotheek, NeMo Switchyard, die per taak bepaalt welk model het werk krijgt. CNBC en SiliconANGLE meldden de release, NVIDIA zelf publiceerde de technische details op zijn ontwikkelaarsblog.
Klein model, hoge snelheid
Lightning is een mixture-of-experts-model: van de 30 miljard parameters staan er per token ongeveer 3 miljard aan. Dat scheelt rekenwerk, en NVIDIA claimt tot vier keer meer uitvoersnelheid dan vergelijkbare modellen in dezelfde klasse en 30 procent snellere afronding van agenttaken. De winst komt volgens het bedrijf uit speculatief decoderen, training die is afgestemd op de agentharnas waarin het model draait, en kwantisatie naar NVFP4. Er zijn checkpoints in NVFP4 en BF16.
De opzet lijkt op wat Meta vorige week deed met Muse Glimmer, dat op een enkele consumenten-GPU draait. Ook Lightning is niet gebonden aan een datacenter: NVIDIA noemt RTX-pc’s, DGX Spark, DGX Station, Jetson-borden en RTX PRO-workstations, plus de gebruikelijke cloudopties. Het model staat op Hugging Face, ModelScope en OpenRouter, en als NIM-microservice op build.nvidia.com.

Zelf bijtrainen voor 85 dollar
Interessanter dan de benchmarkcijfers is wat NVIDIA meelevert. Naast de gewichten publiceert het bedrijf de post-trainingsdatasets, waaronder Nemotron-RL-Agentic-Terminal-Pivot, en de recepten waarmee het model is bijgetraind. Codeplatform CodeRabbit trainde volgens SiliconANGLE een router-agent voor 85 dollar in ongeveer twee uur. Kari Briski, vicepresident generatieve AI bij NVIDIA, zei tegen die site dat klanten vooral melden hoe makkelijk Lightning aan te passen is.
Dat past in een bredere lijn. Chipmakers en modelbouwers zetten hun kleinere modellen steeds vaker open online, zoals AMD deed met Instella-MoE, terwijl de licenties tegelijk strenger worden bij partijen die er geld aan willen verdienen. Alibaba wil een omzetdeel van grote Qwen-gebruikers en de gewichten van Qwen3.8 lieten dagenlang op zich wachten.
Switchyard verdeelt het werk
NeMo Switchyard staat op GitHub en stuurt elke aanvraag naar het model dat qua complexiteit, kosten, nauwkeurigheid en snelheid het beste past, zonder dat een applicatie herschreven hoeft te worden. In eigen tests komt NVIDIA daarmee op ongeveer een derde van de kosten van alles door Opus 4.8 laten lopen, bij gelijkblijvende nauwkeurigheid. Dat is een claim van de leverancier zelf, dus vergelijk hem met de nodige argwaan. Aan de routeerkant werkt NVIDIA samen met acht partijen, waaronder Cadence, Kong, LangChain en Siemens.
Wat betekent dit
Voor bedrijven die met agents experimenteren verschuift de vraag van welk model is het slimst naar welk model is goed genoeg voor deze stap. Een agent die honderd keer per uur een formulier uitleest of een logbestand doorzoekt, hoeft dat niet door het duurste frontier-model te laten doen. NVIDIA verkoopt de chips waarop dit alles draait, dus het bedrijf heeft belang bij meer inferentie op eigen hardware, ook thuis en op de werkplek. Wie zelf gaat bouwen: begin met de goedkope taken, meet wat een agent per taak kost, en bewaar het zware model voor de stappen waar het echt uitmaakt. Zie ook hoe ServiceNow en NVIDIA agents in een sandbox met toezicht zetten.
