Fireworks Nexus stuurt code naar goedkopere modellen
Fireworks AI heeft Nexus uitgebracht, een tussenlaag die per verzoek bepaalt welk taalmodel de klus krijgt. Eenvoudige vragen gaan naar een goedkoop open-weight model, moeilijke taken naar het dure model dat een team al gebruikt. Volgens Fireworks scheelt dat drie tot vijf keer in de kosten van AI-codeerwerk, zonder dat de kwaliteit inzakt.
Hoe de router kiest
Nexus draait op een apart getraind model dat de moeilijkheid van elk verzoek inschat. Routineklussen, denk aan boilerplate of simpele refactors, gaan naar een open-weight model dat Fireworks zelf host. Complexere taken sluist de router door naar de bestaande aanbieder, op de eigen API-sleutel van de klant. In de researchpreview schakelt Nexus tussen Claude Opus 5 en GLM 5.2. Wie helemaal op open gewichten wil blijven, laat het kiezen tussen Kimi K3 en GLM 5.2. De gemengde tokenprijs komt daarmee op ongeveer een kwart van wat de gesloten labs rekenen, aldus Fireworks. Dat het schakelen juist bij een sterk maar prijziger model als Claude Opus 5 gebeurt, laat zien waar de besparing zit.
Wat het oplevert

Fireworks noemt eerste cijfers uit tests bij Notion en Doximity. Daar zou Nexus ongeveer een derde van de kosten per samengevoegde pull request afhalen. De aanpak past in een verschuiving waarbij bedrijven niet langer één model voor alles kiezen, maar werk verdelen over dure en goedkope opties. Die beweging zagen we eerder terug in de prijzenoorlog op tokenkosten en in de bredere opmars van goedkopere modellen. Nexus zit nog in researchpreview, dus de intelligente routing en migratie zijn nog niet af.
Open gewichten voor het saaie werk
Voor ontwikkelteams verschuift de vraag van welk model het beste is naar welk model per taak past. Een router die dat automatisch regelt, verlaagt de drempel om open-weight modellen in te zetten voor het routinewerk en het dure model te bewaren voor de lastige gevallen. Dat raakt ook het debat over open gewichten, waar Anthropic-topman Dario Amodei zich onlangs voorzichtig over uitliet.
Wie AI serieus inzet, kiest straks geen enkel vast model meer, maar laat het werk slim verdelen. De echte besparing zit niet in de router, maar in teams die leren welke taak welk model verdient.
Leon Tindemans, AI-expert en Copilot- & ChatGPT-trainer
Grip op die keuzes begint bij scherpe instructies. Tindemans behandelt dat in zijn training prompts schrijven voor AI bij TTM Communicatie.
Wat betekent dit
Zolang Nexus in preview blijft, is de winst vooral een belofte. Toch geven de tests bij Notion en Doximity een richting aan: routineklussen laten afhandelen door een goedkoop model kan de rekening voor AI-codeerwerk fors drukken. Voor teams die nu al veel met AI programmeren, is het de moeite waard om te meten welk deel van hun werk eigenlijk een duur model nodig heeft. Vaak is dat minder dan gedacht.
