Open modellen doen nu 56 procent van het AI-werk
Bedrijven halen hun AI-werk steeds vaker weg bij de duurste modellen. Open modellen met vrij beschikbare gewichten namen in augustus 56 procent van al het tokenverkeer door de AI Gateway van Vercel voor hun rekening, tegen 7 procent in december 2025. De Financial Times telde daarnaast zes keer zo veel verwijzingen naar open modellen in de laatste ronde Amerikaanse kwartaalcijfers als een jaar eerder.
Veel tokens, weinig omzet
De cijfers uit het maandrapport van Vercel laten een scherpe splitsing zien. Open modellen verwerken meer dan de helft van het volume, maar staan voor 14 procent van de bestedingen. Anthropic hield in augustus 64 procent van alle omzet op het platform, met Opus 5 op 22,5 procent. De gemiddelde prijs per token daalde die maand met 23,2 procent en ligt nu op minder dan de helft van het niveau van vijf maanden eerder. Die snelle prijsdaling per prestatie-eenheid zagen we eerder al in ander onderzoek terug.
Het patroon wijst op een tweedeling in het gebruik: routinewerk zoals classificatie, extractie en herhalende agentstappen gaat naar goedkope open modellen, terwijl de moeilijkste taken bij een frontier-model blijven liggen. Vercel schrijft dat teams zo meer inferentie uit hetzelfde budget halen en de premiummodellen bewaren voor taken die de prijs rechtvaardigen.

AT&T routeert 40 procent zelf
AT&T is het duidelijkste voorbeeld. Vicepresident Mark Austin liet weten dat 40 procent van de AI-verzoeken van medewerkers nu naar open modellen gaat, met een doel van 60 tot 70 procent binnen enkele jaren. Het telecombedrijf gebruikt de router LiteLLM om eenvoudig werk, het grootste deel van het totaal, door te sturen naar modellen als Nemotron, Llama en Gemma. Op programmeertaken zakten de kosten daardoor met 56 procent, bij 2 procent kwaliteitsverlies.
De verschuiving raakt ook de aanbieders zelf. De Financial Times ziet bestedingen wegvloeien van OpenAI en Anthropic naar goedkopere alternatieven van Meta, Alibaba en Z.ai. Het aandeel bedrijven dat betaalt voor model-serving-platforms, de categorie waar de Chinese en open modellen onder vallen, groeide van 4,5 procent in januari naar 6,1 procent in augustus. Chinese labs profiteren daar het meest van; hun modellen stonden eerder dit jaar al boven de Amerikaanse in de downloadcijfers van Hugging Face.
Aanbod groeit mee
Het aanbod houdt het tempo bij. Z.ai gaf deze maand de code van ZCode vrij, Xiaomi publiceerde MiMo-Flash samen met 7.000 RL-omgevingen, en Beijing-startup NaiveAI zette op 28 september Naive-N0.5-Flash op Hugging Face: een mixture-of-experts-model van 309 miljard parameters onder MIT-licentie, met een contextvenster van een miljoen tokens. Kleinere modellen worden tegelijk praktischer om zelf te hosten, zoals de compressie van Qwen3.8 27B tot 5,9 GB aantoont.
Wat betekent dit
Voor Nederlandse organisaties die met AI werken, verschuift de vraag van welk model is het beste naar welk model past bij deze taak. De cijfers van AT&T geven een indicatie van wat er te halen valt: meer dan de helft van de kosten eraf op een deel van het werk, met verwaarloosbaar kwaliteitsverlies. Dat vereist wel een routeringslaag, meetbare kwaliteitscontroles per taaktype en iemand die de afweging blijft volgen. Wie alles standaard naar het duurste model stuurt, betaalt vooral voor capaciteit die de meeste verzoeken niet nodig hebben.
Voor OpenAI en Anthropic is de omzet nog niet in gevaar, want de winstgevende taken blijven bij hen. Het volume schuift wel weg, en daarmee de vanzelfsprekendheid waarmee bedrijven hun standaardmodel kiezen.
