Writer belooft halvering van kosten AI-agents
Writer, het Amerikaanse bedrijf achter AI-software voor marketing- en contentteams, bracht op 13 augustus zijn nieuwe vlaggenschipmodel Palmyra X6 uit. De aankondiging ging niet over een hogere benchmarkscore, maar over de rekening: volgens Writer draaien zijn AI-agents met het nieuwe model gemiddeld 52 procent goedkoper. TechCrunch en VentureBeat besteedden er aandacht aan omdat de claim raakt aan het probleem waar veel bedrijven nu tegenaan lopen.
De winst zit in de harness, niet in het model
Writer verbeterde tegelijk zijn zogeheten harness, de laag die bepaalt hoe een agent context ophaalt, welke tools hij aanroept en hoeveel stappen hij zet. Die orkestratielaag bepaalt in de praktijk hoeveel tokens een taak verbruikt. Met Palmyra X6 en de nieuwe harness meet Writer 52 procent lagere kosten, 48 procent hogere snelheid en 10 procent betere kwaliteit, aldus SiliconANGLE.
Opvallender is een eerder onderzoek van Writer zelf, vorige maand op arXiv gepubliceerd: alleen al het aanpassen van de harness verlaagde de gemiddelde kosten per taak met ruim 40 procent, en dat gold voor elk model dat het bedrijf testte. De keuze van het model doet er dus minder toe dan de manier waarop je het aanstuurt.

Gebouwd op Chinese open weights
Palmyra X6 is geen model dat Writer helemaal zelf vanaf nul trainde. Het is een post-trainingvariant op GLM-5.2, het open model van het Chinese Z.ai. Dat is dezelfde familie waarvan Z.ai deze week besloot de gewichten van GLM-5.3 tijdelijk achter te houden. Voor Writer is het een manier om onder de prijs van de grote labs te blijven zonder een eigen trainingsloop van miljarden te financieren.
Het model komt naast de bestaande Writer-modellen te staan. Klanten kunnen ook externe modellen via Azure of Amazon Bedrock blijven gebruiken.
Bedrijven kijken naar de factuur
CEO May Habib was tegenover TechCrunch weinig diplomatiek over de concurrentie. Bedrijven zijn het najagen van de volgende benchmark beu, zei ze, en willen vooral dat de kosten stoppen met stijgen. Ze wees erop dat de grote AI-labs een financieel belang hebben bij meer tokenverbruik, precies het tegenovergestelde van wat hun klanten willen.
Dat sentiment past bij wat er verder in de markt gebeurt. Google halveerde deze week de prijs van Gemini 3.7 Flash, terwijl DeepSeek juist zijn API-tarieven fors verhoogde. De prijzen bewegen alle kanten op, en dat maakt het voor inkopers lastig plannen.
Wie zijn AI-kosten wil beheersen, moet niet eindeloos modellen vergelijken maar kijken naar hoeveel omwegen een agent maakt voordat hij klaar is. Daar verdwijnt het budget.
Leon Tindemans, AI-expert en Copilot- & ChatGPT-trainer, geeft onder meer Copilot-training aan organisaties.
Wat betekent dit
Voor organisaties die met agents experimenteren is de boodschap concreet: kijk eerst naar je eigen orkestratie voordat je een duurder model inschakelt. Een agent die drie keer dezelfde documenten ophaalt of onnodig lange contexten meestuurt, kost geld ongeacht welk model eronder hangt. Writer is een leverancier die zijn eigen cijfers publiceert, dus enige voorzichtigheid met de percentages is op zijn plaats, maar de richting sluit aan bij wat je ook ziet bij grote integrators als IBM: het gesprek verschuift van modelkeuze naar wat een euro aan inferentie oplevert.
