OpenAI laat GPT-5.6 eigen GPU-kernels optimaliseren
3 mins read

OpenAI laat GPT-5.6 eigen GPU-kernels optimaliseren

OpenAI heeft een opvallende reden gegeven voor de recente prijsverlagingen: het bedrijf zette zijn eigen model aan het werk om de infrastructuur sneller te maken. Volgens OpenAI heeft GPT-5.6 Sol delen van de eigen inferentiestack herschreven, wat de kosten om het model te draaien met ongeveer 20 procent verlaagde.

Wat OpenAI zegt te hebben gedaan

In de aankondiging schrijft OpenAI dat GPT-5.6 Sol “autonoom onze productie-kernels heeft herschreven en geoptimaliseerd”. Die kernels zijn de laag software die bepaalt hoe berekeningen over de GPU’s worden verdeeld. Het model werkte daarbij in Triton en Gluon, twee programmeertalen voor GPU-code, en zocht naar werk dat vooraf berekend, overgeslagen of parallel uitgevoerd kon worden. Het resultaat is volgens OpenAI een daling van 20 procent in de totale kosten per verwerkte aanvraag voor GPT-5.6 Sol.

Naast de kernels noemt OpenAI nog twee aanpassingen. De techniek speculative decoding, waarbij een klein hulpmodel alvast tokens voorspelt, werd verbeterd, en ook de afhandeling van de KV-cache en de verdeling van GPU-taken zijn aangepast. Bij elkaar zou dat de snelheid waarmee tokens worden gegenereerd met zo’n 15 procent hebben opgevoerd. Meer aanvragen op dezelfde hardware betekent een lagere kostprijs per token.

Rijen serverracks met blauwe ledlampjes in een modern datacenter

Waarom de prijzen konden zakken

De besparing landt direct bij ontwikkelaars. OpenAI verlaagde de prijs van het lichte model Luna naar 20 dollarcent per miljoen invoertokens en 1,20 dollar per miljoen uitvoertokens, een daling van tot 80 procent. Het middenmodel Terra werd 20 procent goedkoper. Die stap past in de bredere prijzenoorlog rond GPT-5.6, waarin de kosten voor het draaien van AI in hoog tempo dalen.

Ontwikkelaar en blogger Simon Willison rekende voor dat Luna daarmee ongeveer een vijfde kost van Anthropic Claude Haiku 4.5 voor invoertokens. Hij verplaatste naar eigen zeggen zijn demo agent.datasette.io van Gemini naar Luna. De druk komt van meerdere kanten, want ook de goedkope modellen van DeepSeek zetten de tarieven onder druk, en concurrenten zoals Anthropic voelen dezelfde beweging.

Een model dat aan zijn eigen fundering sleutelt

Het idee dat een AI-model helpt om zichzelf goedkoper te draaien roept vragen op. Een systeem dat eigen productiecode aanpast, vraagt om strakke controle en menselijke toetsing voordat die code live gaat. OpenAI geeft geen inzage in hoeveel van het werk uiteindelijk door engineers is nagekeken of bijgesteld. De cijfers van 20 en 15 procent komen bovendien van het bedrijf zelf en zijn niet onafhankelijk geverifieerd. Techsite The New Stack plaatste dan ook kanttekeningen bij de vraag hoe autonoom het proces werkelijk was.

Wat betekent dit

Voor wie AI inbouwt in producten telt vooral de uitkomst: draaien op grote schaal wordt goedkoper, en toepassingen die eerder te duur waren komen binnen bereik. Tegelijk laat OpenAI zien dat efficiëntiewinst zelf een wapen wordt in de concurrentiestrijd, los van nieuwe modellen of grotere datacenters. Wie de kosten het snelst omlaag krijgt, kan de prijzen blijven verlagen zonder verlies te draaien. Dat verklaart mede waarom OpenAI zijn positie zo stevig neerzet, ook met het oog op de aangekondigde beursgang. De keerzijde is dat modellen die aan hun eigen fundering sleutelen om extra toezicht vragen.