OpenAI maakt realtime-spraak-AI sneller en goedkoper
2 mins read

OpenAI maakt realtime-spraak-AI sneller en goedkoper

OpenAI heeft twee nieuwe spraakmodellen naar de Realtime API gebracht: gpt-realtime-2.1 en een kleinere variant, gpt-realtime-2.1-mini. Volgens de release notes van OpenAI en een analyse van MarkTechPost (6 juli 2026) draait het vooral om lagere vertraging en scherpere prijzen voor ontwikkelaars die voice-agents bouwen.

Snellere reacties en betere spraakherkenning

De grootste winst zit in snelheid. OpenAI zegt de p95-latency van zijn realtime-spraakmodellen met minstens 25 procent te hebben verlaagd, vooral door slimmere caching. Dat verschil merk je in een gesprek: hoe korter de stilte tussen vraag en antwoord, hoe natuurlijker een spraakassistent aanvoelt.

Naast snelheid noemt OpenAI verbeteringen in het herkennen van cijfer- en lettercombinaties (denk aan een postcode of ordernummer), betere omgang met stiltes en achtergrondgeluid, en netter gedrag bij onderbrekingen. gpt-realtime-2.1 ondersteunt spraak-naar-spraak met instelbare reasoning-effort, functieaanroepen en tool-gebruik, waardoor complexere gespreksflows mogelijk worden. Eerder zette OpenAI zijn GPT-Realtime-Translate op de pricingpagina, en deze update bouwt op diezelfde lijn voort.

Wat het kost

De prijzen laten zien waar OpenAI de scheidslijn trekt. Voor gpt-realtime-2.1 rekent het bedrijf 32 dollar per miljoen audio-inputtokens en 64 dollar per miljoen audio-outputtokens, plus 4 dollar per miljoen tekst-inputtokens. De mini-variant blijft op het oude mini-tarief zitten (10 dollar audio-input, 20 dollar audio-output, 0,60 dollar tekst-input) maar krijgt er wel reasoning bij. Dat komt neer op ongeveer drie keer lagere kosten voor audio-output.

Die splitsing past bij een bredere beweging in de markt. Bedrijven kijken steeds strenger naar hun tokenrekening, iets wat we ook zagen toen de tokenmaxxing-fase voorbij leek en er goedkopere modellen opdoken. Ook GLM-5.2 uit China zet druk op de prijzen. En met de discussie rond tokenizers en verborgen kosten weten inkopers dat het bruto-tarief niet het hele verhaal is.

Concurrentie op stem

OpenAI is niet de enige die inzet op realtime spraak. Google zette met Gemini 3.5 Live Translate in op spraak-naar-spraak vertalen op Android. De strijd verschuift daarmee van pure tekstprestaties naar hoe vloeiend en betaalbaar een assistent kan praten en luisteren.

Wat betekent dit

Voor wie een klantenservicebot, telefonie-agent of voice-app bouwt, wordt de keuze concreter. De volle 2.1 is er voor gesprekken waar redeneren en nauwkeurigheid tellen, de mini voor snelle, goedkopere interacties op schaal. De prijs voor spraak blijft flink hoger dan voor tekst, dus de rekening loopt op zodra er veel wordt gepraat. De belofte van 25 procent minder vertraging is vooral goed nieuws voor de gebruikerservaring: een agent die niet hapert, voelt eerder als een gesprek dan als een menu.