Alibaba en Google verlagen prijs van AI-stemmen fors
3 mins read

Alibaba en Google verlagen prijs van AI-stemmen fors

Op dezelfde dag, 23 september, kwamen Alibaba en Google met nieuwe spraakmodellen naar buiten. Alibaba verlaagde de prijzen van zijn Qwen-Audio-serie met tientallen procenten, Google zette twee nieuwe Gemini-stemmodellen in de API. Voor wie audio in een product wil bouwen, verschuift daarmee het rekensommetje opnieuw.

Qwen-Audio-3.1 gaat tot 95 procent omlaag

Alibaba’s Qwen-team bracht Qwen-Audio-3.1 uit, een pakket van vijf modellen: spraakherkenning (ASR), spraaksynthese (TTS), realtime conversatie en twee nieuwkomers, TTS-Next voor audiocreatie en ASR-Next voor audiobegrip. Volgens The Decoder gaan de tarieven flink omlaag: ongeveer 70 procent voor TTS, rond 85 procent voor de realtime-variant en tot 95 procent voor spraakherkenning. Qwen kondigde de reeks zelf aan op X als een complete audiostack, van herkenning tot generatie.

Die richting kennen we inmiddels. Microsoft zette eerder dit jaar MAI-Transcribe-2 op tien cent per audio-uur en Meta claimde de koppositie in realtime spraakherkenning. Transcriptie is in korte tijd van specialistische dienst naar bulkgoed gegaan.

Ontwikkelaar met koptelefoon bekijkt geluidsgolven op een beeldscherm

Google mikt op stemmen die je zelf ontwerpt

Google lanceerde Gemini 3.8 Flash TTS en een goedkopere Flash-Lite-versie, beide direct beschikbaar in de Gemini API en AI Studio. Het opvallendste is de manier van stembesturing: je beschrijft in tekst wat voor stem je wilt, inclusief rol, accent en klankkleur, in ruim honderd talen en dialecten, en je bewaart het resultaat voor hergebruik. Daarnaast staan er meer dan 2.000 kant-en-klare stemmen klaar. Het model kan ook een stemprofiel nabouwen uit een opname van dertig seconden, waarvoor toestemming van de spreker vereist is.

Volgens de aankondiging van Google kost Flash TTS tot en met 31 december 0,50 dollar per miljoen tekstinvoertokens en 9 dollar per miljoen audio-uitvoertokens. Op 1 januari 2027 verdubbelen die tarieven naar 1 en 18 dollar. Flash-Lite TTS staat tot het einde van het jaar op 0,54 dollar per uur gegenereerde audio. Elke clip krijgt een SynthID-watermerk en C2PA-herkomstgegevens mee.

Het watermerk is geen bijzaak

Dat laatste punt verdient aandacht. Stemklonen uit een half minuutje audio is technisch al langer mogelijk, maar het wordt nu een standaardfunctie in een API waar iedere ontwikkelaar bij kan. Watermerken en herkomstlabels zijn de enige praktische rem die aanbieders zelf inbouwen. In de muziekwereld lopen de conflicten hierover al langer, zie de licentieafspraak tussen Universal Music en ElevenLabs.

Wat betekent dit

Voor Nederlandse bedrijven met een klantenservice, een podcast of een interne kennisbank verdwijnt de prijs als argument om audio-AI uit te stellen. Een uur transcriberen kost minder dan een kop koffie, en een voorleesstem laten maken is niet langer een apart project. De aandacht verschuift naar de vragen die er wel toe doen: mag je de stem die je gebruikt, kloppen de transcripties in vaktaal, en waar blijven de opnames. Die laatste vraag wordt in Nederland concreter nu Alibaba Cloud in oktober een datacenter in Nederland opent. Ook ChatGPT Voice haakte deze week aan op werkdata, wat laat zien hoe snel spraak van gimmick naar werkinterface schuift.