Microsoft lanceert spraakmodellen voor realtime voice agents
Microsoft AI heeft drie nieuwe spraakmodellen uitgebracht die bedoeld zijn voor voice agents: software die live met mensen praat, bijvoorbeeld aan de telefoon bij een klantenservice. Het gaat om MAI-Transcribe-2-Streaming, MAI-Voice-2.1 en de snellere variant MAI-Voice-2.1-Flash. Microsoft maakte de modellen op 1 oktober bekend in een eigen blogpost.
Transcriptie terwijl iemand nog praat
Het opvallendste model is MAI-Transcribe-2-Streaming. Waar veel spraakherkenning wacht tot iemand is uitgesproken, zet dit model spraak doorlopend om in tekst. Volgens Microsoft verschijnt na ongeveer 100 milliseconden een eerste voorlopige transcriptie, die het model bijwerkt naarmate er meer context binnenkomt. Woorden komen volgens het bedrijf twee keer zo snel op het scherm als bij de dichtstbijzijnde concurrent.
Het model ondersteunt 60 talen en herkent automatisch welke taal er gesproken wordt, ook als iemand halverwege wisselt. Op de AA-WER Streaming-ranglijst van benchmarkbureau Artificial Analysis staat het model op de eerste plaats van 38 modellen, zowel voor de eerste voorlopige als de definitieve transcriptie. Volgens RuntimeWire haalt het een woordfoutpercentage van 2,5 procent, 0,13 seconden nadat de spreker is gestopt.
De introductieprijs is 0,54 dollar per uur audio. Dat tarief geldt tot het einde van dit jaar.

Twee stemmodellen met stemklonen
Voor de andere kant van het gesprek, het terugpraten, heeft Microsoft MAI-Voice-2.1. Dit tekst-naar-spraakmodel werkt in 23 talen verdeeld over 26 locales en houdt volgens Microsoft in elke taal het eigen accent van de stem vast. Een stem klonen kan op basis van enkele seconden referentie-audio. Microsoft zegt dat er ingebouwde toestemmingscontroles zijn om misbruik te voorkomen. Hoe die precies werken, staat niet in de aankondiging.
De Flash-variant is gemaakt voor toepassingen waar snelheid en prijs zwaarder wegen dan klankkwaliteit. Volgens Microsoft genereert dat model 45 seconden audio met een vertraging van 150 milliseconden. De prijzen: 22 dollar per miljoen tekens voor MAI-Voice-2.1 en 15 dollar voor de Flash-versie. The Decoder meldt dat in een test van Microsoft ongeveer de helft van 4.000 deelnemers dacht dat de gekloonde stemmen van echte mensen waren.
De modellen zijn beschikbaar via Microsoft Foundry, de MAI Playground, OpenRouter, Vercel en Azure Voice Live. Ondersteuning in LiveKit volgt later. Of Nederlands bij de 23 talen van de stemmodellen hoort, maakt Microsoft in de aankondiging niet duidelijk.
Wat betekent dit
De markt voor AI-stemmen is druk. ElevenLabs bracht vorige week nog een nieuw stemmodel voor ruim 90 talen uit en zag zijn waardering verdubbelen naar 22 miljard dollar. Alibaba en Google verlaagden eerder de prijs van hun AI-stemmen. Microsoft concurreert hier vooral op snelheid: een voice agent die al meeluistert terwijl iemand praat, kan sneller antwoorden en voelt minder als een computer.
Voor bedrijven die een AI-telefoonassistent overwegen, worden de bouwstenen dus goedkoper. Tegelijk wordt het lastiger om een echte stem van een nagemaakte te onderscheiden, zeker nu de helft van de testpersonen zich al vergist. Dat maakt werk aan deepfake-detectie belangrijker. Wie zelf met agents werkt, kan ook kijken naar de always-on agents die OpenAI deze week lanceerde.
