Meta pakt koppositie in realtime spraakherkenning
3 mins read

Meta pakt koppositie in realtime spraakherkenning

Meta Superintelligence Labs bracht dinsdag Muse Voice Transcribe uit, het eerste realtime audiomodel van die afdeling. Meetbureau Artificial Analysis zet het model meteen bovenaan zijn streaming-ranglijst voor spraak naar tekst, met een woordfoutpercentage van 3,1 procent. Mark Zuckerberg kondigde de release aan op X, Meta AI Research publiceerde tegelijk een technische toelichting.

Een model dat luistert en tegelijk beslist

Volgens de blogpost van Meta AI Research knipt Muse Voice Transcribe binnenkomende audio in stukjes van 80 milliseconden. Die worden omgezet naar tokens, waarna het model per stap kiest: nu al tekst produceren, of nog even doorluisteren. Meta trainde die afweging met reinforcement learning, zodat de vertraging per woord meebeweegt met hoe zeker het model is. Het eindtranscript staat er gemiddeld 0,16 seconde na het einde van de spraak.

Drie taken zitten in hetzelfde model in plaats van in een keten van losse componenten: streaming transcriptie, sprekerherkenning en het detecteren van begin en einde van spraak. Meta claimt diarisatie bij meer dan twintig sprekers, ondersteuning van opnames langer dan een uur en het soepel wisselen van taal binnen een zin. Het model is getraind op ruim zeventig talen, waarvan er 25 uitgebreid zijn getest. Wie met vaktermen of eigennamen werkt kan die vooraf meegeven, zodat het model er rekening mee houdt.

Drie collega's in gesprek rond een vergadertafel met een laptop

Nipt voor op de concurrentie

Op de streaming-test van Artificial Analysis staat Meta met 3,1 procent voor op Cartesia Ink-2 (3,4 procent), Scribe v2 Realtime van ElevenLabs (3,6 procent), GPT Live Transcribe (3,9 procent) en Gemini 3.5 Transcribe Live (4 procent). De marges zijn klein. Google claimde eind augustus nog 2,6 procent foutmarge voor Gemini 3.5 Transcribe, maar dat cijfer komt van een andere meting dan de streaming-variant die Artificial Analysis hier vergelijkt. Op sprekerherkenning noteert het meetbureau voor Meta een gemiddelde diarisatiefout van 17,5 procent, ook de beste score in het overzicht.

De richting is bekend. OpenAI maakte zijn realtime spraakmodel eerder dit jaar sneller en goedkoper, en Google schoof zijn transcriptiemodel in augustus naar voren. Het verschil zit inmiddels minder in wie het beste luistert en meer in wie de laagste vertraging haalt tegen welke prijs.

Waar je het kunt gebruiken

Muse Voice Transcribe draait via de Meta Model API, in Meta AI voor Mac en in Muse Code. 9to5Mac meldt dat de Mac-app dictaat in vrijwel elke applicatie mogelijk maakt, dus niet alleen binnen Meta’s eigen software. Een prijs noemt Meta in de aankondiging niet; Artificial Analysis komt uit op 0,18 dollar per uur audio, omgerekend 3 dollar per duizend minuten. Voor Meta past het in een bredere beweging naar producten voor eindgebruikers, na eerder werk zoals de agent Hatch voor WhatsApp.

Wat betekent dit

Voor notuleren, klantenservice en live ondertiteling zakt de drempel verder. Tegen 18 dollarcent per uur kost het transcriberen van een werkweek aan vergaderingen minder dan een lunch. De beperking zit in de talen: Meta test er 25 grondig en zegt niet welke. Wie Nederlands zakelijk wil inzetten, doet er goed aan zelf een uur eigen materiaal door het model te halen voordat de conclusie getrokken wordt.

En er blijft een tweede vraag. Transcriptie betekent dat gesprekken ergens worden opgeslagen. Het datalek bij AI-notulist tl;dv, waarbij 181.874 vergaderingen op straat kwamen, liet zien wat er dan misgaat. Goedkoper transcriberen maakt die afweging niet kleiner, alleen vaker relevant.