ElevenLabs v4 spreekt ruim 90 talen en kloont in 10 seconden
ElevenLabs heeft maandag 28 september twee nieuwe spraakmodellen uitgebracht: Eleven v4 en Eleven v4 Turbo. Het Londense bedrijf breidt het aantal ondersteunde talen uit van 70 naar ruim 90 en belooft meer controle over hoe een zin klinkt. Voor stemklonen is nog maar tien seconden audio nodig.
Wat is er nieuw in Eleven v4
Volgens TechCrunch kijkt v4 naar de omliggende tekst om de toon van een zin te bepalen. Eerdere modellen behandelden elke regel meer als een losse opname. De inline tags die ElevenLabs met v3 introduceerde zijn uitgebreid: gebruikers kunnen nu meerdere tags achter elkaar stapelen, en het model volgt die volgorde. Op de productpagina van ElevenLabs staan voorbeelden als [laughs], [whispers] en zelfs geluidseffecten als [door slams].
De grootste kwaliteitswinst zit volgens het bedrijf in het Japans, Braziliaans-Portugees, Mandarijn en Kantonees. Nederlands wordt op de productpagina niet apart genoemd. Een stem die in de ene taal is opgenomen, kan in een andere taal spreken met behoud van de identiteit van de spreker en een natuurlijk accent. Wie dat met een bestaande stem wil doen, heeft volgens ElevenLabs wel aantoonbare toestemming van de eigenaar nodig. Die eis staat niet voor niets in de voorwaarden: Britse acteurs eisen al een wet tegen stemklonen.
v4 Turbo is gebouwd voor klantgesprekken

De Turbo-variant levert iets in op geluidskwaliteit en wint snelheid terug. ElevenLabs meldt in een blogpost een mediane latency van ongeveer 100 milliseconden, met zo’n 150 milliseconden tot het eerste gesproken woord. Het model kan al beginnen met praten terwijl het onderliggende taalmodel zijn antwoord nog schrijft. Een beller kan halverwege het gesprek van taal wisselen, en via een uitspraakwoordenboek leer je het model merknamen of medicijnnamen correct uitspreken.
Het bedrijf claimt dat v4 Turbo in september op de eerste plaats stond bij benchmarkpartij Artificial Analysis en in blinde tests in ongeveer 75 procent van de gevallen de voorkeur kreeg boven concurrerende modellen. Dat zijn cijfers van ElevenLabs zelf. Onafhankelijke metingen zullen moeten uitwijzen of ze standhouden.
Prijsdruk in de stemmenmarkt
De lancering komt op een moment dat spraak snel goedkoper wordt. Vorige week verlaagden Alibaba en Google de prijs van hun AI-stemmen fors, en Microsoft zette eerder transcriptiemodel MAI-Transcribe-2 neer voor 10 cent per audio-uur. TechCrunch noemt verder Cartesia, Deepgram en Fish Audio als directe concurrenten.
ElevenLabs verandert niets aan zijn tarieven: de v4-modellen gebruiken hetzelfde creditsysteem als de bestaande modellen. Er is een gratis laag met 10.000 credits per maand, goed voor ongeveer tien minuten audio, en betaalde abonnementen beginnen bij 6 dollar per maand. Zakelijk gaat het het bedrijf voor de wind. Volgens TechCrunch ligt de jaaromzet op basis van de huidige run rate boven de 600 miljoen dollar, tegen zo’n 330 miljoen aan het begin van het jaar. Grote bedrijven leveren 55 procent van die omzet. Deze maand sloot ElevenLabs nog een deal met Universal Music over AI-remixes door fans.
Wat betekent dit
Voor Nederlandse bedrijven die een spraakassistent overwegen voor hun klantenservice, wordt de drempel lager. Een reactietijd van rond de 100 milliseconden voelt in een telefoongesprek bijna als een mens. Test wel zelf hoe het Nederlands klinkt, want ElevenLabs publiceert daar geen specifieke verbeteringen voor. En wie een stem kloont, moet de toestemming van de spreker goed vastleggen. Dat vraagt ElevenLabs, en onder de Europese privacyregels ligt het ook voor de hand.
