Google lanceert Gemini 3.8 Live voor spraakgesprekken
Google heeft op 15 september twee nieuwe spraakmodellen uitgebracht: Gemini 3.8 Live en Gemini 3.8 Live Extended Thinking. Het eerste model is gebouwd voor schaal en lage kosten, het tweede voor gesprekken waarin de assistent echt moet nadenken. Beide modellen kunnen tijdens een gesprek meekijken via de camera en ondertussen taken uitvoeren, zo schrijven Tom Ouyang en Malini Jaganathan van het Gemini-audioteam op de blog van Google.
Het is de tweede 3.8-release in twee weken. Begin september verscheen al Gemini 3.8 Flash, dat zich op programmeerwerk richt.
Twee varianten met een eigen taak
Gemini 3.8 Live is het werkpaard. Google positioneert het als model voor bedrijven die veel gesprekken tegelijk willen afhandelen zonder dat de rekening oploopt. De Extended Thinking-variant redeneert in meerdere stappen en doet dat terwijl het praat. In plaats van een stilte te laten vallen, geeft het model hoorbaar aan dat het ergens mee bezig is.
Beide versies herkennen 97 talen en schakelen automatisch als een gebruiker halverwege een zin van taal wisselt. Ze kunnen op de achtergrond tools en API’s aanroepen, zodat het gesprek doorloopt terwijl er bijvoorbeeld een afspraak wordt opgezocht. Volgens Unite.AI verwerken de modellen audio als 16-bit PCM, met 16 kHz aan de invoerkant en 24 kHz bij de uitvoer.

Wat de benchmarks laten zien
Google publiceert zelf een reeks scores. Extended Thinking haalt 82,6 op de Speech to Speech Quality Index van Artificial Analysis, goed voor de eerste plek. Op τ-Voice, een test voor agentische taken via spraak, scoort het model 68,6 procent. Op de strengere bankvariant van Sierra komt het niet verder dan 35,1 procent. Op Big Bench Audio noteert Google 97,7 procent. Unite.AI meldt dat de gewone Live-versie tweede staat in de Speech Agent Arena van Artificial Analysis.
Wie een klantenservice wil automatiseren, moet vooral naar dat bankcijfer kijken. Een op de drie bankgesprekken correct afronden is een stuk minder dan de kwaliteitsscores doen vermoeden. Uit onze eerdere dekking van frontier-modellen op echte bedrijfscode bleek al dat labscores in de praktijk vaak lager uitvallen.
Waar het model opduikt
Ontwikkelaars kunnen vanaf vandaag aan de slag via de Gemini API en Google AI Studio. Voor bedrijven draait een private preview in Gemini Enterprise. Consumenten merken het in Search Live en Gemini Live. Extended Thinking is beschikbaar voor Pro- en Ultra-abonnees. Google noemt Salesforce, ServiceNow en Genspark als partners. Alle gegenereerde audio krijgt een SynthID-watermerk, zodat nepopnames herkenbaar blijven.
De concurrentie zit niet stil. OpenAI liet ChatGPT met GPT-Live tegelijk luisteren en praten, en Microsoft test met MAI-Realtime een stem die meepraat.
Wat betekent dit
Spraak wordt een volwaardige interface voor agenten. Een assistent die kan kijken, praten en tegelijk een systeem bevragen, maakt telefonische klantenservice en hands-free werk realistischer. Voor Nederlandse bedrijven is de automatische taalwissel interessant, zeker in klantcontact met internationale klanten. Kijk wel verder dan de koptekst: 35 procent op een bankbenchmark betekent dat een mens voorlopig moet kunnen ingrijpen. En wie nog bijhoudt welk model waarvoor dient, herkent het probleem uit ons stuk over model fatigue bij bedrijven. Meer achtergrond over de modellenreeks staat op onze pagina over Gemini 3.8 Flash.
