Google claimt 2,6 procent foutmarge met Gemini 3.5 Transcribe
3 mins read

Google claimt 2,6 procent foutmarge met Gemini 3.5 Transcribe

Google heeft Gemini 3.5 Transcribe uitgebracht, een spraak-naar-tekstmodel dat volgens het bedrijf een gemiddelde woordfoutmarge van 2,6 procent haalt op vooraf opgenomen audio. Voor realtime streaming ligt dat cijfer op 4,0 procent. Het model staat in public preview via Google AI Studio en het Gemini Enterprise Agent Platform, meldt Google op zijn eigen blog.

Twee endpoints, twee sets beperkingen

De release valt uiteen in twee losse endpoints, en dat verschil bepaalt wat je ermee kunt. Het endpoint gemini-3.5-transcribe verwerkt complete audiobestanden in één verzoek via de Interactions API. Daar krijg je sprekerherkenning en tijdstempels per woord bij. Het tweede endpoint, gemini-3.5-transcribe-live, draait via de Live API en levert transcriptie terwijl iemand nog aan het praten is, met latentie onder een seconde.

Die snelheid kost wat. De live-variant laat sprekerherkenning en woord-tijdstempels vallen. Wie een notulist bouwt die achteraf moet kunnen aangeven wie wat zei, zit dus vast aan de batch-route. Google spreekt van een verbetering van 70 procent in transcriptietijd ten opzichte van voorganger Chirp 3.

Drie collega's overleggen aan een tafel met een smartphone die de vergadering opneemt

Wat het model met rommelige spraak doet

Google legt de nadruk op spraak zoals mensen die echt produceren. Het model haalt stopwoorden weg, verwerkt zelfcorrecties (iemand die halverwege een zin van gedachten verandert) en formatteert de tekst automatisch. Het detecteert naar eigen zeggen meer dan 85 talen en kan midden in een gesprek van taal wisselen. Sprekerherkenning werkt tot drie personen; daarboven noemt Google het experimenteel.

Verder kun je een eigen woordenlijst meegeven, handig voor vakjargon, productnamen of eigennamen die een generiek model steevast verkeerd hoort. Op de FLEURS-benchmark rapporteert Google 5,04 procent foutmarge non-streaming en 5,50 procent streaming voor een selectie talen, hoger dus dan de gemiddeldes die het bedrijf zelf meet.

Waar het al draait

Het model zit volgens 9to5Google al onder Rambler in Gboard op Android, in de Gemini-app voor macOS en in de promptbalk van Google Antigravity. Chrome volgt later. Voor bedrijven staat het in preview op het Gemini Enterprise Agent Platform, dat Google eerder deze maand ook bij advocatenkantoren binnenbracht. De variant voor Gemini Enterprise for Customer Experience, gericht op klantcontact, is aangekondigd maar nog niet beschikbaar.

Dat laatste spoor is waar het geld zit. Callcenters, klantenservice en zorgadministratie draaien op spraak, en een foutmarge van enkele procenten scheelt daar direct in nabewerking. Google positioneert Gemini 3.5 Transcribe niet als los product maar als bouwsteen voor de agenten die bedrijven nu massaal uitrollen.

Wat betekent dit

Spraakherkenning was jarenlang een aparte hoek van de markt, met eigen aanbieders en eigen prijslijsten. Google trekt die functie nu de Gemini-stack in, net zoals het Gemini lokaal op de Pixel 11 liet draaien. Voor ontwikkelaars betekent dat één API minder om te beheren, en voor bestaande transcriptiediensten een concurrent met diepe zakken.

Twee kanttekeningen. De cijfers komen van Google zelf en zijn nog niet onafhankelijk nagemeten; het gat tussen de gerapporteerde gemiddeldes en de FLEURS-scores laat zien hoeveel de gekozen testset uitmaakt. En public preview is geen productiestatus: voorwaarden, prijzen en limieten kunnen nog schuiven. Wie audio van klanten of patiënten door zo’n dienst haalt, loopt bovendien tegen dezelfde vragen aan die eerder speelden bij het datalek bij AI-notulist tl;dv, waar bijna 182.000 vergaderingen op straat kwamen te liggen. Goede transcriptie is één ding, weten waar de opname belandt een ander.