Tavus: Griffin laat helft van testers in de maling lopen
Tavus, een Amerikaans bedrijf dat videoavatars maakt, heeft een model gepresenteerd dat volgens het bedrijf de Turingtest voor video heeft gehaald. In een eigen onderzoek dacht 48 procent van de deelnemers aan de lijn te hebben met een echt mens. De claim is stevig, de testopzet is dat minder.
Wat Tavus heeft gebouwd
Het model heet Griffin en Tavus noemt het een Human Interaction Model. Volgens de productpagina van Tavus werkt Griffin full-duplex: het model luistert, bepaalt wanneer het iets zegt en genereert spraak en video tegelijk. Eerdere avatars werken met een keten van losse onderdelen, eerst spraakherkenning, dan een taalmodel, dan spraaksynthese en dan pas het beeld. Griffin doet dat in één model en kijkt een paar keer per seconde opnieuw naar het gesprek. Daardoor kan het knikken terwijl jij nog praat, ophouden als je het onderbreekt en reageren op wat het via je camera ziet.
Wie het gesprek van Google over een pratend gezicht voor Gemini Live heeft gevolgd, herkent de richting. Het verschil is dat Tavus de hele keten in één model wil stoppen.

Wat de test laat zien
Tavus liet 54 mensen een videogesprek van een minuut voeren. Daarna kregen ze de vraag of ze dachten dat hun gesprekspartner geen mens was. Van de 54 deelnemers hielden 26 Griffin voor een echt persoon, schrijft tech-ish. De vorige combinatie van Tavus (Phoenix-4.5, Sparrow-2 en Raven-1) haalde 1 van de 41, ongeveer 2,4 procent. Op de VideoFDB-benchmark van NVIDIA, gescoord in september, staat Griffin volgens Tavus eerste op beide onderdelen van 15 modellen. Op generatie haalt het 3,83, tegenover 3,92 voor een mens en 2,80 voor het beste andere systeem.
Er zit een kanttekening aan. ID.nl wijst erop dat de test niet de klassieke Turingopzet volgt, waarbij een derde een gesprek beoordeelt. Het ging om een korte call, met deelnemers die dachten met een mens te bellen, en de resultaten komen van Tavus zelf. Een score van 48 procent zegt dus vooral dat een minuut genoeg is om veel mensen te misleiden. Over een gesprek van een halfuur is niets gemeten.
Nog niet te gebruiken
De cijfers komen van Griffin-Lite, een onderzoekspreview voor geselecteerde testers. Het is geen product voor klanten van Tavus. Volgens ID.nl hangt een bredere release af van aanvullende veiligheidstests.
Dat is begrijpelijk, want dit soort technologie raakt aan fraude. Een nepcollega of nepbankmedewerker die live meekijkt en terugpraat, is lastiger te ontmaskeren dan een gefaalde deepfake in een opgenomen filmpje. Onderzoekers werken aan tegenmiddelen, zoals de optische chip die vijftien deepfakes tegelijk herkent. Aan de bedrijfskant is er het gebruik dat Tavus zelf voor ogen heeft, zoals klantenservice en training. Hoe dat in de praktijk uitpakt, zagen we al bij Gemini dat bedrijven zelf belt en bij Microsofts spraakmodellen voor realtime voice agents.
Wat betekent dit
Een videogesprek was tot nu toe een redelijk bewijs dat je met een mens praat. Griffin laat zien dat die zekerheid verdwijnt, ook al is het model nog niet vrij beschikbaar. Voor organisaties betekent dat: spreek af hoe je bij een gevoelig verzoek via video, zoals een betaalopdracht, een tweede kanaal gebruikt om iemands identiteit te controleren. Wie klanten met een avatar te woord laat staan, doet er goed aan te melden dat het een AI is. De cijfers van Tavus zijn bovendien zelf aangeleverd, dus een onafhankelijke herhaling van de test blijft nodig.
