Tavus Griffin: AI-avatar misleidt 48% in gesprek van minuut

Tavus Griffin: AI-avatar misleidt 48% in gesprek van minuut

Tavus, een startup uit San Francisco, wil dat zijn AI een gesprek van aangezicht tot aangezicht zo goed kan voeren dat je niet doorhebt dat je met een machine praat. Met het nieuwe model Griffin komt het bedrijf daar dichter bij dan ooit. In een eigen onderzoek van Tavus was bijna de helft van de deelnemers na een videogesprek van een minuut ervan overtuigd dat ze met een mens hadden gesproken.

Wat Griffin is

Tavus noemt Griffin het eerste "Human Interaction Model", kortweg HIM. Die term staat voor een soort model dat gesprekken van aangezicht tot aangezicht in realtime moet begrijpen en voeren. Het is bedoeld om meer te doen dan tekst of een pratend hoofd genereren.

Griffin verwerkt meer dan woorden. Het model analyseert spraak, gezichtsuitdrukkingen, stemklank, gebaren en pauzes. Dat doet het terwijl het video van de gesprekspartner binnenkrijgt en zelf video als antwoord genereert. Die wisselwerking in twee richtingen is de kern van het idee. Het model moet de persoon aan de andere kant van de camera lezen en op die persoon reageren, en niet alleen een antwoord opdreunen.

De cijfers

Tavus meldt twee soorten resultaten.

  1. De test met een gesprek van een minuut. In een onderzoek van Tavus dacht 48 procent van de deelnemers na een videogesprek van een minuut dat Griffin een echt persoon was. Volgens het bedrijf kwamen eerdere systemen niet verder dan twee procent.

  2. De evaluatie van Nvidia. Tavus omschrijft dit als een onafhankelijke test van Nvidia die meet hoe menselijk een AI overkomt in een direct gesprek met beeld en geluid. Griffin scoorde 3,83 punten. Echte mensen scoorden 3,92. Het vorige beste AI-model haalde 2,80.

Beide resultaten wijzen dezelfde kant op. Op de Nvidia-meting zit Griffin 0,09 punt onder echte mensen en meer dan een vol punt boven het vorige beste model. In het belonderzoek is de sprong van twee naar 48 procent het soort verschuiving dat verandert wat een product kan, en niet alleen waar het in een grafiek uitkomt.

Er zijn wel kanttekeningen. Het cijfer van 48 procent komt uit Tavus' eigen onderzoek. Dat de Nvidia-test onafhankelijk is, zegt Tavus zelf. En het gesprek duurde een minuut. Korte gesprekken verbergen veel. Of de illusie standhoudt na tien of dertig minuten is een andere vraag, en het beschikbare materiaal geeft daar geen antwoord op. Tavus heeft meer details gepubliceerd in zijn onderzoeksrapport.

Voorlopig beperkte toegang

Griffin is niet breed beschikbaar. Een voorlopige versie, Griffin-Lite, staat open voor "geselecteerde testers als onderzoekspreview". Volgens Tavus volgt een krachtigere versie zodra "de veiligheidszorgen zijn aangepakt".

Die formulering valt op. Het bedrijf koppelt de lancering van zijn sterkere model openlijk aan onopgeloste veiligheidskwesties. Dat doet vermoeden dat het een reëel risico ziet in een systeem dat mensen ongeveer de helft van de tijd voor een mens aanzien.

De toepassingen die Tavus noemt, zijn praktisch:

  • Bijles
  • Moeilijke gesprekken oefenen
  • Technische ondersteuning via de camera

Bij elk van deze toepassingen heb je baat bij een gesprekspartner die je kan zien, je toon hoort en merkt wanneer je aarzelt. Een bijlesdocent die verwarring op het gezicht van een leerling opmerkt, of een helpdeskmedewerker die kan meekijken met waar de gebruiker de camera op richt, heeft precies het soort multimodale waarneming nodig waarvoor Griffin is ontworpen. Ook een lastig gesprek oefenen werkt beter als de ander reageert op je gezichtsuitdrukking en niet alleen op je woorden.

Wie erachter zit

Tavus werd opgericht in 2020 en haalde ongeveer 64 miljoen dollar op. Het bedrijf begon met gepersonaliseerde AI-video's voor sales en marketing. Daarna breidde het uit naar live videogesprekken met digitale persona's. Griffin is de volgende stap op die weg: van vooraf gerenderde clips, via live avatars, naar een model dat moet communiceren zoals een mens.

Het grotere geheel

Dit wijst erop dat realtime conversationele AI verder gaat dan spraak en het volledige gesprek van aangezicht tot aangezicht betreedt. Tot nu toe was spraak het belangrijkste strijdtoneel, met producten zoals streaming transcriptie voor spraakagents en grote belangstelling van investeerders voor spraak-AI-bedrijven zoals ElevenLabs. Griffin trekt hetzelfde idee door naar video, waar gezichtsuitdrukking, gebaren en timing allemaal betekenis dragen.

Voor lezers is het voordeel vrij duidelijk: natuurlijkere bijles, coaching en ondersteuning. Het nadeel is het cijfer van 48 procent zelf. Een systeem dat de helft van de mensen na een minuut voor een mens houdt, roept voor de hand liggende vragen op over transparantie en mogelijk misbruik. Die vragen komen op een moment dat toezichthouders AI-ontwikkelaars al kritischer onder de loep nemen, zoals blijkt uit het FTC-onderzoek naar AI-labs.

Drie dingen zijn het volgen waard. Ten eerste welke "veiligheidszorgen" Tavus benoemt voor de volledige lancering, en hoe het bedrijf zegt die te hebben aangepakt. Ten tweede of het zich ertoe verbindt gebruikers duidelijk te laten weten dat ze met een AI praten. Ten derde of externe onderzoekers de resultaten kunnen herhalen, vooral bij gesprekken die langer duren dan een minuut.