Tavus Griffin : un avatar IA trompe 48 % des appelants

Tavus Griffin : un avatar IA trompe 48 % des appelants

Tavus, une start-up de San Francisco, veut que son IA tienne une conversation en face à face de manière assez convaincante pour qu'on ne devine pas qu'il s'agit d'une machine. Son nouveau modèle, Griffin, est ce qui s'en approche le plus à ce jour. Dans une étude menée par Tavus elle-même, près de la moitié des participants ont terminé un appel vidéo d'une minute persuadés d'avoir parlé à un humain.

Ce qu'est Griffin

Tavus présente Griffin comme le premier "Human Interaction Model", ou HIM. Ce terme désigne une catégorie de modèles conçus pour comprendre et mener des conversations en face à face en temps réel. L'objectif va au-delà de la génération de texte ou d'une simple tête parlante.

Griffin ne se limite pas aux mots. Il traite la parole, les expressions du visage, le ton de la voix, les gestes et les silences. Il le fait tout en recevant la vidéo de son interlocuteur et en générant sa propre vidéo en réponse. Cette boucle à double sens est l'idée centrale. Le modèle est censé lire la personne de l'autre côté de la caméra et réagir à ce qu'il perçoit, pas seulement réciter une réponse.

Les chiffres

Tavus avance deux séries de résultats.

  1. Le test de l'appel d'une minute. Dans une étude de Tavus, 48 % des participants ont cru que Griffin était une vraie personne après un appel vidéo d'une minute. Selon l'entreprise, les systèmes précédents plafonnaient à 2 %.

  2. L'évaluation de Nvidia. Tavus la décrit comme un test indépendant de Nvidia qui mesure à quel point une IA paraît humaine dans une conversation audio-vidéo directe. Griffin a obtenu 3,83 points. De vrais humains ont obtenu 3,92. Le meilleur modèle d'IA précédent atteignait 2,80.

Les deux résultats vont dans le même sens. Sur la mesure de Nvidia, Griffin se situe à 0,09 point des humains et devance de plus d'un point le meilleur modèle précédent. Dans l'étude sur les appels, le bond de 2 % à 48 % est le genre de changement qui modifie ce qu'un produit peut faire, et pas seulement sa place sur un graphique.

Quelques réserves s'imposent. Le chiffre de 48 % provient de l'étude de Tavus elle-même. C'est Tavus qui qualifie le test de Nvidia d'indépendant. Et l'appel ne durait qu'une minute. Une conversation courte masque beaucoup de choses. Savoir si l'illusion tient sur dix ou trente minutes est une autre question, à laquelle les éléments disponibles ne répondent pas. Tavus a publié davantage de détails dans son rapport de recherche.

Un accès limité, pour l'instant

Griffin n'est pas largement disponible. Une version d'aperçu, Griffin-Lite, est ouverte à "certains testeurs sous forme d'aperçu de recherche". Tavus indique qu'une version plus performante suivra une fois que "les problèmes de sécurité auront été résolus".

Cette formulation attire l'attention. L'entreprise lie ouvertement la sortie de son modèle le plus puissant à des questions de sécurité non résolues. Cela laisse penser qu'elle voit un risque réel dans un système que les gens prennent pour un humain environ une fois sur deux.

Les usages cités par Tavus sont concrets :

  • Le soutien scolaire
  • L'entraînement aux conversations difficiles
  • L'assistance technique par caméra

Chacun de ces usages profite d'un interlocuteur capable de vous voir, d'entendre votre ton et de remarquer quand vous hésitez. Un tuteur qui repère la confusion sur le visage d'un élève, ou un agent d'assistance qui peut regarder ce que l'utilisateur lui montre à la caméra, a besoin précisément du type de lecture multimodale pour lequel Griffin a été conçu. S'exercer à une conversation difficile fonctionne aussi mieux quand l'autre réagit à votre expression, et pas seulement à vos mots.

Qui est derrière

Tavus a été fondée en 2020 et a levé environ 64 millions de dollars. Elle a commencé par produire des vidéos personnalisées par IA pour la vente et le marketing. Elle s'est ensuite étendue aux conversations vidéo en direct avec des personnages numériques. Griffin est l'étape suivante sur ce chemin : des clips pré-enregistrés aux avatars en direct, puis à un modèle censé interagir comme une personne.

Une vue d'ensemble

Tout cela suggère que l'IA conversationnelle en temps réel dépasse la voix pour s'étendre à l'échange en face à face complet. Jusqu'ici, la voix était le principal terrain d'affrontement, avec des produits comme la transcription en continu pour les agents vocaux et un fort intérêt des investisseurs pour les entreprises d'IA vocale comme ElevenLabs. Griffin pousse la même logique vers la vidéo, où l'expression, les gestes et le rythme portent tous du sens.

Pour les lecteurs, l'avantage est assez clair : un soutien scolaire, un coaching et une assistance plus naturels. L'inconvénient, c'est justement ce chiffre de 48 %. Un système que la moitié des gens prennent pour un humain au bout d'une minute soulève des questions évidentes sur la transparence et les abus possibles. Ces questions arrivent au moment où les régulateurs examinent déjà de plus près les développeurs d'IA, comme le montre l'enquête de la FTC visant les laboratoires d'IA.

Trois points méritent d'être suivis. D'abord, quels "problèmes de sécurité" Tavus nommera avant la sortie complète, et comment l'entreprise dira les avoir résolus. Ensuite, si elle s'engage à indiquer clairement aux utilisateurs qu'ils parlent à une IA. Enfin, si des chercheurs extérieurs parviennent à reproduire les résultats, en particulier sur des appels de plus d'une minute.