Tavus Griffin: un avatar de IA engañó al 48% en llamadas
Tavus, una startup de San Francisco, quiere que su IA sea capaz de mantener una conversación cara a cara tan bien que no se note que es una máquina. Su nuevo modelo, Griffin, es lo más cerca que ha estado la empresa de conseguirlo hasta ahora. En un estudio de la propia Tavus, casi la mitad de los participantes terminó una videollamada de un minuto convencida de haber hablado con una persona.
Qué es Griffin
Tavus define Griffin como el primer "Human Interaction Model", o HIM. La etiqueta describe un tipo de modelo pensado para entender y mantener conversaciones cara a cara en tiempo real. La idea es que haga algo más que generar texto o una cabeza parlante.
Griffin no se queda solo con las palabras. Procesa el habla, las expresiones faciales, el tono de voz, los gestos y las pausas. Y lo hace mientras recibe el vídeo de la otra persona y genera su propio vídeo como respuesta. Ese circuito en dos direcciones es la clave. Se supone que el modelo interpreta a la persona que está al otro lado de la cámara y reacciona ante ella, en lugar de limitarse a recitar una respuesta.
Las cifras
Tavus presenta dos conjuntos de resultados.
-
La prueba de la llamada de un minuto. En un estudio de Tavus, el 48 por ciento de los participantes creyó que Griffin era una persona real tras una videollamada de un minuto. Según la empresa, los sistemas anteriores no pasaban del dos por ciento.
-
La evaluación de Nvidia. Tavus la describe como una prueba independiente de Nvidia que mide hasta qué punto una IA parece humana en una conversación directa de audio y vídeo. Griffin obtuvo 3,83 puntos. Los humanos reales, 3,92. El mejor modelo de IA anterior se quedó en 2,80.
Los dos resultados apuntan en la misma dirección. En la medición de Nvidia, Griffin se queda a 0,09 puntos de las personas reales y supera en más de un punto al mejor modelo anterior. En el estudio de las llamadas, el salto del dos al 48 por ciento es de los que cambian lo que un producto puede hacer, no solo su posición en un gráfico.
Hay que hacer algunas salvedades. La cifra del 48 por ciento procede del propio estudio de Tavus. Es Tavus quien califica de independiente la prueba de Nvidia. Y la llamada duraba un minuto. Las conversaciones cortas esconden mucho. Si la ilusión se mantiene durante diez o treinta minutos es otra cuestión, y el material disponible no la responde. Tavus ha publicado más detalles en su informe de investigación.
Acceso limitado, de momento
Griffin no está disponible para el gran público. Una versión preliminar, Griffin-Lite, está abierta a "testers seleccionados como avance de investigación". Tavus asegura que llegará una versión más capaz cuando "se hayan resuelto los problemas de seguridad".
Esa forma de decirlo llama la atención. La empresa vincula abiertamente el lanzamiento de su modelo más potente a cuestiones de seguridad aún sin resolver. Esto sugiere que ve un riesgo real en un sistema que la gente confunde con un humano aproximadamente la mitad de las veces.
Los usos que plantea Tavus son prácticos:
- Clases particulares
- Ensayar conversaciones difíciles
- Soporte técnico a través de la cámara
Todos ellos salen ganando con un interlocutor que puede verte, captar tu tono de voz y darse cuenta de cuándo dudas. Un tutor que detecta la confusión en la cara de un alumno, o un agente de soporte que puede ver aquello a lo que el usuario apunta con la cámara, necesita justo el tipo de lectura multimodal para el que está diseñado Griffin. Ensayar una conversación complicada también funciona mejor cuando la otra parte reacciona a tu expresión y no solo a tus palabras.
Quién está detrás
Tavus se fundó en 2020 y ha captado unos 64 millones de dólares. Empezó creando vídeos personalizados con IA para ventas y marketing. Después se amplió a las videoconversaciones en directo con personajes digitales. Griffin es el siguiente paso en ese camino: de los clips pregrabados a los avatares en directo y, de ahí, a un modelo pensado para interactuar como una persona.
El panorama general
Todo esto sugiere que la IA conversacional en tiempo real está yendo más allá de la voz para abarcar todo el canal cara a cara. Hasta ahora, la voz ha sido el principal campo de batalla, con productos como la transcripción en streaming para agentes de voz y un fuerte interés de los inversores por empresas de IA de voz como ElevenLabs. Griffin lleva esa misma idea al vídeo, donde la expresión, los gestos y los tiempos también transmiten significado.
Para los lectores, la ventaja está bastante clara: clases, coaching y soporte más naturales. El inconveniente es la propia cifra del 48 por ciento. Un sistema que la mitad de la gente toma por humano al cabo de un minuto plantea preguntas evidentes sobre la transparencia y el posible mal uso. Y estas preguntas llegan en un momento en que los reguladores ya están vigilando más de cerca a los desarrolladores de IA, como demuestra la investigación de la FTC a los laboratorios de IA.
Hay tres cosas a las que conviene estar atentos. Primero, qué "problemas de seguridad" concreta Tavus antes del lanzamiento completo y cómo explica que los ha resuelto. Segundo, si se compromete a avisar claramente a los usuarios de que están hablando con una IA. Tercero, si investigadores externos pueden reproducir los resultados, sobre todo en llamadas de más de un minuto.
