Tavus Griffin: KI-Avatar täuscht 48 % nach einer Minute
Tavus, ein Start-up aus San Francisco, will, dass seine KI ein Gespräch von Angesicht zu Angesicht so gut führt, dass man nicht merkt, dass man mit einer Maschine spricht. Mit seinem neuen Modell Griffin ist das Unternehmen diesem Ziel so nahe gekommen wie noch nie. In einer eigenen Studie von Tavus beendete fast die Hälfte der Teilnehmer einen einminütigen Videoanruf in der festen Überzeugung, mit einem Menschen gesprochen zu haben.
Was Griffin ist
Tavus bezeichnet Griffin als erstes "Human Interaction Model", kurz HIM. Der Begriff steht für eine Modellklasse, die Gespräche von Angesicht zu Angesicht in Echtzeit verstehen und führen soll. Sie soll mehr können, als Text oder einen sprechenden Kopf zu erzeugen.
Griffin verarbeitet mehr als Worte. Das Modell erfasst Sprache, Mimik, Tonfall, Gesten und Pausen. Dabei empfängt es das Video des Gegenübers und erzeugt gleichzeitig sein eigenes Video als Antwort. Um diesen wechselseitigen Kreislauf geht es im Kern. Das Modell soll die Person auf der anderen Seite der Kamera lesen und auf sie reagieren, statt nur eine Antwort aufzusagen.
Die Zahlen
Tavus nennt zwei Ergebnisse.
-
Der Test mit einminütigen Anrufen. In einer Studie von Tavus hielten 48 Prozent der Teilnehmer Griffin nach einem einminütigen Videoanruf für einen echten Menschen. Laut Unternehmen kamen frühere Systeme auf höchstens zwei Prozent.
-
Die Nvidia-Bewertung. Tavus beschreibt diese als unabhängigen Nvidia-Test, der misst, wie menschlich eine KI im direkten Audio-Video-Gespräch wirkt. Griffin erreichte 3,83 Punkte. Echte Menschen kamen auf 3,92. Das bislang beste KI-Modell schaffte 2,80.
Beide Ergebnisse weisen in dieselbe Richtung. Beim Nvidia-Maßstab liegt Griffin nur 0,09 Punkte hinter echten Menschen und mehr als einen ganzen Punkt vor dem bisher besten Modell. Bei der Anrufstudie ist der Sprung von zwei auf 48 Prozent eine Veränderung, die bestimmt, was ein Produkt leisten kann, und nicht nur, wo es in einer Grafik landet.
Es gibt allerdings Einschränkungen. Die 48 Prozent stammen aus einer eigenen Studie von Tavus. Den Nvidia-Test nennt Tavus selbst unabhängig. Und der Anruf dauerte eine Minute. Kurze Gespräche verbergen vieles. Ob die Illusion über zehn oder dreißig Minuten trägt, ist eine andere Frage, und das verfügbare Material beantwortet sie nicht. Weitere Details hat Tavus in seinem Forschungsbericht veröffentlicht.
Vorerst eingeschränkter Zugang
Griffin ist nicht allgemein verfügbar. Eine Vorabversion, Griffin-Lite, steht "ausgewählten Testern als Forschungsvorschau" offen. Eine leistungsfähigere Version soll laut Tavus folgen, sobald "Sicherheitsbedenken ausgeräumt sind".
Diese Formulierung fällt auf. Das Unternehmen knüpft die Veröffentlichung seines stärkeren Modells offen an ungelöste Sicherheitsfragen. Das legt nahe, dass es ein echtes Risiko in einem System sieht, das Menschen etwa in der Hälfte der Fälle für einen Menschen halten.
Die Einsatzbereiche, die Tavus nennt, sind praxisnah:
- Nachhilfe
- Üben schwieriger Gespräche
- Technischer Support per Kamera
All diese Anwendungen profitieren von einem Gegenüber, das einen sehen kann, den Tonfall hört und merkt, wenn man zögert. Ein Nachhilfelehrer, der Verwirrung im Gesicht eines Schülers erkennt, oder ein Support-Mitarbeiter, der sich ansehen kann, worauf der Nutzer die Kamera richtet, braucht genau die Art von multimodalem Verständnis, für die Griffin gebaut ist. Auch das Proben eines schwierigen Gesprächs funktioniert besser, wenn die Gegenseite auf den Gesichtsausdruck reagiert und nicht nur auf die Worte.
Wer dahintersteckt
Tavus wurde 2020 gegründet und hat rund 64 Millionen Dollar eingesammelt. Anfangs entwickelte das Unternehmen personalisierte KI-Videos für Vertrieb und Marketing. Danach weitete es sein Angebot auf Live-Videogespräche mit digitalen Personas aus. Griffin ist der nächste Schritt auf diesem Weg: von vorgerenderten Clips über Live-Avatare hin zu einem Modell, das wie ein Mensch interagieren soll.
Das große Ganze
Das deutet darauf hin, dass dialogfähige KI in Echtzeit über die reine Stimme hinaus in den vollständigen Kanal von Angesicht zu Angesicht vordringt. Bislang war die Stimme das wichtigste Schlachtfeld, mit Produkten wie Streaming-Transkription für Sprachagenten und großem Investoreninteresse an Sprach-KI-Firmen wie ElevenLabs. Griffin überträgt dieselbe Idee auf Video, wo Mimik, Gestik und Timing allesamt Bedeutung tragen.
Für Leser liegt der Nutzen recht klar auf der Hand: natürlichere Nachhilfe, natürlicheres Coaching und natürlicherer Support. Die Kehrseite ist die 48-Prozent-Zahl selbst. Ein System, das die Hälfte der Menschen nach einer Minute für einen Menschen hält, wirft offensichtliche Fragen nach Offenlegung und möglichem Missbrauch auf. Diese Fragen kommen zu einer Zeit, in der Aufsichtsbehörden KI-Entwickler ohnehin genauer unter die Lupe nehmen, wie die FTC-Untersuchung gegen KI-Labore zeigt.
Drei Dinge lohnt es sich zu beobachten. Erstens, welche "Sicherheitsbedenken" Tavus vor der vollständigen Veröffentlichung benennt und wie das Unternehmen sie ausgeräumt haben will. Zweitens, ob es sich verpflichtet, Nutzern klar mitzuteilen, dass sie mit einer KI sprechen. Drittens, ob externe Forscher die Ergebnisse nachvollziehen können, vor allem bei Anrufen, die länger als eine Minute dauern.
