Tavus zufolge glaubten 26 von 54 Personen nach einem einminütigen Videoanruf mit dem neuen Modell Griffin-Lite, mit einem echten Menschen gesprochen zu haben. Das ist ein bemerkenswertes Ergebnis aus einer von Tavus durchgeführten Studie, misst aber nur die Reaktion auf einen bestimmten Anruf und eine bestimmte Frage. Griffin-Lite ist weiterhin eine Research-Preview für ausgewählte Tester. Tavus erklärt, vor einem Einsatz durch Kunden noch an Schutzmaßnahmen zur Offenlegung zu arbeiten.

Die große Änderung

  • Was sich geändert hat: Tavus hat seine Forschung zu Videoassistenten in Richtung eines Systems weiterentwickelt, das während desselben Gesprächs zuhört, das Gegenüber sieht und ein Gesicht sowie eine Stimme erzeugt. In den kurzen, vom Unternehmen durchgeführten Anrufen glaubten 26 von 54 Teilnehmenden, das Modell sei ein Mensch.
  • Warum das wichtig ist: Für Teams, die Video-Agenten entwickeln, können Gesprächsrhythmus und ausdrucksstarkes Video die Interaktion erleichtern. Dieselbe Studie zeigt, warum der Hinweis, dass Anrufende mit einer KI sprechen, von Anfang an dazugehören muss.
  • Worauf zu achten ist: Griffin-Lite steht nur ausgewählten Forschungstestern zur Verfügung. Tavus zufolge werden Offenlegungsfunktionen und weitere Sicherheitsverfahren noch entwickelt; ihre konkrete Ausgestaltung und Wirksamkeit, der Zugang für Kunden und ein spezieller Preis für Griffin sind noch nicht bekannt.

Was das Ergebnis 26 von 54 gemessen hat

Im Forschungsbericht von Tavus vom 1. Oktober wurde den Teilnehmenden mitgeteilt, sie würden für einen einminütigen Videoanruf darüber, worauf sie sich in diesem Jahr freuen, mit einer anderen Person verbunden. Stattdessen sprach ihr Gegenüber als KI-Persona von Tavus, die auf Griffin-Lite basierte. Nach dem Anruf bewerteten die Teilnehmenden das Gespräch und wurden gefragt, ob sie sich gefragt hätten, ob ihr Gegenüber nicht echt sei. Anschließend gab Tavus bekannt, dass es sich um eine KI handelte.

Von 54 Teilnehmenden, die mit Griffin-Lite sprachen, hielten 26 ihr Gegenüber für einen echten Menschen – rund 48 %. Tavus zufolge verwendete das Unternehmen dasselbe Verfahren bereits für die Vorgängermodelle Phoenix-4.5, Sparrow-2 und Raven-1. In jener Gruppe hielt eine von 41 Personen ihr Gegenüber für einen Menschen. Das waren unterschiedliche Gruppen von Anrufenden und kein Vorher-nachher-Vergleich derselben Personen. Aus der Ankündigung geht nicht hervor, wie sich diese Reaktion bei längeren Gesprächen, anderen Themen oder einer alltäglichen Nutzung ändern würde, bei der Menschen mit KI-Agenten rechnen.

Tavus bezeichnet das Ergebnis als einen bestandenen Echtzeit-Video-Turing-Test. Das ist die Beschreibung des Unternehmens für seine einminütige Studie, keine allgemeingültige Bestätigung menschenähnlicher Gespräche. Der unabhängige Einführungsbericht von RuntimeWire behandelt den Wert von 48 % ebenfalls als kleines, vom Unternehmen selbst ermitteltes Ergebnis und weist darauf hin, dass die Preview noch nicht für Kunden verfügbar ist. Die Studie liefert Erkenntnisse zu den Urteilen der Teilnehmenden unter den angegebenen Bedingungen; sie ist keine unabhängige Wiederholung einer Täuschungsquote.

Ein separater Benchmark prüft die Interaktionsqualität

Die VideoFDB-Bestenliste von NVIDIA bewertet Griffin-Lite mit 3,83 von 5 Punkten bei der Generierung und 3,73 bei der Wahrnehmung. Der Benchmark verwendet Ausschnitte aus echten Videoanrufen und eine Bewertung anhand von Kriterien durch ein Sprachmodell. Beim Generierungswert wird beurteilt, wie angemessen Stimme, Gesicht und Gesprächsverhalten des Modells sind; beim Wahrnehmungswert, wie es auf Audio- und Videodaten einer Person reagiert. In der Tabelle von NVIDIA liegt Griffin-Lite bei beiden Kategorien über den aufgeführten Systemen. Die Vergleichswerte mit Menschen betragen 3,92 beziehungsweise 4,20.

Diese Werte messen etwas anderes als die Frage an Anrufende, ob sie ihr Gegenüber für einen Menschen halten. Auch Vergleichsgruppen und Bedingungen unterscheiden sich: Die Tabelle zur Generierung schließt mehrstufige Systeme ein, bei denen Sprache und Avatar getrennt erzeugt werden. In der Tabelle zur Wahrnehmung werden Systeme mit Audio und Video oder in separaten Zeilen nur mit Audio bewertet. Die Bestenliste belegt ein Ergebnis nach den veröffentlichten Bewertungskriterien von NVIDIA. Sie bestätigt weder Tavus’ Ergebnis von 48 % aus den Anrufen noch zeigt sie, wie Griffin in einem Kundenservice-, Lern- oder Gesundheitsprodukt abschneiden würde.

Was Tavus über das System sagt

Tavus beschreibt Griffin als zweigliedriges System. Ein fortlaufend arbeitendes Gesprächsmodell verarbeitet Audio und Video der anrufenden Person und gibt Steuerungssignale dazu aus, was gesagt werden soll, wann gesprochen wird und wie der Ausdruck aussehen soll. Streaming-Generatoren für Sprache und Video setzen diese Signale in eine Stimme und eine bewegte Szene um. Das Unternehmen erklärt, das System könne zuhören, während es spricht, bei einer Unterbrechung das Wort abgeben und auf visuelle Zusammenhänge reagieren, statt jeden Gesprächsbeitrag abzuwarten. Das sind technische Beschreibungen und Vorführungen von Tavus; BIG CHANGE hatte keinen Zugang zur Preview und hat das Verhalten nicht gemessen.

Diese Unterscheidung ist wichtig, denn ein erzeugtes Gesicht allein bildet noch nicht die gesamte Interaktion ab. Ein System, das auf Pausen, Blickrichtung und Unterbrechungen reagiert, könnte beeinflussen, ob Anrufende sich verstanden fühlen oder merken, dass sie mit Software sprechen. Das Ergebnis von VideoFDB bietet einen bewerteten Vergleich des Gesprächsverhaltens nach einem Benchmark-Verfahren. Die Studie mit Anrufen durch Menschen liefert eine engere Beobachtung dazu, wen Teilnehmende auf der anderen Seite vermuten. Keines der Ergebnisse ersetzt öffentlich zugängliche Belege für anhaltende Zuverlässigkeit, Offenlegung bei einem Live-Einsatz oder die informierte Einwilligung der Nutzenden.

Zugang und die nächste Entscheidung

Tavus zufolge ist Griffin-Lite nur für ausgewählte vertrauenswürdige Tester geöffnet und befindet sich in einer Research-Preview; Kunden von Tavus können das Modell nicht nutzen. Das Unternehmen bietet ein Formular für Testanfragen an. Griffin ist noch nicht Teil der allgemeinen Plattform oder einer öffentlichen API. Die Ankündigung nennt keinen Griffin-spezifischen Preis. Die bestehenden Modelle Phoenix, Raven und Sparrow von Tavus sind davon getrennte aktuelle Produkte.

Das Unternehmen erklärt, vor einer breiteren Veröffentlichung an Offenlegungsfunktionen und weiteren Sicherheitsverfahren zu arbeiten. Ein Termin, ein detailliertes Konzept für die Offenlegung oder Belege für die Wirksamkeit der Maßnahmen wurden nicht veröffentlicht. Wer einen Echtzeit-Video-Agenten bewertet, sollte deshalb zunächst eine konkrete Frage klären: Wie erfahren Anrufende, wer oder was ihnen gegenüber ist, und wie wird das überprüft, bevor Griffin zu einem Produkt für Kunden wird?

Quellen und weiterführende Informationen