DIE WELT BLEIBT NICHT STEHEN.RSS
BIG CHANGE.

Markdown-Ausgabe

AI-translated from English; not yet reviewed by a fluent editor.

# Tavus Griffin: Was das Ergebnis aus einminütigen Videoanrufen aussagt

> In einminütigen Videoanrufen von Tavus glaubten 26 von 54 Teilnehmenden, Griffin-Lite sei ein Mensch. Die Studie von Tavus, der NVIDIA-Benchmark und die eingeschränkte Preview beantworten unterschiedliche Fragen.

By BIG CHANGE Editorial

Published: 2026-10-02T15:28:31.155Z
Updated: 2026-10-02T15:28:31.155Z
Canonical: https://bigchange.ai/blog/tavus-griffin-one-minute-video-call-study

![A charcoal and ink illustration of one hollow translucent face mask mounted on a stand, with a restrained orange reflection.](https://bigchange.ai/api/media/file/tavus-griffin-identity-mask-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

Tavus zufolge glaubten 26 von 54 Personen nach einem einminütigen Videoanruf mit dem neuen Modell Griffin-Lite, mit einem echten Menschen gesprochen zu haben. Das ist ein bemerkenswertes Ergebnis aus einer von Tavus durchgeführten Studie, misst aber nur die Reaktion auf einen bestimmten Anruf und eine bestimmte Frage. Griffin-Lite ist weiterhin eine Research-Preview für ausgewählte Tester. Tavus erklärt, vor einem Einsatz durch Kunden noch an Schutzmaßnahmen zur Offenlegung zu arbeiten.

## Die große Änderung

- **Was sich geändert hat:** Tavus hat seine Forschung zu Videoassistenten in Richtung eines Systems weiterentwickelt, das während desselben Gesprächs zuhört, das Gegenüber sieht und ein Gesicht sowie eine Stimme erzeugt. In den kurzen, vom Unternehmen durchgeführten Anrufen glaubten 26 von 54 Teilnehmenden, das Modell sei ein Mensch.
- **Warum das wichtig ist:** Für Teams, die Video-Agenten entwickeln, können Gesprächsrhythmus und ausdrucksstarkes Video die Interaktion erleichtern. Dieselbe Studie zeigt, warum der Hinweis, dass Anrufende mit einer KI sprechen, von Anfang an dazugehören muss.
- **Worauf zu achten ist:** Griffin-Lite steht nur ausgewählten Forschungstestern zur Verfügung. Tavus zufolge werden Offenlegungsfunktionen und weitere Sicherheitsverfahren noch entwickelt; ihre konkrete Ausgestaltung und Wirksamkeit, der Zugang für Kunden und ein spezieller Preis für Griffin sind noch nicht bekannt.

## Was das Ergebnis 26 von 54 gemessen hat

Im [Forschungsbericht von Tavus vom 1. Oktober](https://www.tavus.io/griffin) wurde den Teilnehmenden mitgeteilt, sie würden für einen einminütigen Videoanruf darüber, worauf sie sich in diesem Jahr freuen, mit einer anderen Person verbunden. Stattdessen sprach ihr Gegenüber als KI-Persona von Tavus, die auf Griffin-Lite basierte. Nach dem Anruf bewerteten die Teilnehmenden das Gespräch und wurden gefragt, ob sie sich gefragt hätten, ob ihr Gegenüber nicht echt sei. Anschließend gab Tavus bekannt, dass es sich um eine KI handelte.

Von 54 Teilnehmenden, die mit Griffin-Lite sprachen, hielten 26 ihr Gegenüber für einen echten Menschen – rund 48 %. Tavus zufolge verwendete das Unternehmen dasselbe Verfahren bereits für die Vorgängermodelle Phoenix-4.5, Sparrow-2 und Raven-1. In jener Gruppe hielt eine von 41 Personen ihr Gegenüber für einen Menschen. Das waren unterschiedliche Gruppen von Anrufenden und kein Vorher-nachher-Vergleich derselben Personen. Aus der Ankündigung geht nicht hervor, wie sich diese Reaktion bei längeren Gesprächen, anderen Themen oder einer alltäglichen Nutzung ändern würde, bei der Menschen mit KI-Agenten rechnen.

Tavus bezeichnet das Ergebnis als einen bestandenen Echtzeit-Video-Turing-Test. Das ist die Beschreibung des Unternehmens für seine einminütige Studie, keine allgemeingültige Bestätigung menschenähnlicher Gespräche. [Der unabhängige Einführungsbericht von RuntimeWire](https://runtimewire.com/article/tavus-griffin-video-turing-test) behandelt den Wert von 48 % ebenfalls als kleines, vom Unternehmen selbst ermitteltes Ergebnis und weist darauf hin, dass die Preview noch nicht für Kunden verfügbar ist. Die Studie liefert Erkenntnisse zu den Urteilen der Teilnehmenden unter den angegebenen Bedingungen; sie ist keine unabhängige Wiederholung einer Täuschungsquote.

## Ein separater Benchmark prüft die Interaktionsqualität

Die [VideoFDB-Bestenliste von NVIDIA](https://research.nvidia.com/labs/amri/projects/video-fdb/) bewertet Griffin-Lite mit 3,83 von 5 Punkten bei der Generierung und 3,73 bei der Wahrnehmung. Der Benchmark verwendet Ausschnitte aus echten Videoanrufen und eine Bewertung anhand von Kriterien durch ein Sprachmodell. Beim Generierungswert wird beurteilt, wie angemessen Stimme, Gesicht und Gesprächsverhalten des Modells sind; beim Wahrnehmungswert, wie es auf Audio- und Videodaten einer Person reagiert. In der Tabelle von NVIDIA liegt Griffin-Lite bei beiden Kategorien über den aufgeführten Systemen. Die Vergleichswerte mit Menschen betragen 3,92 beziehungsweise 4,20.

Diese Werte messen etwas anderes als die Frage an Anrufende, ob sie ihr Gegenüber für einen Menschen halten. Auch Vergleichsgruppen und Bedingungen unterscheiden sich: Die Tabelle zur Generierung schließt mehrstufige Systeme ein, bei denen Sprache und Avatar getrennt erzeugt werden. In der Tabelle zur Wahrnehmung werden Systeme mit Audio und Video oder in separaten Zeilen nur mit Audio bewertet. Die Bestenliste belegt ein Ergebnis nach den veröffentlichten Bewertungskriterien von NVIDIA. Sie bestätigt weder Tavus’ Ergebnis von 48 % aus den Anrufen noch zeigt sie, wie Griffin in einem Kundenservice-, Lern- oder Gesundheitsprodukt abschneiden würde.

## Was Tavus über das System sagt

Tavus beschreibt Griffin als zweigliedriges System. Ein fortlaufend arbeitendes Gesprächsmodell verarbeitet Audio und Video der anrufenden Person und gibt Steuerungssignale dazu aus, was gesagt werden soll, wann gesprochen wird und wie der Ausdruck aussehen soll. Streaming-Generatoren für Sprache und Video setzen diese Signale in eine Stimme und eine bewegte Szene um. Das Unternehmen erklärt, das System könne zuhören, während es spricht, bei einer Unterbrechung das Wort abgeben und auf visuelle Zusammenhänge reagieren, statt jeden Gesprächsbeitrag abzuwarten. Das sind technische Beschreibungen und Vorführungen von Tavus; BIG CHANGE hatte keinen Zugang zur Preview und hat das Verhalten nicht gemessen.

Diese Unterscheidung ist wichtig, denn ein erzeugtes Gesicht allein bildet noch nicht die gesamte Interaktion ab. Ein System, das auf Pausen, Blickrichtung und Unterbrechungen reagiert, könnte beeinflussen, ob Anrufende sich verstanden fühlen oder merken, dass sie mit Software sprechen. Das Ergebnis von VideoFDB bietet einen bewerteten Vergleich des Gesprächsverhaltens nach einem Benchmark-Verfahren. Die Studie mit Anrufen durch Menschen liefert eine engere Beobachtung dazu, wen Teilnehmende auf der anderen Seite vermuten. Keines der Ergebnisse ersetzt öffentlich zugängliche Belege für anhaltende Zuverlässigkeit, Offenlegung bei einem Live-Einsatz oder die informierte Einwilligung der Nutzenden.

## Zugang und die nächste Entscheidung

Tavus zufolge ist [Griffin-Lite nur für ausgewählte vertrauenswürdige Tester geöffnet](https://www.tavus.io/griffin) und befindet sich in einer Research-Preview; Kunden von Tavus können das Modell nicht nutzen. Das Unternehmen bietet ein Formular für Testanfragen an. Griffin ist noch nicht Teil der allgemeinen Plattform oder einer öffentlichen API. Die Ankündigung nennt keinen Griffin-spezifischen Preis. Die bestehenden Modelle Phoenix, Raven und Sparrow von Tavus sind davon getrennte aktuelle Produkte.

Das Unternehmen erklärt, vor einer breiteren Veröffentlichung an Offenlegungsfunktionen und weiteren Sicherheitsverfahren zu arbeiten. Ein Termin, ein detailliertes Konzept für die Offenlegung oder Belege für die Wirksamkeit der Maßnahmen wurden nicht veröffentlicht. Wer einen Echtzeit-Video-Agenten bewertet, sollte deshalb zunächst eine konkrete Frage klären: Wie erfahren Anrufende, wer oder was ihnen gegenüber ist, und wie wird das überprüft, bevor Griffin zu einem Produkt für Kunden wird?

## Quellen und weiterführende Informationen

- [Tavus Research: „Introducing Griffin: The First Human Interaction Model“](https://www.tavus.io/griffin), 1. Oktober 2026. Beschreibung des Systems, Studienverfahren und Ergebnisse, Verfügbarkeit und Sicherheitshinweise des Anbieters. Tavus führte die Studie mit menschlichen Teilnehmenden durch; in den hier geprüften Quellen wurde sie nicht unabhängig wiederholt.
- [NVIDIA und David AI: „VideoFDB: Evaluating Full-Duplex Vision-Speech Capabilities in Conversational Agents“](https://research.nvidia.com/labs/amri/projects/video-fdb/), geprüft am 2. Oktober 2026. Methodik und aktuelle Bestenliste des Benchmark-Anbieters, einschließlich der Griffin-Lite-Werte für Generierung und Wahrnehmung. Die Bewertung durch ein Modell ist von der Anrufstudie mit Menschen getrennt.
- [Ryan Merket, RuntimeWire: „Tavus says Griffin fooled 48% of testers in one-minute video calls“](https://runtimewire.com/article/tavus-griffin-video-turing-test), 1. Oktober 2026. Unabhängige Berichterstattung, die Stichprobengröße und fehlenden Zugang für Kunden nennt; der Bericht enthält weder eine eigene Wiederholung noch einen Praxistest von Griffin.

## Sources

- [Tavus: Introducing Griffin: The First Human Interaction Model](https://www.tavus.io/griffin) — Primärankündigung von Tavus: Beschreibung des Modells, einminütige Unternehmensstudie mit Menschen, ausgewählte Research-Preview, Arbeit an Offenlegung und fehlender Zugang für Kunden. Tavus’ Interpretation als bestandener Video-Turing-Test wird zugeschrieben und nicht als allgemeingültiges Ergebnis übernommen.
- [VideoFDB – Bewertung von Full-Duplex-Fähigkeiten für Sehen und Sprechen in dialogbasierten Agenten](https://research.nvidia.com/labs/amri/projects/video-fdb/) — Methodik und aktuelle Bestenliste von NVIDIA und David AI. Griffin-Lite erreicht 3,83 Punkte bei der Generierung und 3,73 bei der Wahrnehmung; es handelt sich um getrennte Bewertungen durch ein Modell, nicht um eine Untersuchung, ob Menschen die KI für echt hielten.
- [Tavus zufolge täuschte Griffin 48 % der Tester in einminütigen Videoanrufen](https://runtimewire.com/article/tavus-griffin-video-turing-test) — Unabhängiger Einführungsbericht und Einordnung der kleinen, vom Unternehmen durchgeführten Studie sowie des fehlenden Kundenzugangs; keine unabhängige Wiederholung.
Der Newsletter von BIG CHANGE

Das große Ganze. In Ihrem Tempo.

Aktuelle Storys über KI und Robotik, beobachtenswerte Veränderungen und praktische Ideen zur Anwendung. Wählen Sie ein tägliches Briefing, eine wöchentliche Zusammenfassung oder eine monatliche Perspektive.