Tavus indique que, lors d’appels vidéo d’une minute avec son nouveau modèle Griffin-Lite, 26 personnes sur 54 ont cru avoir parlé à une personne réelle. C’est un résultat marquant issu d’une étude menée par Tavus, mais il mesure les réactions à un appel et à une question précis. Griffin-Lite reste une avant-première de recherche réservée à des testeurs sélectionnés ; Tavus dit mettre au point des mesures pour informer les interlocuteurs de la présence d’une IA avant d’autoriser les clients à l’utiliser.
Le grand changement
- Ce qui change : Tavus fait évoluer ses recherches sur les assistants vidéo vers un système qui écoute, observe et génère un visage et une voix au cours d’une même conversation. Dans ses appels brefs menés par l’entreprise, 26 personnes sur 54 ont cru que le modèle était humain.
- Pourquoi c’est important : Pour les équipes qui conçoivent des agents vidéo, le rythme de la conversation et l’expressivité de la vidéo peuvent rendre l’interface plus engageante. Cette même étude montre pourquoi il ne faut pas reléguer au second plan l’information indiquant aux interlocuteurs qu’ils s’adressent à une IA.
- À surveiller : Griffin-Lite est réservé à des testeurs de recherche sélectionnés. Tavus indique que les fonctions permettant d’informer les interlocuteurs de la présence d’une IA et d’autres procédures de sécurité sont en cours de développement ; leur forme et leur efficacité, ainsi que l’accès des clients et le prix propre à Griffin, n’ont pas été annoncés.
Ce que mesurait le résultat de 26 personnes sur 54
Selon le compte rendu de recherche de Tavus du 1er octobre, les participants pensaient qu’ils seraient mis en relation avec un autre participant pour un appel vidéo d’une minute au sujet de ce qu’ils avaient hâte de vivre cette année. En réalité, leur interlocuteur était un personnage d’IA de Tavus animé par Griffin-Lite. Après l’appel, les personnes ont évalué l’échange et indiqué si elles s’étaient demandé si leur interlocuteur était réel. Tavus a ensuite révélé que celui-ci était une IA.
Sur les 54 personnes ayant participé aux appels avec Griffin-Lite, 26 ont déclaré que leur interlocuteur était une personne réelle, soit environ 48 %. Tavus indique avoir utilisé le même protocole pour ses systèmes antérieurs Phoenix-4.5, Sparrow-2 et Raven-1 ; dans ce groupe, une personne sur 41 a dit que son interlocuteur était humain. Il s’agit de groupes différents, et non d’une comparaison avant-après auprès des mêmes personnes. L’annonce ne permet pas d’établir comment cette réponse évoluerait lors d’appels plus longs, sur d’autres sujets ou dans un usage quotidien où les personnes savent qu’un agent d’IA peut intervenir.
Tavus qualifie le résultat de réussite à un test de Turing vidéo en temps réel. Il s’agit de la description que l’entreprise donne de son étude d’une minute, et non d’une certification universelle attestant d’une conversation comparable à celle d’un humain. Le compte rendu indépendant du lancement publié par RuntimeWire considère lui aussi le chiffre de 48 % comme un résultat limité, obtenu par l’entreprise, et souligne que l’aperçu n’est pas encore disponible aux clients. L’étude renseigne sur le jugement des participants dans les conditions indiquées ; elle ne mesure pas un taux de tromperie répliqué de façon indépendante.
Un benchmark distinct évalue la qualité de l’interaction
Le classement VideoFDB de NVIDIA attribue à Griffin-Lite une note de 3,83 sur 5 en génération et de 3,73 en perception. Le benchmark utilise des extraits de véritables appels vidéo et une évaluation par un modèle de langage fondée sur une grille. La génération évalue la pertinence de la voix, du visage et du comportement conversationnel du modèle ; la perception évalue ses réponses aux signaux audio et vidéo d’une personne. Le tableau de NVIDIA place Griffin-Lite au-dessus des systèmes répertoriés dans les deux catégories, tandis que les scores de référence humaine sont respectivement de 3,92 et 4,20.
Ces scores mesurent une tâche différente de celle qui consiste à demander aux interlocuteurs s’ils pensent que leur partenaire est humain. Les groupes de comparaison et les conditions diffèrent aussi : le tableau sur la génération inclut des systèmes en cascade qui convertissent la parole en avatar, tandis que celui sur la perception comprend des systèmes évalués avec l’audio et la vidéo ou, dans des lignes séparées, avec l’audio seul. Le classement étaye un résultat obtenu selon la grille publiée par NVIDIA. Il ne valide pas le chiffre de 48 % issu de l’étude d’appels de Tavus et ne montre pas comment Griffin fonctionnerait comme produit de service client, de tutorat ou de santé.
Ce que Tavus dit du fonctionnement du système
Tavus décrit Griffin comme une architecture en deux parties. Un modèle conversationnel continu reçoit l’audio et la vidéo de l’interlocuteur et produit des commandes indiquant quoi dire, quand parler et comment s’exprimer. Des générateurs de parole et de vidéo en continu transforment ces commandes en voix et en scène animée. L’entreprise indique que le système peut écouter tout en parlant, céder la parole lorsqu’on l’interrompt et réagir au contexte visuel au lieu d’attendre la fin de chaque tour. Il s’agit des descriptions techniques et démonstrations de Tavus ; BIG CHANGE n’a pas accédé à l’aperçu ni mesuré son comportement.
Cette distinction compte, car un visage généré ne constitue pas à lui seul toute l’interaction. Un système qui réagit aux pauses, au regard et aux interruptions pourrait influer sur le sentiment de l’interlocuteur d’être compris ou sur sa capacité à se rendre compte qu’il parle à un logiciel. Le résultat VideoFDB fournit une comparaison notée du comportement conversationnel selon un protocole de benchmark. L’étude d’appels de Tavus apporte une observation plus restreinte sur les jugements concernant l’identité. Aucun des deux ne remplace des données publiques sur la fiabilité dans la durée, l’information des interlocuteurs lors d’un déploiement réel ou le consentement éclairé des utilisateurs.
Accès et décisions à venir
Tavus indique que Griffin-Lite est réservé à un petit groupe de testeurs de confiance dans le cadre d’une avant-première de recherche et n’est pas accessible aux clients de Tavus. L’entreprise propose un formulaire de demande pour participer aux tests. Griffin n’est pas encore disponible sur la plateforme générale ni sur l’API publique, et l’annonce ne précise aucun tarif qui lui soit propre. Les modèles existants Phoenix, Raven et Sparrow de Tavus restent une offre distincte.
L’entreprise indique travailler sur des dispositifs pour informer les interlocuteurs de la présence d’une IA et sur des procédures de sécurité supplémentaires avant une diffusion plus large. Elle n’a publié ni calendrier, ni description détaillée de l’information qui leur sera donnée, ni preuve de l’efficacité de ces mesures. Pour quiconque évalue un agent vidéo en temps réel, la question immédiate est donc précise : comment l’interlocuteur saura-t-il qui, ou quoi, se trouve de l’autre côté, et comment cette information sera-t-elle vérifiée avant que Griffin devienne un produit destiné aux clients ?
Sources et lectures complémentaires
- Tavus Research, « Introducing Griffin: The First Human Interaction Model », 1er octobre 2026. Description du système par son éditeur, protocole et résultats de l’étude, disponibilité et déclarations sur la sécurité. L’étude d’appels a été menée par Tavus et n’a pas été répliquée indépendamment dans les sources examinées ici.
- NVIDIA et David AI, « VideoFDB: Evaluating Full-Duplex Vision-Speech Capabilities in Conversational Agents », consulté le 2 octobre 2026. Méthodologie de l’opérateur du benchmark et classement actualisé, avec les scores de Griffin-Lite en génération et en perception. Les scores évalués par un modèle sont distincts de l’étude d’appels humains de Tavus.
- Ryan Merket, RuntimeWire, « Tavus says Griffin fooled 48% of testers in one-minute video calls », 1er octobre 2026. Article indépendant indiquant la taille de l’échantillon et l’absence d’accès pour les clients ; il ne fait état ni d’une réplication ni d’un test pratique de Griffin.



