नव्या Griffin-Lite मॉडेलशी एका मिनिटाच्या video call मध्ये बोलल्यानंतर 54 पैकी 26 जणांना समोरची व्यक्ती खरी माणूस असल्याचे वाटले, असे Tavus सांगते. Tavus ने केलेल्या अभ्यासातील हा ठळक निष्कर्ष आहे; पण तो एका विशिष्ट कॉल आणि प्रश्नाला मिळालेल्या प्रतिसादांचे मोजमाप करतो. Griffin-Lite निवडक परीक्षकांसाठीचा संशोधन preview आहे; ग्राहकांना वापर देण्यापूर्वी ओळख उघड करणारी सुरक्षा तयार करत असल्याचे Tavus सांगते.

मोठा बदल

  • काय बदलले: व्हिडिओ सहाय्यकावरील संशोधनातून, एकाच संभाषणात ऐकणारी, पाहणारी आणि चेहरा व आवाज निर्माण करणारी प्रणालीकडे Tavus वाटचाल करत आहे. कंपनीच्या छोट्या कॉलमध्ये 54 पैकी 26 जणांना मॉडेल माणूस असल्याचे वाटले.
  • हे महत्त्वाचे का: Video agent तयार करणाऱ्या टीमसाठी संभाषणाचा वेग आणि भाव दाखवणारा व्हिडिओ interface वापरणे सोपे करू शकतो. कॉल करणाऱ्याला तो AI शी बोलतो आहे हे सांगणे नंतरची गोष्ट ठेवता येत नाही, हेही हाच अभ्यास दाखवतो.
  • कशाकडे लक्ष द्यावे: Griffin-Lite फक्त निवडक संशोधन परीक्षकांसाठी उपलब्ध आहे. उघड प्रकटीकरण वैशिष्ट्ये आणि पुढील सुरक्षितता प्रक्रिया विकसित करत असल्याचे Tavus सांगते; त्यांचे स्वरूप व परिणामकारकता, ग्राहक प्रवेश आणि Griffin ची स्वतंत्र किंमत अद्याप जाहीर नाही.

54 पैकी 26 च्या निकालात काय मोजले

1 ऑक्टोबरच्या Tavus संशोधन अहवालात, सहभागींना एका मिनिटाच्या video call साठी दुसऱ्या सहभाग्याशी जोडले जाईल असे सांगितले. या वर्षी कशाची उत्सुकता आहे यावर बोलायचे होते. प्रत्यक्षात जोडीदार Griffin-Lite वर चालणारा Tavus AI persona होता. कॉलनंतर लोकांनी संवादाला गुण दिले व जोडीदार खरा नसावा असे वाटले होते का ते विचारले. मग Tavus ने तो AI असल्याचे उघड केले.

Griffin-Lite गटातील 54 पैकी 26 जणांनी जोडीदार खरा माणूस होता असे सांगितले—सुमारे 48%. आधीच्या Phoenix-4.5, Sparrow-2 आणि Raven-1 प्रणालींसाठीही तोच protocol वापरल्याचे Tavus म्हणते; त्या गटात 41 पैकी एकाने जोडीदार माणूस असल्याचे सांगितले. हे वेगवेगळे कॉलर-गट आहेत; त्याच लोकांचा आधी-नंतरचा निकाल नाही. दीर्घ कॉल, वेगळे विषय किंवा समोर AI agent असू शकतो हे माहीत असलेल्या रोजच्या वापरात प्रतिसाद कसा बदलेल हे घोषणेतून सिद्ध होत नाही.

या निकालाला Tavus खऱ्या-वेळेच्या video Turing चाचणीतील यश म्हणते. हे एका मिनिटाच्या अभ्यासाबद्दल कंपनीचे वर्णन आहे; मानवी संभाषणाची सार्वत्रिक प्रमाणपत्र-चाचणी नाही. RuntimeWire च्या स्वतंत्र प्रकाशन-वृत्तात देखील 48% हा मर्यादित, कंपनीने केलेला निकाल मानला आहे आणि preview ग्राहकांसाठी उपलब्ध नसल्याचे नमूद केले. अभ्यास ठरवलेल्या परिस्थितीत सहभागींच्या मतांचा पुरावा देतो; फसवणुकीचा दर स्वतंत्रपणे पुन्हा तपासलेला नाही.

स्वतंत्र benchmark संभाषणाची गुणवत्ता मोजतो

NVIDIA ची VideoFDB क्रमवारी मॉडेलच्या generation ला 5 पैकी 3.83 आणि perception ला 3.73 गुण देते. Benchmark खऱ्या video call मधील clips आणि rubric-आधारित language-model परीक्षक वापरतो. Generation मध्ये मॉडेलचा आवाज, चेहरा व संभाषण योग्य आहेत का हे तपासतात; perception मध्ये व्यक्तीच्या audio व video ला मिळालेले उत्तर तपासतात. NVIDIA च्या तक्त्यात Griffin-Lite दोन्ही प्रकारांत नमूद इतर प्रणालींपेक्षा वर आहे; मानवी संदर्भ-गुण अनुक्रमे 3.92 आणि 4.20 आहेत.

हे गुण कॉलरला समोरचा माणूस आहे असे वाटते का, या प्रश्नापेक्षा वेगळे काम मोजतात. तुलना-गट आणि परिस्थितीही वेगळ्या आहेत: generation तक्त्यात टप्प्याटप्प्याने speech-to-avatar बनवणाऱ्या प्रणाली आहेत; perception तक्त्यात audio-video किंवा वेगळ्या ओळींत फक्त audio वापरून तपासलेल्या प्रणाली आहेत. NVIDIA च्या प्रकाशित निकषांवरील निष्कर्षाला leaderboard आधार देतो. Tavus च्या 48% कॉल-अभ्यासाची पुष्टी किंवा ग्राहकसेवा, शिकवणी वा आरोग्यसेवेतील Griffin ची कामगिरी तो दाखवत नाही.

प्रणालीबद्दल Tavus काय सांगते

Griffin ची रचना दोन भागांची असल्याचे Tavus सांगते. सतत काम करणारे संभाषण मॉडेल कॉलरचे audio व video घेते आणि काय बोलायचे, केव्हा बोलायचे व कसे व्यक्त व्हायचे याची नियंत्रणे देते. Streaming speech व video जनरेटर ती नियंत्रणे आवाज आणि हलत्या दृश्यात रूपांतरित करतात. प्रत्येक फेरी पूर्ण होण्याची वाट न पाहता प्रणाली ऐकू, बोलता, मध्येच थांबता आणि दृश्य-संदर्भाला प्रतिसाद देऊ शकते, असे कंपनीचे म्हणणे. ही Tavus ची तांत्रिक माहिती व प्रात्यक्षिके आहेत; BIG CHANGE ला preview प्रवेश मिळालेला नाही किंवा वर्तन मोजलेले नाही.

तयार केलेला चेहरा म्हणजे संपूर्ण संवाद नव्हे, म्हणून हा फरक महत्त्वाचा. विराम, नजर आणि मध्येच बोलणे यांना प्रतिसाद देणारी प्रणाली कॉलरला समजून घेतल्याचा अनुभव देऊ शकते किंवा आपण सॉफ्टवेअरशी बोलतो आहोत हे जाणवण्यावर परिणाम करू शकते. VideoFDB मध्ये benchmark नियमानुसार संभाषणाचे गुणांकित मूल्यमापन आहे; Tavus च्या कॉल-अभ्यासात ओळखीबाबतची मते मर्यादित परिस्थितीत नोंदली. सातत्यपूर्ण विश्वासार्हता, प्रत्यक्ष तैनातीतील प्रकटीकरण किंवा माहितीपूर्ण संमती यांबाबत सार्वजनिक पुराव्याची जागा यांपैकी कोणी घेत नाही.

प्रवेश आणि पुढील निर्णय

Tavus सांगते की Griffin-Lite फक्त निवडक विश्वासार्ह परीक्षकांसाठी खुले संशोधन preview म्हणून; Tavus ग्राहकांना उपलब्ध नाही. चाचणीसाठी विनंती-फॉर्म आहे. Griffin सर्वसाधारण platform किंवा public API वर अद्याप नाही आणि घोषणेत त्याची स्वतंत्र किंमत दिलेली नाही. Tavus ची सध्याची Phoenix, Raven आणि Sparrow मॉडेल्स वेगळा उत्पादन-मार्ग आहेत.

विस्तृत प्रकाशनापूर्वी प्रकटीकरण वैशिष्ट्ये व आणखी सुरक्षितता प्रक्रिया विकसित करत असल्याचे कंपनी म्हणते. तारीख, प्रकटीकरणाची तपशीलवार रचना किंवा उपाय कार्य करतात याचा पुरावा तिने दिलेला नाही. Real-time video agent तपासणाऱ्यांसाठी लगेचचा प्रश्न असा: Griffin ग्राहक-उत्पादन होण्याआधी कॉलरला पलीकडे कोण किंवा काय आहे हे कसे कळेल, आणि त्याची पडताळणी कशी होईल?

स्रोत आणि पुढील वाचन

  • Tavus Research, “Introducing Griffin: The First Human Interaction Model”, 1 ऑक्टोबर 2026. विक्रेत्याचे प्रणाली-वर्णन, अभ्यासाची पद्धत व निष्कर्ष, उपलब्धता आणि सुरक्षिततेची विधाने. Tavus नेच कॉल-अभ्यास केला; तपासलेल्या स्रोतांत स्वतंत्र पुनरावृत्ती नाही.
  • NVIDIA आणि David AI, “VideoFDB: Evaluating Full-Duplex Vision-Speech Capabilities in Conversational Agents”, 2 ऑक्टोबर 2026 रोजी तपासले. Benchmark चालकाची पद्धत व live leaderboard, Griffin-Lite चे generation आणि perception गुणांसह. Language-model परीक्षकाचे गुण Tavus च्या कॉल-अभ्यासापेक्षा वेगळे.
  • Ryan Merket, RuntimeWire, “Tavus says Griffin fooled 48% of testers in one-minute video calls”, 1 ऑक्टोबर 2026. नमुना आकार व ग्राहक-प्रवेशातील मर्यादा ओळखणारे स्वतंत्र वृत्तांकन; स्वतःची पुनरावृत्ती किंवा Griffin ची प्रत्यक्ष चाचणी नाही.