Tavus বলেছে, তার নতুন Griffin-Lite model-এর সঙ্গে এক মিনিটের video call-এ ৫৪ জনের মধ্যে ২৬ জন ভেবেছিলেন তাঁরা সত্যিকারের একজন মানুষের সঙ্গে কথা বলেছেন। Tavus-এর করা গবেষণার এটি উল্লেখযোগ্য ফল, তবে মাপে নির্দিষ্ট একটি কল ও প্রশ্নে অংশগ্রহণকারীদের প্রতিক্রিয়া। Griffin-Lite এখনো বাছাই করা পরীক্ষকদের জন্য গবেষণা preview; গ্রাহকেরা ব্যবহার করতে পারার আগে disclosure সুরক্ষা তৈরি করছে বলে Tavus জানিয়েছে।
মূল পরিবর্তন
- কী বদলেছে: Tavus-এর video assistant গবেষণা এমন ব্যবস্থার দিকে এগিয়েছে, যা একই কথোপকথনে শোনে, দেখে এবং মুখ ও কণ্ঠ তৈরি করে। কোম্পানির পরিচালিত সংক্ষিপ্ত কলে ৫৪ জনের মধ্যে ২৬ জন model-টিকে মানুষ ভেবেছিলেন।
- কেন গুরুত্বপূর্ণ: video agent নকশাকারী দলের জন্য কথোপকথনের timing ও অভিব্যক্তিপূর্ণ video interface-এ যুক্ত হওয়া সহজ করতে পারে। একই গবেষণা দেখায়, callers-কে তারা AI-এর সঙ্গে কথা বলছেন জানানো বিষয়টি পরে ভাবার মতো নয়।
- কী খেয়াল রাখবেন: Griffin-Lite শুধু বাছাই করা গবেষণা-পরীক্ষকদের জন্য সীমিত। Disclosure feature ও অতিরিক্ত নিরাপত্তা পদ্ধতি তৈরি হচ্ছে বলে Tavus জানিয়েছে; সেগুলোর রূপ ও কার্যকারিতা, গ্রাহক-প্রবেশাধিকার এবং Griffin-এর নির্দিষ্ট মূল্য—কোনোটিই এখনো ঘোষণা করা হয়নি।
৫৪ জনের মধ্যে ২৬ জনের ফল কী মেপেছে
Tavus-এর 1 অক্টোবরের গবেষণা-বিবরণে অংশগ্রহণকারীদের বলা হয়েছিল, এ বছর তাঁরা কী প্রত্যাশা করছেন তা নিয়ে এক মিনিটের video call-এ তাঁদের আরেকজন অংশগ্রহণকারীর সঙ্গে মিলিয়ে দেওয়া হবে। কিন্তু তাঁদের সঙ্গী ছিলেন Griffin-Lite-চালিত Tavus AI persona। কলের পরে অংশগ্রহণকারীরা কথোপকথনের rating দেন এবং সঙ্গীটি আসল মানুষ নয়—এমন সন্দেহ তাঁদের হয়েছিল কি না জিজ্ঞেস করা হয়। এরপর Tavus জানায়, সঙ্গীটি AI ছিল।
Griffin-Lite-এর ৫৪ জন অংশগ্রহণকারীর মধ্যে ২৬ জন বলেছেন, তাঁদের সঙ্গী বাস্তব মানুষ—প্রায় ৪৮%। Tavus বলেছে, আগের Phoenix-4.5, Sparrow-2 ও Raven-1 system-এর ক্ষেত্রেও একই protocol ব্যবহার করেছিল; ওই দলে ৪১ জনের মধ্যে একজন সঙ্গীকে মানুষ বলেছিলেন। এগুলো আলাদা caller group, একই মানুষের ওপর আগে-পরের পরীক্ষা নয়। দীর্ঘ call, ভিন্ন বিষয় বা দৈনন্দিন ব্যবহারে—যেখানে মানুষ জানেন AI agent দেখা দিতে পারে—এই প্রতিক্রিয়া কীভাবে বদলাবে, ঘোষণা তা প্রতিষ্ঠা করে না।
Tavus ফলটিকে real-time video Turing test-এ উত্তীর্ণ হওয়া বলে অভিহিত করেছে। এটি কোম্পানির এক মিনিটের গবেষণা সম্পর্কে বর্ণনা, মানুষের মতো কথোপকথনের সর্বজনীন সনদ নয়। RuntimeWire-এ প্রকাশিত স্বাধীন প্রতিবেদন ৪৮% ফলকেও ছোট, কোম্পানি-পরিচালিত ফল হিসেবে বিবেচনা করে এবং জানায় preview এখনো গ্রাহকদের জন্য খোলা হয়নি। গবেষণাটি উল্লিখিত শর্তে অংশগ্রহণকারীদের বিচার সম্পর্কে প্রমাণ; প্রতারণার হারের স্বাধীন পুনরাবৃত্তি নয়।
আলাদা benchmark কথোপকথনের মান পরীক্ষা করে
NVIDIA-র VideoFDB leaderboard Griffin-Lite-কে generation-এ 5-এর মধ্যে 3.83 এবং perception-এ 3.73 দিয়েছে। Benchmark-এ বাস্তব video call-এর clip এবং rubric-ভিত্তিক language-model বিচারক ব্যবহার করা হয়। Generation-এ model-এর কণ্ঠ, মুখ ও কথোপকথনের আচরণের উপযুক্ততা মাপা হয়; perception-এ মানুষের audio ও video-তে model-এর প্রতিক্রিয়া দেখা হয়। NVIDIA-র table-এ দুই track-এই তালিকাভুক্ত system-গুলোর ওপরে Griffin-Lite আছে; human-reference score যথাক্রমে 3.92 ও 4.20।
এই score caller-কে সঙ্গী মানুষ কি না জিজ্ঞেস করার থেকে আলাদা কাজ মাপে। তুলনার সেট ও শর্তও আলাদা: generation table-এ cascaded speech-to-avatar system আছে; perception table-এ audio ও video-সহ, অথবা আলাদা row-তে শুধু audio দিয়ে বিচার করা system রয়েছে। Leaderboard NVIDIA-র প্রকাশিত rubric অনুযায়ী ফল সমর্থন করে। এটি Tavus-এর ৪৮% call-study ফল যাচাই করে না বা গ্রাহক-সেবা, tutoring কিংবা healthcare পণ্য হিসেবে Griffin কেমন করবে তা দেখায় না।
Tavus-এর বর্ণনায় systemটি কীভাবে কাজ করে
Tavus Griffin-কে দুই অংশের নকশা বলে বর্ণনা করে। একটি অবিচ্ছিন্ন conversational model caller-এর audio ও video নেয় এবং কী বলতে হবে, কখন বলতে হবে ও কীভাবে প্রকাশ করতে হবে—তার control দেয়। Streaming speech ও video generator সেই control থেকে কণ্ঠ ও চলমান দৃশ্য তৈরি করে। কোম্পানির মতে systemটি কথা বলার সময় শুনতে, মাঝপথে বাধা পেলে থামতে এবং প্রতিটি turn শেষ হওয়ার অপেক্ষা না করে দৃশ্যগত প্রেক্ষাপটে সাড়া দিতে পারে। এগুলো Tavus-এর technical বর্ণনা ও demonstration; BIG CHANGE preview-তে প্রবেশ করেনি বা এর আচরণ মাপেনি।
এই পার্থক্য জরুরি, কারণ তৈরি করা মুখ একাই পুরো interaction নয়। বিরতি, দৃষ্টি ও বাধায় সাড়া দেওয়া ব্যবস্থা caller-এর বোঝা-পাওয়ার অনুভূতি বা তিনি software-এর সঙ্গে কথা বলছেন তা বুঝতে পারা বদলাতে পারে। VideoFDB ফল benchmark protocol-এ conversational আচরণের score-ভিত্তিক তুলনা দেয়। Tavus-এর মানব-call গবেষণা পরিচয়-সংক্রান্ত বিচারের আরও সংকীর্ণ পর্যবেক্ষণ। কোনোটিই দীর্ঘমেয়াদি নির্ভরযোগ্যতা, live deployment-এ disclosure বা ব্যবহারকারীর অবহিত সম্মতি সম্পর্কে প্রকাশ্য প্রমাণের বিকল্প নয়।
প্রবেশাধিকার ও সামনের সিদ্ধান্ত
Tavus বলেছে, Griffin-Lite শুধু নির্বাচিত বিশ্বস্ত পরীক্ষকদের জন্য উন্মুক্ত গবেষণা preview হিসেবে; Tavus-এর গ্রাহকেরা এটি ব্যবহার করতে পারেন না। পরীক্ষার জন্য কোম্পানি অনুরোধের form দেয়। Griffin এখনো তাদের সাধারণ platform বা public API-তে নেই, এবং ঘোষণায় Griffin-নির্দিষ্ট মূল্যও নেই। Tavus-এর বিদ্যমান Phoenix, Raven ও Sparrow model আলাদা বর্তমান product path হিসেবেই রয়েছে।
বৃহত্তরভাবে ছাড়ার আগে disclosure feature ও অতিরিক্ত safety procedure নিয়ে কাজ চলছে বলে কোম্পানি জানিয়েছে। কোনো তারিখ, disclosure-এর বিস্তারিত নকশা বা এসব ব্যবস্থা কার্যকর—এমন প্রমাণ প্রকাশ করেনি। তাই real-time video agent মূল্যায়নকারীর তাৎক্ষণিক প্রশ্নটি নির্দিষ্ট: কলার কীভাবে জানবেন অপর প্রান্তে কে বা কী আছে, এবং Griffin গ্রাহক-পণ্য হওয়ার আগে তা কীভাবে যাচাই করা হবে?
সূত্র ও আরও পড়ুন
- Tavus Research, “Introducing Griffin: The First Human Interaction Model”, 1 অক্টোবর 2026। Vendor-এর system বর্ণনা, গবেষণার protocol ও ফল, availability এবং নিরাপত্তা-সংক্রান্ত বক্তব্য। মানুষের সঙ্গে call-এর গবেষণাটি Tavus চালিয়েছে; এখানে পর্যালোচিত সূত্রে এর স্বাধীন পুনরাবৃত্তি নেই।
- NVIDIA ও David AI, “VideoFDB: Evaluating Full-Duplex Vision-Speech Capabilities in Conversational Agents”, 2 অক্টোবর 2026 যাচাই। Benchmark পরিচালনাকারীর পদ্ধতি ও live leaderboard, Griffin-Lite-এর generation ও perception score-সহ। Model-judge score Tavus-এর human-call গবেষণা থেকে আলাদা।
- Ryan Merket, RuntimeWire, “Tavus says Griffin fooled 48% of testers in one-minute video calls”, 1 অক্টোবর 2026। স্বাধীন প্রতিবেদনে নমুনার আকার ও গ্রাহক-প্রবেশাধিকারের ঘাটতি শনাক্ত করা হয়েছে; নিজস্ব পুনরাবৃত্তি বা hands-on Griffin পরীক্ষা নয়।



