تقول تافوس إن 26 من أصل 54 شخصاً في مكالمات فيديو مدتها دقيقة مع نموذج Griffin-Lite الجديد اعتقدوا أنهم تحدثوا إلى شخص حقيقي. وهذه نتيجة لافتة من دراسة أجرتها تافوس، لكنها تقيس الاستجابات لمكالمة وسؤال محددين. ولا يزال Griffin-Lite معاينة بحثية لمختبرين مختارين، وتقول تافوس إنها تطوّر ضمانات للإفصاح قبل إتاحته للعملاء.

التغيير الأبرز

  • ما الذي تغيّر: وجّهت تافوس أبحاثها في المساعدات المرئية نحو نظام يستمع ويراقب ويولّد وجهاً وصوتاً أثناء المحادثة نفسها. وفي مكالماتها القصيرة التي أجرتها الشركة، اعتقد 26 من أصل 54 شخصاً أن النموذج إنسان.
  • لماذا يهم ذلك: بالنسبة إلى الفرق التي تصمم وكلاء الفيديو، قد يجعل توقيت الحوار والفيديو التعبيري التفاعل مع الواجهة أسهل. وتوضح الدراسة نفسها لماذا لا يمكن تأجيل إبلاغ المتصلين بأنهم يتحدثون إلى ذكاء اصطناعي.
  • ما الذي ينبغي متابعته: يقتصر Griffin-Lite على مختبرين بحثيين مختارين. وتقول تافوس إن ميزات الإفصاح وإجراءات السلامة الإضافية قيد التطوير؛ ولم تعلن بعد عن شكلها أو مدى فاعليتها، ولا عن إتاحة النموذج للعملاء أو سعر خاص بـGriffin.

ما الذي قاستْه نتيجة 26 من أصل 54

في عرض تافوس البحثي المنشور في الأول من أكتوبر، أُبلغ المشاركون بأنهم سيُوصَلون بمشارك آخر لإجراء مكالمة فيديو مدتها دقيقة حول ما يتطلعون إليه هذا العام. لكن الطرف الآخر كان شخصية افتراضية تعمل بالذكاء الاصطناعي من تافوس، ويشغّلها Griffin-Lite. وبعد المكالمة، قيّم المشاركون التفاعل وسُئلوا عما إذا كانوا قد تساءلوا إن كان الطرف الآخر غير حقيقي. ثم كشفت تافوس أن الطرف الآخر كان ذكاءً اصطناعياً.

من بين 54 مشاركاً تفاعلوا مع Griffin-Lite، قال 26 إن الطرف الآخر كان شخصاً حقيقياً، أي نحو 48%. وتقول تافوس إنها استخدمت البروتوكول نفسه مع نظامها السابق Phoenix-4.5 وSparrow-2 وRaven-1؛ وقال مشارك واحد من أصل 41 في تلك المجموعة إن الطرف الآخر كان إنساناً. هذه مجموعتان مختلفتان من المتصلين، وليست مقارنة قبل وبعد للأشخاص أنفسهم. ولا يثبت الإعلان كيف ستتغير هذه الاستجابة في مكالمات أطول أو مع موضوعات مختلفة أو في الاستخدام اليومي حين يعلم الناس باحتمال ظهور وكيل ذكاء اصطناعي.

تصف تافوس النتيجة بأنها اجتياز لاختبار تورنغ بالفيديو في الوقت الفعلي. وهذا وصف الشركة لدراستها التي استغرقت دقيقة، وليس شهادة عامة على قدرة المحادثة الشبيهة بالبشر. تقرير RuntimeWire المستقل عن الإطلاق يتعامل كذلك مع نسبة 48% بوصفها نتيجة محدودة أجرتها الشركة، ويشير إلى أن المعاينة لا تزال غير متاحة للعملاء. وتُعد الدراسة دليلاً على أحكام المشاركين في الظروف المحددة لها؛ لكنها ليست معدل خداع أُعيد التحقق منه بصورة مستقلة.

مقياس منفصل يختبر جودة التفاعل

تعطي لوحة VideoFDB من NVIDIA نموذج Griffin-Lite درجة 3.83 من 5 في التوليد و3.73 في الإدراك. ويستخدم المقياس مقاطع من مكالمات فيديو حقيقية وحَكَماً لغوياً مبنياً على معايير محددة. ويقيّم التوليد مدى ملاءمة صوت النموذج ووجهه وسلوكه الحواري؛ أما الإدراك فيقيّم استجاباته لصوت الشخص وصورته. ويضع جدول NVIDIA نموذج Griffin-Lite أعلى من الأنظمة المدرجة في المسارين، بينما تبلغ درجات المرجع البشري 3.92 و4.20 على التوالي.

تقيس هذه الدرجات مهمة مختلفة عن سؤال المتصلين إن كانوا يعتقدون أن الطرف الآخر إنسان. كما تختلف مجموعات المقارنة والظروف: يتضمن جدول التوليد أنظمة متسلسلة لتحويل الكلام إلى شخصية رمزية، بينما يشمل جدول الإدراك أنظمة قُيّمت بالصوت والفيديو أو، في صفوف منفصلة، بالصوت وحده. وتدعم لوحة المتصدرين نتيجة وفق المعايير المنشورة لدى NVIDIA. لكنها لا تثبت صحة نسبة 48% في دراسة مكالمات تافوس، ولا تُظهر كيف سيؤدي Griffin كمنتج لخدمة العملاء أو التدريس أو الرعاية الصحية.

ما الذي تقول تافوس إن النظام يفعله

تصف تافوس Griffin بأنه تصميم من جزأين. يستقبل نموذج حواري متواصل صوت المتصل وفيديوه، ويصدر تعليمات بشأن ما سيُقال ومتى وكيفية التعبير عنه. ثم يحوّل مولّدا الكلام والفيديو المتدفقان تلك التعليمات إلى صوت ومشهد متحرك. وتقول الشركة إن النظام يستطيع الاستماع أثناء التحدث، وإفساح المجال عند مقاطعته، والاستجابة للسياق المرئي بدلاً من انتظار انتهاء كل دور حواري. هذه أوصاف وعروض تقنية من تافوس؛ ولم تطّلع BIG CHANGE على المعاينة أو تقِس أداء النظام.

هذا التمييز مهم لأن الوجه المُولّد وحده لا يشكّل التفاعل بأكمله. فقد يغيّر النظام الذي يستجيب للصمت ونظرات العين والمقاطعات شعور المتصل بأنه مفهوم، أو إدراكه أنه يتحدث إلى برنامج. وتقدم نتيجة VideoFDB مقارنة مُقيّمة للسلوك الحواري وفق بروتوكول معياري. أما دراسة المكالمات البشرية لدى تافوس فتقدم ملاحظة أضيق نطاقاً عن أحكام المشاركين بشأن هوية الطرف الآخر. ولا يغني أي منهما عن أدلة عامة على الموثوقية المستمرة، أو الإفصاح عند النشر الفعلي، أو الموافقة المستنيرة من المستخدمين.

إمكانية الوصول والقرار المقبل

تقول تافوس إن Griffin-Lite متاح حصراً لمختبرين موثوقين تختارهم الشركة بوصفه معاينة بحثية، وليس متاحاً لعملاء تافوس. وتوفر الشركة نموذجاً لطلب المشاركة في الاختبار. ولم يُضف Griffin بعد إلى منصتها العامة أو واجهة API المتاحة للجمهور، كما لا يذكر الإعلان سعراً خاصاً به. وتظل نماذج Phoenix وRaven وSparrow الحالية لدى تافوس مساراً منفصلاً للمنتجات.

تقول الشركة إنها تعمل على ميزات للإفصاح وإجراءات سلامة إضافية قبل طرح أوسع. ولم تنشر موعداً أو تصميماً مفصلاً للإفصاح أو دليلاً على فاعلية هذه التدابير. لذلك يظل السؤال المباشر أمام من يقيّم وكيلاً للفيديو في الوقت الفعلي محدداً: كيف سيعرف المتصل مَن أو ما الموجود على الطرف الآخر، وكيف سيُتحقق من ذلك قبل أن يصبح Griffin منتجاً للعملاء؟

المصادر ومزيد من القراءة