تقدم مسودة أولية على arXiv في سبتمبر، بعنوان «التعلّم الروبوتي ضمن السياق باستخدام وكلاء الرؤية واللغة»، نظام GPT-Policy الذي يربط نموذج رؤية ولغة ثابتًا بأدوات الروبوت باستخدام العروض والصور وسجل التفاعل. وتشمل تجاربه مهام الأذرع الروبوتية والاستكشاف المتنقل. لكنها لا تثبت صحة الادعاء المنفصل عن منشور Reddit بشأن GPT-6 Astra وروبوت Unitree G1.

التغيير الأبرز

  • ما الذي تغيّر: يمنح GPT-Policy نموذج رؤية ولغة عامًا طريقة منظمة لتحويل العروض ومشاهد الكاميرا الحالية إلى طلبات لأدوات الروبوت، ثم استخدام ملاحظات التنفيذ لاختيار إجراء آخر من دون تحديث أوزان النموذج الخاصة بالمهمة.
  • لماذا يهم ذلك: يفصل النهج بين الاستدلال البصري العام وفحوص الحركة والتنفيذ. وفي تجاربهم المحدودة، ساعد السياق الإضافي في بعض المهام، بينما احتاجت الأفعال الحساسة للتلامس أحيانًا إلى مراجع محاذاة لأفعال الروبوت.
  • ما الذي ينبغي متابعته: لا يعرض البحث سوى ثلاث تجارب لكل حالة، ويصف تشغيلات بطيئة كثيرة الإخفاقات، شملت اصطدامات الأذرع. ويلزم تكرار التجربة وتوسيع التقييمات وتوفير ضوابط أمان مستقلة قبل أن تكشف النتائج الكثير عن عمل الروبوتات قرب الناس.

ما الذي يفعله GPT-Policy

قُدمت الورقة إلى arXiv في 16 سبتمبر. وتسأل ما إذا كان نموذج رؤية ولغة عامًا يستطيع استخدام الأمثلة والتغذية الراجعة لتنفيذ مهمة انطلاقًا من حالة ابتدائية جديدة، من دون ضبط دقيق أو تغيير معلمات النموذج الخاصة بالمهمة. ويسمي المؤلفون إطارهم GPT-Policy، ويذكرون GPT-6 Astra ضمن النماذج التي قيّموها.

يجمع النظام أنواعًا عدة من السياق: تعليمات المهمة ومشاهد الكاميرا والحالة الحالية، إضافة إلى مقاطع فيديو اختيارية لعروض بشرية، أو عروض روبوتية تتضمن مراجع للأفعال، أو صورة هدف، أو محاولات الروبوت السابقة، أو تفاعل بشري. ويختار مُصرّف السياق انتقالات بصرية مرتبطة بالمهمة ويجمعها مع التعليمات والقيود ومخططات الأدوات. ثم يقترح نموذج الرؤية واللغة طلبًا منظمًا لأداة روبوتية.

يُمرّر الطلب إلى متحكم خاص بنوع الروبوت. ويصف المؤلفون فحص حلول الحركة العكسية، وأخذ عينات من وضعيات ديكارتية، وتوقيت مراجع المفاصل قبل تنفيذ الحركة أو رفضها. ويعيد المتحكم الملاحظات وتغذية التنفيذ الراجعة للقرار التالي للنموذج. يقترح النموذج الأفعال؛ بينما يتحقق منها برنامج خاص بالروبوت وينفذها.

هذه الحلقة هي المساهمة الرئيسية للورقة. فهي تتيح لنموذج رؤية ولغة ثابت تكييف الإجراء التالي استنادًا إلى الأمثلة والنتائج الأخيرة، من دون تحديث بالتدرج. ويصف مصطلح «التعلّم ضمن السياق» هنا طريقة استخدام النظام للمعلومات المقدمة أثناء المهمة. ولا يعني أن النموذج تعلم مهارة جديدة بصورة دائمة أو أن كل روبوت يستطيع استخدام واجهة الأدوات نفسها.

ما الذي قاستْه التجارب

يذكر المؤلفون خمس مجموعات من التجارب عبر عشر مهام روبوتية، مع ثلاث تجارب لكل حالة. وتعرض صفحة المشروع تشغيلات فعلية للروبوت وتنشر نتائج المهام والقرارات والوقت المنقضي. ففي التقاط المنشفة، نجح GPT-6 Astra في تجربتين من أصل ثلاث عند تزويده بفيديو بشري، ولم ينجح في أي من ثلاث من دونه. كما انتقل التقاط الدفتر من صفر نجاح من ثلاثة من دون عرض إلى نجاحين من ثلاثة بوجوده.

وتوضح مهام التلامس لماذا لا يشكل السياق الإضافي حلًا عامًا. ففي فك غطاء زجاجة، حقق فيديو الروبوت نجاحين من ثلاث تجارب؛ وأدى إضافة أفعال روبوتية محاذاة إلى ثلاثة نجاحات من ثلاث. وفي إزالة قابس وإعادة إدخاله، لم يحقق شرط الفيديو وحده أي نجاح في ثلاث تجارب، بينما حقق الفيديو مع مراجع الأفعال نجاحين. وهذه أعداد صغيرة لكل حالة، وليست تقديرات للموثوقية.

كما يذكر المشروع نجاحًا في التجارب الثلاث لترتيب المكعبات والفواكه وفق صورة هدف، وفي مهمتين للتفاعل البشري. ومع سجل التفاعل الذاتي، يذكر البحث نجاحًا في التجارب الثلاث لكل من «ليمونة إلى طبق وردي» و«الاستكشاف المتنقل». وفي المهمة الأخيرة، تجنب الروبوت العقبات بنشاط أثناء البحث عن الهدف؛ وبلغ متوسط الزمن المنقضي 25.53 دقيقة. ويعرض الشكل 1 أيضًا استرجاع أجسام أثناء التنقل. وتوسّع هذه النتائج نطاق البحث إلى ما يتجاوز المناولة فوق الطاولة، مع بقائها مهام مختارة بثلاث تجارب لكل حالة. واستغرقت التشغيلات دقائق: تذكر صفحة المشروع متوسطًا قدره 18.9 دقيقة لالتقاط المنشفة بفيديو بشري، و17.9 دقيقة لمهمة غطاء الزجاجة بفيديو ومراجع أفعال. لذلك يظل زمن الاستجابة وكلفة التشغيل سؤالين عمليين مفتوحين، لا تفصيلين محسومين.

يسرد الملحق B روبوت Morphi Kino إلى جانب YAM وARX X5 ضمن إعدادات الروبوتات التي تصفها الورقة. ويذكر أن Morphi Kino مزود بقاعدة متحركة وخصر ورأس وذراعين، لكل منهما سبعة مفاصل. لذا تتضمن الورقة إعدادًا بمنصة متنقلة إلى جانب منصات الأذرع؛ لكن الملحق لا يذكر Unitree G1.

المهمة المتنقلة في الورقة لا تثبت سيناريو Reddit

يزعم منشور Reddit أن GPT-6 Astra يتحكم في Unitree G1 داخل غرفة غير مألوفة، ويتذكر مواقع الأشياء ويسترجعها لاحقًا استجابة لطلبات مبهمة. ويعرض البحث مهمة «الاستكشاف المتنقل» المختلفة ويصف Morphi Kino بأنه منصة ذات قاعدة متحركة، لكن الورقة ومواد المشروع و مستودع GitHub العام لا تحدد سيناريو G1 المنشور على Reddit بوصفه تجربة من تجارب GPT-Policy. ويظل المنشور ادعاءً منفصلًا لم يُتحقق منه؛ وهذه المقارنة لا تدحضه.

وتحتوي صفحة المشروع للمؤلفين على مقاطع فيديو لتجاربهم، وهي دليل على المهام التي يذكرونها لا تحقق مستقل. ويضم مستودع الشيفرة العام حاليًا محولات لـARX X5 وI2RT/YAM، ويذكر أن مضيفات النشر والمطالبات الخاصة وتسجيلات التشغيل والمعايرة الخاصة بالمواقع وسجل التقييم غير مدرجة في المستودع العام. وتصف قائمة المحولات المستودع المنشور؛ ولا تحدد النطاق الكامل للورقة، التي تعرض أيضًا استكشافًا متنقلًا وتذكر Morphi Kino في الملحق B. ولا توفر المواد المتاحة تفاصيل كافية كي تعيد BIG CHANGE إنتاج التشغيلات المبلغ عنها، ولم نختبر روبوتًا.

ولا تزال حدود التحكم مهمة

تذكر صفحة المشروع تسلسلات أفعال طويلة وتشير إلى صعوبات في التنفيذ. ويقول النقاش إن الاصطدامات الملحوظة بين الذراعين أظهرت قصور الضمانات القائمة عن دعم نشر ذاتي آمن. كما يدعو إلى مراقبة مستقلة للمسافة والتلامس الماديين، إلى جانب تحكم منخفض المستوى أسرع واستعادة أكثر أمانًا. ورفض المتحكم لبعض الحركات غير الصالحة لا يجعله، بحد ذاته، نظام أمان مكتملًا.

تقدم الدراسة نتيجة بحثية ملموسة: قد يساعد السياق نموذج رؤية ولغة عامًا على توجيه أدوات الروبوت في بعض المهام، كما أن نوع السياق مهم. لكن حجم التقييم والوقت لكل تشغيل ونقص مواد إعادة الإنتاج العامة والاصطدامات المبلغ عنها تُبقي النتيجة بعيدة عن إثبات وجود روبوت منزلي شبيه بالبشر يفهم الطلبات المفتوحة وينفذها بموثوقية.

المصادر ومواد إضافية للقراءة