عرض فريق من Caltech وStanford HomeBody، وهو نظام بحثي يوجّه فيه GPT Astra روبوت Unitree G1 في مهام المطبخ عبر استدعاء مهارات للتنقل والمناولة. يستكشف الروبوت الغرفة أولًا ويحفظ مواقع الأشياء التي رآها. وفي العروض التي قدمها الفريق، يجمع أكياس القهوة، ويتخلص من علب محددة، ويسترجع زجاجة دواء من درج بعد أن يغيب الجسم عن مجال رؤية الكاميرا.
التغيير الأبرز
- ما الذي تغيّر: يتيح HomeBody لنموذج رؤية ولغة الوصول إلى سجل مكاني لغرفة استُكشفت، وإلى واجهة مشتركة لمهارات الروبوت. ويختار النموذج المهارة والهدف؛ ثم يخطط البرنامج المحلي للحركة وينفذها، ويبلّغ عن النتيجة.
- لماذا يهم ذلك: يستطيع النموذج التخطيط بين مواقع مختلفة واستخدام التغذية الراجعة من دون تدريب سياسة أفعال جديدة لهذا المطبخ. وتوضح عروض الفريق كيف يمكن جمع الذاكرة والمهارات الحركية الموجودة لتنفيذ مهام أطول.
- ما الذي لا يزال غير محسوم: يعرض الإصدار عروضًا مختارة، لا دراسة مضبوطة لمعدل النجاح. وحتى 27 سبتمبر، لم تُنشر ورقة بحثية ولا شيفرة الروبوت؛ لذلك لا يمكن حتى الآن إعادة إنتاج الأداء المبلغ عنه اعتمادًا على الإصدار.
كيف يتذكر الروبوت الغرفة
يبدأ HomeBody بالاستكشاف. ووفقًا لـ وصف المشروع لطريقة تشغيله، يجمع G1 فيديو واسع الزاوية من هاتف iPhone، ومشاهدات كاميرا D435i، ومسوح LiDAR، ووضعيات المفاصل، ونقاط مسار يختارها النموذج. وتوفر خريطة SLAM المستندة إلى LiDAR هندسة الغرفة المقاسة. ويستخدم Astra هذه المواد لبناء توأم رقمي في Nvidia Isaac Sim. ويوائم الفريق الخريطة وإعادة البناء بحيث تشترك مشاهد الكاميرا المسجلة وموقع الروبوت الحالي في إطار إحداثي واحد.
ويهم هذا الإعداد عندما تشير التعليمات إلى جسم لا يستطيع الروبوت رؤيته حاليًا. ففي طلب الدواء، يقول الفريق إن HomeBody يسترجع إطارات كاميرا محفوظة لتحديد مكان الدرج، ثم يتجه إليه ويفتحه ويلتقط الزجاجة. ويساعد نموذج الغرفة في الملاحة وتذكر المواقع؛ أما الكاميرا المباشرة فتظل موجِّهًا للتفاعل المادي الأخير.
أما العرض التفاعلي لتسلسل العمل في المطبخ على صفحة المشروع، فيوصف صراحة بأنه توضيحي ويجري في الغرفة المعاد بناؤها. وتعرض الصفحة على نحو منفصل مقاطع للروبوت G1 وهو ينفذ مهام المطبخ، وتصف مقاطع الملاحة والالتقاط والوضع وفتح الأدراج بأنها لقطات حقيقية للروبوت. وتوثق تلك المقاطع اختيارات الفريق من التشغيلات، بينما يشرح العرض المحاكى تسلسل التخطيط.
من قرار النموذج إلى الحركة
يتلقى النموذج المهمة ومشهد الكاميرا الحالي وسياق الخريطة وحالة الممسك والملاحظات المسترجعة ونتيجة المهارة السابقة. ويرسل استدعاءً منظمًا يحدد مهارة وهدفًا. وفي مهمة الالتقاط، يكون الهدف نقطة في الصورة على مقياس من 0 إلى 1000، مع اختيار اليد. ويجزّئ نظام الإدراك المحلي الجسم، ويقدّر عمقه من صور الاستريو، ثم يحول الاختيار إلى قبضة ثلاثية الأبعاد. وبعدها يحسب مخطط الذراع مسار الحركة ويفحصه. أما الملاحة فتأخذ هدفًا ثنائي الأبعاد ونقطة اتجاه في إحداثيات الخريطة؛ ويتطلب الوضع نقطة إفلات ثلاثية الأبعاد. ويجمع فتح الدرج محاذاة المقبض والتعشيق والمشي إلى الخلف في فعل واحد.
وتنجز المهارات التصحيحات الصغيرة محليًا. ويصف الفريق تتبعًا بصريًا أثناء الاقتراب ومحاولات إعادة محدودة عند فشل الالتقاط. فإذا فشلت الاستعادة، تعيد المهارة سببًا إلى Astra لاتخاذ قرار آخر. ويعتمد المشي والوصول إلى الأجسام على متحكم شامل للجسم مدرّب مسبقًا يسمى AMO. وتذكر الصفحة أن أوامر الذراع واليد تعمل بتردد 250 هرتز، وأن سياسة AMO تحدّث بتردد 50 هرتز. ويعمل Astra عن بُعد؛ أما الإدراك وتخطيط الحركة والمهارات فتعمل على حاسوب محمول مزود بوحدة RTX 4090.
يختار Astra ما الفعل الذي سيجربه و أين؛ بينما تحدد مكتبة المهارات ووحدات التحكم كيف يتحرك G1. ويقول الفريق إن عروض المطبخ لم تستخدم بيانات تدريب خاصة بالبيئة ولا تعلمًا إضافيًا للسياسة. ومع ذلك، يظل التحكم المدرب مسبقًا وإعادة بناء الغرفة على نحو مفصل جزءًا من الإعداد.
ما الذي تثبته العروض
تصف صفحة المشروع تسلسلين لمهام فعلية في مطبخ لم يسبق رؤيته. في أحدهما يجمع G1 أكياس القهوة ويتخلص من علب الحليب وعصير البرتقال المحددة. وفي الآخر يحدد زجاجة دواء من طلب غير مفصل بما يكفي، ويسترجعها من درج ويسلمها ثم يتخلص من علبة. وتعرض مقاطع المهارات أفعالًا منفردة ومحاولات مسجلة؛ وتقول الصفحة إن معظم المعاينات مسرّعة، وتحدد مقطعًا لالتقاط شيء من الدرج يتضمن محاولات متتابعة.
لا يذكر الإصدار عدد التجارب أو معدل نجاح المهام أو مقارنة بسياسة أفعال متعلمة للرؤية واللغة أو الوقت والتكلفة لكل تشغيل مكتمل في المطبخ. لذلك فهو يعرض بنية للنظام، ولا يقدم ادعاءً مقاسًا بأن التصميم يعمل بموثوقية في مطابخ أخرى. ويشير المستودع العام المرتبط حاليًا إلى أن «الشيفرة ستصدر قريبًا»، ولا يحتوي وسم «الورقة البحثية» في صفحة المشروع على مخطوطة مرتبطة. ويضم المستودع الموقع والرسوم التوضيحية ومقاطع الفيديو، لكن لا يضم تطبيق الروبوت أو ملفات تقييمه. ولم تشغّل BIG CHANGE نظام HomeBody أو تختبر روبوتًا.
وتناول تقرير BIG CHANGE السابق عن GPT-Policy ورقة لفريق آخر بشأن سياق أفعال الروبوت. ولا تحدد مواد HomeBody تلك الورقة بوصفها جزءًا من هذا النظام.
ويسرد الفريق قيودًا عملية: يتطلب بناء التوأم الرقمي وقتًا للإعداد وإنفاقًا على واجهات API؛ كما يؤدي التفكير عن بُعد في Astra إلى فواصل بين المهارات؛ ويحدّ مدى الوصول والمناولة مما يستطيع G1 فعله؛ وقد تسخن محركات الأصابع أكثر من اللازم عند التشغيل المطوّل. وتتطلب المنظومة المحلية حاسوبًا محمولًا مزودًا بوحدة RTX 4090، وقد تحتاج المهارات الأثقل إلى قدرة حوسبة أكبر.
المصادر ومواد إضافية للقراءة
- صفحة مشروع HomeBody لباحثي Caltech وStanford — المصدر الأولي لبنية النظام وعروض المطبخ وإعادة التشغيل المحاكية وواجهات المهارات ومنظومة التحكم والقيود المذكورة. وتحمل الصفحة تاريخ سبتمبر 2026؛ أما المقاطع والأوصاف المختارة فهي أدلة الفريق وليست تقييمًا مستقلًا.
- مستودع HomeBody العام لمختبر TML في Stanford — أحالت إليه صفحة المشروع. وعند التحقق منه في 27 سبتمبر 2026، ذكر ملف README أن الشيفرة ستصدر قريبًا؛ ويحتوي المستودع العام أصول الموقع، لا تطبيق الروبوت ولا ورقة بحثية كاملة.



