ستمبر کا arXiv پر پیش کیا گیا مقالہ، “VLM ایجنٹس کے ساتھ سیاق میں روبوٹ سیکھنا”، GPT-Policy متعارف کراتا ہے، جو مظاہروں، تصاویر اور باہمی عمل کی تاریخ کے ذریعے ایک مستقل وژن لینگویج ماڈل کو روبوٹ کے ٹولز سے جوڑتا ہے۔ اس کے تجربات میں روبوٹک بازو کے کام اور موبائل کھوج شامل ہیں۔ ان سے Reddit کی اس پوسٹ کا دعویٰ کہ GPT-6 Astra نے Unitree G1 کو کنٹرول کیا ثابت نہیں ہوتا۔

بڑی تبدیلی

  • کیا بدلا: GPT-Policy ایک عمومی وژن لینگویج ماڈل کو مظاہروں اور کیمرے کے موجودہ نظاروں سے روبوٹ ٹولز کے لیے منظم درخواستیں بنانے کا طریقہ دیتا ہے؛ پھر عملدرآمد کی رائے کے ذریعے ماڈل اپنے اگلے اقدام کا انتخاب کرتا ہے، جبکہ کام کے لیے مخصوص ماڈل وزن اپ ڈیٹ نہیں کیے جاتے۔
  • یہ کیوں اہم ہے: یہ طریقہ وسیع بصری استدلال کو حرکت کی جانچ اور عملدرآمد سے الگ رکھتا ہے۔ مصنفین کی محدود آزمائشوں میں اضافی سیاق نے کچھ کاموں میں مدد دی، جبکہ جسمانی رابطے سے حساس اقدامات میں کبھی کبھی روبوٹ کے اعمال سے ہم آہنگ حوالوں کی ضرورت پڑی۔
  • کس بات پر نظر رکھیں: مقالہ ہر حالت میں صرف تین آزمائشیں رپورٹ کرتا ہے اور سست، ناکامی کے خدشے والے عمل بیان کرتا ہے، جن میں بازوؤں کا ٹکرا جانا بھی شامل ہے۔ ان نتائج سے یہ سمجھنے سے پہلے کہ روبوٹ لوگوں کے آس پاس کام کر سکتے ہیں، نتائج کو دوبارہ پیدا کرنا، بڑے پیمانے پر جانچ اور آزاد حفاظتی کنٹرول اہم ہیں۔

GPT-Policy کیا کرتا ہے

یہ مقالہ 16 ستمبر کو arXiv پر جمع کرایا گیا تھا۔ اس میں پوچھا گیا ہے کہ آیا ایک عمومی وژن لینگویج ماڈل، نئے ابتدائی حالات سے کام انجام دینے کے لیے مثالوں اور رائے سے فائدہ اٹھا سکتا ہے، بغیر فائن ٹیوننگ یا کام سے مخصوص ماڈل پیرامیٹرز بدلے۔ مصنفین اپنے فریم ورک کو GPT-Policy کہتے ہیں اور جانچے گئے ماڈلز میں GPT-6 Astra کا نام بھی شامل کرتے ہیں۔

یہ نظام کئی طرح کا سیاق یکجا کرتا ہے: کام کی ہدایت، کیمرے کے موجودہ مناظر اور حالت، اور اختیاری طور پر انسانی مظاہرے کی ویڈیوز، اعمال کے حوالوں سمیت روبوٹ کے مظاہرے، ہدف کی تصویر، روبوٹ کی سابقہ کوششیں یا انسانی تعامل۔ سیاق مرتب کرنے والا متعلقہ بصری تبدیلیاں منتخب کرتا اور انہیں ہدایات، پابندیوں اور ٹول کے خاکوں کے ساتھ جوڑتا ہے۔ پھر VLM روبوٹ ٹول کے لیے ایک منظم درخواست تجویز کرتا ہے۔

یہ درخواست متعلقہ روبوٹ کے لیے مخصوص کنٹرولر کو بھیجی جاتی ہے۔ مصنفین بیان کرتے ہیں کہ حرکت انجام دینے یا مسترد کرنے سے پہلے الٹا حرکیات کے حل جانچے جاتے ہیں، کارتسیئن وضع کے نمونے لیے جاتے ہیں اور جوڑوں کی حرکت کے حوالہ جاتی وقت مقرر کیے جاتے ہیں۔ کنٹرولر اگلے ماڈل فیصلے کے لیے مشاہدات اور عملدرآمد کی رائے واپس کرتا ہے۔ ماڈل اقدامات تجویز کرتا ہے؛ روبوٹ کے لیے مخصوص کوڈ ان کی توثیق اور عملدرآمد کرتا ہے۔

یہ چکر مقالے کی بنیادی اختراع ہے۔ اس سے ایک مستقل VLM کو تدریجی تازہ کاری کے بغیر، مثالوں اور حالیہ نتائج کے مطابق اگلا اقدام ڈھالنے کا موقع ملتا ہے۔ یہاں “سیاق میں سیکھنے” سے مراد وہ معلومات ہیں جو کام کے دوران فراہم کی جاتی ہیں۔ اس کا یہ مطلب نہیں کہ ماڈل نے کوئی نئی مہارت مستقل طور پر سیکھ لی یا ہر روبوٹ یہی ٹول انٹرفیس چلا سکتا ہے۔

آزمائشوں میں کیا ناپا گیا

مصنفین دس روبوٹ کاموں میں تجربات کی پانچ اقسام اور ہر حالت میں تین آزمائشوں کی اطلاع دیتے ہیں۔ ان کا پروجیکٹ صفحہ حقیقی روبوٹ کے عمل درج کرتا اور کام کے نتائج، فیصلے اور دورانیے شائع کرتا ہے۔ تولیہ اٹھانے کے کام میں GPT-6 Astra انسانی ویڈیو کے ساتھ تین میں سے دو بار کامیاب ہوا، اور اس ویڈیو کے بغیر تینوں میں ناکام رہا۔ نوٹ بک اٹھانے کے کام میں بھی مظاہرے کے بغیر تین میں سے کوئی آزمائش کامیاب نہیں ہوئی، جبکہ مظاہرے کے ساتھ دو کامیاب ہوئیں۔

جسمانی رابطے والے کام بتاتے ہیں کہ اضافی سیاق کوئی عمومی حل کیوں نہیں۔ بوتل کا ڈھکن کھولنے میں روبوٹ کی ویڈیو سے تین میں سے دو بار کامیابی ملی؛ اس کے ساتھ روبوٹ کے اعمال کے ہم آہنگ حوالوں کو شامل کرنے پر تینوں آزمائشیں کامیاب ہوئیں۔ پلگ نکال کر دوبارہ لگانے میں صرف ویڈیو والی حالت تینوں بار ناکام رہی، جبکہ ویڈیو اور عمل کے حوالوں کے ساتھ تین میں سے دو بار کامیابی ملی۔ یہ ہر حالت میں کامیابی کی کم تعداد ہے، قابلِ اعتماد کارکردگی کا تخمینہ نہیں۔

پروجیکٹ میں ہدف کی تصویر دیکھ کر بلاکس اور پھل ترتیب دینے کے کاموں، اور انسانی تعامل کے دونوں کاموں میں بھی تین میں سے تین کامیابیاں رپورٹ کی گئی ہیں۔ سابقہ خود تعامل کی تاریخ استعمال کرتے ہوئے مقالے میں “لیموں کو گلابی پلیٹ پر رکھنا” اور “موبائل کھوج” دونوں میں تین میں سے تین کامیابیاں درج ہیں۔ دوسرے کام میں روبوٹ نے ہدف تلاش کرتے ہوئے رکاوٹوں سے سرگرمی کے ساتھ گریز کیا؛ اوسط دورانیہ 25.53 منٹ تھا۔ شکل 1 میں موبائل پلیٹ فارم سے چیز واپس لانا بھی دکھایا گیا ہے۔ ان نتائج سے میز پر چیزیں سنبھالنے کے علاوہ بھی کام سامنے آتے ہیں، مگر یہ ہر حالت میں صرف تین آزمائشوں والے منتخب کام ہیں۔ عمل میں منٹ لگے: پروجیکٹ صفحے کے مطابق انسانی ویڈیو کے ساتھ تولیہ اٹھانے میں اوسطاً 18.9 منٹ اور ویڈیو و عمل کے حوالوں کے ساتھ بوتل کا ڈھکن کھولنے میں 17.9 منٹ لگے۔ اس لیے تاخیر اور چلانے کی لاگت عملی سوال ہیں، حل شدہ معاملات نہیں۔

ضمیمہ B میں مقالے کے بیان کردہ روبوٹ کی ساختوں میں YAM اور ARX X5 کے ساتھ Morphi Kino بھی درج ہے۔ اس کے مطابق Morphi Kino کے پاس موبائل بیس، کمر، سر اور دو سات سات جوڑوں والے بازو ہیں۔ لہٰذا مقالے میں بازو والے پلیٹ فارموں کے علاوہ موبائل پلیٹ فارم کی ساخت بھی شامل ہے؛ ضمیمہ میں Unitree G1 کا نام نہیں ہے۔

مقالے کا موبائل کام Reddit کے منظرنامے کی تصدیق نہیں کرتا

یہ Reddit پوسٹ دعویٰ کرتی ہے کہ GPT-6 Astra ایک نامانوس کمرے میں Unitree G1 کو کنٹرول کرتا، چیزوں کی جگہ یاد رکھتا اور مبہم درخواستوں پر بعد میں انہیں اٹھاتا ہے۔ مقالہ “موبائل کھوج” کا الگ کام رپورٹ کرتا اور Morphi Kino کو موبائل بیس والے پلیٹ فارم کے طور پر بیان کرتا ہے، مگر مقالہ، پروجیکٹ کا مواد اور عوامی GitHub ذخیرہ Reddit پوسٹ کے G1 والے منظرنامے کو GPT-Policy کا تجربہ قرار نہیں دیتے۔ یہ پوسٹ ایک الگ، غیر مصدقہ دعویٰ ہے؛ اس تقابل سے اس کی تردید بھی نہیں ہوتی۔

مصنفین کے پروجیکٹ صفحے پر ان کے تجربات کی ویڈیوز موجود ہیں۔ یہ ان کے رپورٹ کردہ کاموں کے شواہد ہیں، آزادانہ توثیق نہیں۔ عوامی کوڈ ذخیرہ میں فی الحال ARX X5 اور I2RT/YAM کے اڈاپٹر درج ہیں؛ اس میں تعیناتی کے میزبان، نجی پرامپٹس، عمل کے ریکارڈ، مقام کے مطابق کیلیبریشن اور جانچ کی تاریخ شامل نہیں، ایسا ذخیرہ خود کہتا ہے۔ اڈاپٹر کی یہ فہرست جاری کردہ ذخیرے کی وضاحت ہے، مقالے کے پورے دائرے کی نہیں؛ مقالہ موبائل کھوج بھی رپورٹ کرتا اور ضمیمہ B میں Morphi Kino کا نام بھی لیتا ہے۔ دستیاب مواد سے BIG CHANGE کے لیے رپورٹ کردہ عمل کو دوبارہ پیدا کرنے کی خاطر کافی تفصیل نہیں ملتی، اور ہم نے کسی روبوٹ کی جانچ نہیں کی۔

کنٹرول کی حد اب بھی اہم ہے

پروجیکٹ صفحہ طویل سلسلہ وار اقدامات اور عملدرآمد کی دشواریوں کا ذکر کرتا ہے۔ مصنفین کے مطابق، بازوؤں کے درمیان ٹکراؤ سے ظاہر ہوا کہ موجودہ حفاظتی تدابیر خودمختار محفوظ استعمال کے لیے ناکافی تھیں۔ وہ جسمانی فاصلے اور رابطے کی آزاد نگرانی، زیادہ تیز نچلی سطح کے کنٹرول اور محفوظ طریقۂ بحالی کی ضرورت بتاتے ہیں۔ کچھ غلط حرکات مسترد کر دینے والا کنٹرولر، صرف اسی بنا پر، مکمل حفاظتی نظام نہیں بن جاتا۔

یہ مطالعہ ایک ٹھوس تحقیقی نتیجہ پیش کرتا ہے: سیاق ایک عمومی VLM کو بعض کاموں میں روبوٹ ٹولز کی رہنمائی میں مدد دے سکتا ہے، اور سیاق کی قسم اہم ہے۔ جانچ کا محدود حجم، ہر عمل کا دورانیہ، عوامی طور پر دوبارہ عمل کرنے کے نامکمل مواد اور رپورٹ کردہ ٹکراؤ، ان نتائج کو ایسے گھریلو ہیومنائڈ روبوٹ کا ثبوت بننے سے بہت دور رکھتے ہیں جو کھلی نوعیت کی درخواستوں کو قابلِ اعتماد طریقے سے سمجھے اور پورا کرے۔

ماخذ اور مزید مطالعہ