دنیا ٹھہری نہیں ہے۔RSS
BIG CHANGE.

Markdown ایڈیشن

AI-translated from English; not yet reviewed by a fluent editor.

# GPT-Policy روبوٹک بازو اور موبائل کھوج کے کاموں میں سیاق کو آزماتا ہے

> ستمبر میں شائع ہونے والا ایک قبل از اشاعت مقالہ روبوٹک بازو کے تجربات کے ساتھ موبائل کھوج کے کام کی تین آزمائشوں کی اطلاع دیتا ہے۔ یہ GPT-6 Astra اور Unitree G1 سے متعلق Reddit کے الگ دعوے کی تصدیق نہیں کرتا۔

By BIG CHANGE Editorial

Published: 2026-09-27T06:11:48.387Z
Updated: 2026-09-27T06:11:48.387Z
Canonical: https://bigchange.ai/blog/gpt-policy-robot-learning-vlm-agents

![A conceptual robot arm reaches toward a bottle cap on a workbench beneath a mounted camera.](https://bigchange.ai/api/media/file/gpt-policy-robot-arm-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

ستمبر کا [arXiv پر پیش کیا گیا مقالہ، “VLM ایجنٹس کے ساتھ سیاق میں روبوٹ سیکھنا”](https://arxiv.org/html/2609.19138v1)، GPT-Policy متعارف کراتا ہے، جو مظاہروں، تصاویر اور باہمی عمل کی تاریخ کے ذریعے ایک مستقل وژن لینگویج ماڈل کو روبوٹ کے ٹولز سے جوڑتا ہے۔ اس کے تجربات میں روبوٹک بازو کے کام اور موبائل کھوج شامل ہیں۔ ان سے [Reddit کی اس پوسٹ کا دعویٰ کہ GPT-6 Astra نے Unitree G1 کو کنٹرول کیا](https://www.reddit.com/r/singularity/s/tjaYXdzfnI) ثابت نہیں ہوتا۔

## بڑی تبدیلی

- **کیا بدلا:** GPT-Policy ایک عمومی وژن لینگویج ماڈل کو مظاہروں اور کیمرے کے موجودہ نظاروں سے روبوٹ ٹولز کے لیے منظم درخواستیں بنانے کا طریقہ دیتا ہے؛ پھر عملدرآمد کی رائے کے ذریعے ماڈل اپنے اگلے اقدام کا انتخاب کرتا ہے، جبکہ کام کے لیے مخصوص ماڈل وزن اپ ڈیٹ نہیں کیے جاتے۔
- **یہ کیوں اہم ہے:** یہ طریقہ وسیع بصری استدلال کو حرکت کی جانچ اور عملدرآمد سے الگ رکھتا ہے۔ مصنفین کی محدود آزمائشوں میں اضافی سیاق نے کچھ کاموں میں مدد دی، جبکہ جسمانی رابطے سے حساس اقدامات میں کبھی کبھی روبوٹ کے اعمال سے ہم آہنگ حوالوں کی ضرورت پڑی۔
- **کس بات پر نظر رکھیں:** مقالہ ہر حالت میں صرف تین آزمائشیں رپورٹ کرتا ہے اور سست، ناکامی کے خدشے والے عمل بیان کرتا ہے، جن میں بازوؤں کا ٹکرا جانا بھی شامل ہے۔ ان نتائج سے یہ سمجھنے سے پہلے کہ روبوٹ لوگوں کے آس پاس کام کر سکتے ہیں، نتائج کو دوبارہ پیدا کرنا، بڑے پیمانے پر جانچ اور آزاد حفاظتی کنٹرول اہم ہیں۔

## GPT-Policy کیا کرتا ہے

یہ مقالہ 16 ستمبر کو arXiv پر جمع کرایا گیا تھا۔ اس میں پوچھا گیا ہے کہ آیا ایک عمومی وژن لینگویج ماڈل، نئے ابتدائی حالات سے کام انجام دینے کے لیے مثالوں اور رائے سے فائدہ اٹھا سکتا ہے، بغیر فائن ٹیوننگ یا کام سے مخصوص ماڈل پیرامیٹرز بدلے۔ مصنفین اپنے فریم ورک کو GPT-Policy کہتے ہیں اور جانچے گئے ماڈلز میں GPT-6 Astra کا نام بھی شامل کرتے ہیں۔

یہ نظام کئی طرح کا سیاق یکجا کرتا ہے: کام کی ہدایت، کیمرے کے موجودہ مناظر اور حالت، اور اختیاری طور پر انسانی مظاہرے کی ویڈیوز، اعمال کے حوالوں سمیت روبوٹ کے مظاہرے، ہدف کی تصویر، روبوٹ کی سابقہ کوششیں یا انسانی تعامل۔ سیاق مرتب کرنے والا متعلقہ بصری تبدیلیاں منتخب کرتا اور انہیں ہدایات، پابندیوں اور ٹول کے خاکوں کے ساتھ جوڑتا ہے۔ پھر VLM روبوٹ ٹول کے لیے ایک منظم درخواست تجویز کرتا ہے۔

یہ درخواست متعلقہ روبوٹ کے لیے مخصوص کنٹرولر کو بھیجی جاتی ہے۔ مصنفین بیان کرتے ہیں کہ حرکت انجام دینے یا مسترد کرنے سے پہلے الٹا حرکیات کے حل جانچے جاتے ہیں، کارتسیئن وضع کے نمونے لیے جاتے ہیں اور جوڑوں کی حرکت کے حوالہ جاتی وقت مقرر کیے جاتے ہیں۔ کنٹرولر اگلے ماڈل فیصلے کے لیے مشاہدات اور عملدرآمد کی رائے واپس کرتا ہے۔ ماڈل اقدامات تجویز کرتا ہے؛ روبوٹ کے لیے مخصوص کوڈ ان کی توثیق اور عملدرآمد کرتا ہے۔

یہ چکر مقالے کی بنیادی اختراع ہے۔ اس سے ایک مستقل VLM کو تدریجی تازہ کاری کے بغیر، مثالوں اور حالیہ نتائج کے مطابق اگلا اقدام ڈھالنے کا موقع ملتا ہے۔ یہاں “سیاق میں سیکھنے” سے مراد وہ معلومات ہیں جو کام کے دوران فراہم کی جاتی ہیں۔ اس کا یہ مطلب نہیں کہ ماڈل نے کوئی نئی مہارت مستقل طور پر سیکھ لی یا ہر روبوٹ یہی ٹول انٹرفیس چلا سکتا ہے۔

## آزمائشوں میں کیا ناپا گیا

مصنفین دس روبوٹ کاموں میں تجربات کی پانچ اقسام اور ہر حالت میں تین آزمائشوں کی اطلاع دیتے ہیں۔ ان کا [پروجیکٹ صفحہ](https://cheng-haha.github.io/GPT-Policy/) حقیقی روبوٹ کے عمل درج کرتا اور کام کے نتائج، فیصلے اور دورانیے شائع کرتا ہے۔ تولیہ اٹھانے کے کام میں GPT-6 Astra انسانی ویڈیو کے ساتھ تین میں سے دو بار کامیاب ہوا، اور اس ویڈیو کے بغیر تینوں میں ناکام رہا۔ نوٹ بک اٹھانے کے کام میں بھی مظاہرے کے بغیر تین میں سے کوئی آزمائش کامیاب نہیں ہوئی، جبکہ مظاہرے کے ساتھ دو کامیاب ہوئیں۔

جسمانی رابطے والے کام بتاتے ہیں کہ اضافی سیاق کوئی عمومی حل کیوں نہیں۔ بوتل کا ڈھکن کھولنے میں روبوٹ کی ویڈیو سے تین میں سے دو بار کامیابی ملی؛ اس کے ساتھ روبوٹ کے اعمال کے ہم آہنگ حوالوں کو شامل کرنے پر تینوں آزمائشیں کامیاب ہوئیں۔ پلگ نکال کر دوبارہ لگانے میں صرف ویڈیو والی حالت تینوں بار ناکام رہی، جبکہ ویڈیو اور عمل کے حوالوں کے ساتھ تین میں سے دو بار کامیابی ملی۔ یہ ہر حالت میں کامیابی کی کم تعداد ہے، قابلِ اعتماد کارکردگی کا تخمینہ نہیں۔

پروجیکٹ میں ہدف کی تصویر دیکھ کر بلاکس اور پھل ترتیب دینے کے کاموں، اور انسانی تعامل کے دونوں کاموں میں بھی تین میں سے تین کامیابیاں رپورٹ کی گئی ہیں۔ سابقہ خود تعامل کی تاریخ استعمال کرتے ہوئے مقالے میں “لیموں کو گلابی پلیٹ پر رکھنا” اور “موبائل کھوج” دونوں میں تین میں سے تین کامیابیاں درج ہیں۔ دوسرے کام میں روبوٹ نے ہدف تلاش کرتے ہوئے رکاوٹوں سے سرگرمی کے ساتھ گریز کیا؛ اوسط دورانیہ 25.53 منٹ تھا۔ شکل 1 میں موبائل پلیٹ فارم سے چیز واپس لانا بھی دکھایا گیا ہے۔ ان نتائج سے میز پر چیزیں سنبھالنے کے علاوہ بھی کام سامنے آتے ہیں، مگر یہ ہر حالت میں صرف تین آزمائشوں والے منتخب کام ہیں۔ عمل میں منٹ لگے: پروجیکٹ صفحے کے مطابق انسانی ویڈیو کے ساتھ تولیہ اٹھانے میں اوسطاً 18.9 منٹ اور ویڈیو و عمل کے حوالوں کے ساتھ بوتل کا ڈھکن کھولنے میں 17.9 منٹ لگے۔ اس لیے تاخیر اور چلانے کی لاگت عملی سوال ہیں، حل شدہ معاملات نہیں۔

ضمیمہ B میں مقالے کے بیان کردہ روبوٹ کی ساختوں میں YAM اور ARX X5 کے ساتھ Morphi Kino بھی درج ہے۔ اس کے مطابق Morphi Kino کے پاس موبائل بیس، کمر، سر اور دو سات سات جوڑوں والے بازو ہیں۔ لہٰذا مقالے میں بازو والے پلیٹ فارموں کے علاوہ موبائل پلیٹ فارم کی ساخت بھی شامل ہے؛ ضمیمہ میں Unitree G1 کا نام نہیں ہے۔

## مقالے کا موبائل کام Reddit کے منظرنامے کی تصدیق نہیں کرتا

یہ [Reddit پوسٹ](https://www.reddit.com/r/singularity/s/tjaYXdzfnI) دعویٰ کرتی ہے کہ GPT-6 Astra ایک نامانوس کمرے میں Unitree G1 کو کنٹرول کرتا، چیزوں کی جگہ یاد رکھتا اور مبہم درخواستوں پر بعد میں انہیں اٹھاتا ہے۔ مقالہ “موبائل کھوج” کا الگ کام رپورٹ کرتا اور Morphi Kino کو موبائل بیس والے پلیٹ فارم کے طور پر بیان کرتا ہے، مگر مقالہ، پروجیکٹ کا مواد اور [عوامی GitHub ذخیرہ](https://github.com/cheng-haha/GPT-Policy) Reddit پوسٹ کے G1 والے منظرنامے کو GPT-Policy کا تجربہ قرار نہیں دیتے۔ یہ پوسٹ ایک الگ، غیر مصدقہ دعویٰ ہے؛ اس تقابل سے اس کی تردید بھی نہیں ہوتی۔

مصنفین کے [پروجیکٹ صفحے](https://cheng-haha.github.io/GPT-Policy/) پر ان کے تجربات کی ویڈیوز موجود ہیں۔ یہ ان کے رپورٹ کردہ کاموں کے شواہد ہیں، آزادانہ توثیق نہیں۔ عوامی [کوڈ ذخیرہ](https://github.com/cheng-haha/GPT-Policy) میں فی الحال ARX X5 اور I2RT/YAM کے اڈاپٹر درج ہیں؛ اس میں تعیناتی کے میزبان، نجی پرامپٹس، عمل کے ریکارڈ، مقام کے مطابق کیلیبریشن اور جانچ کی تاریخ شامل نہیں، ایسا ذخیرہ خود کہتا ہے۔ اڈاپٹر کی یہ فہرست جاری کردہ ذخیرے کی وضاحت ہے، مقالے کے پورے دائرے کی نہیں؛ مقالہ موبائل کھوج بھی رپورٹ کرتا اور ضمیمہ B میں Morphi Kino کا نام بھی لیتا ہے۔ دستیاب مواد سے BIG CHANGE کے لیے رپورٹ کردہ عمل کو دوبارہ پیدا کرنے کی خاطر کافی تفصیل نہیں ملتی، اور ہم نے کسی روبوٹ کی جانچ نہیں کی۔

## کنٹرول کی حد اب بھی اہم ہے

پروجیکٹ صفحہ طویل سلسلہ وار اقدامات اور عملدرآمد کی دشواریوں کا ذکر کرتا ہے۔ مصنفین کے مطابق، بازوؤں کے درمیان ٹکراؤ سے ظاہر ہوا کہ موجودہ حفاظتی تدابیر خودمختار محفوظ استعمال کے لیے ناکافی تھیں۔ وہ جسمانی فاصلے اور رابطے کی آزاد نگرانی، زیادہ تیز نچلی سطح کے کنٹرول اور محفوظ طریقۂ بحالی کی ضرورت بتاتے ہیں۔ کچھ غلط حرکات مسترد کر دینے والا کنٹرولر، صرف اسی بنا پر، مکمل حفاظتی نظام نہیں بن جاتا۔

یہ مطالعہ ایک ٹھوس تحقیقی نتیجہ پیش کرتا ہے: سیاق ایک عمومی VLM کو بعض کاموں میں روبوٹ ٹولز کی رہنمائی میں مدد دے سکتا ہے، اور سیاق کی قسم اہم ہے۔ جانچ کا محدود حجم، ہر عمل کا دورانیہ، عوامی طور پر دوبارہ عمل کرنے کے نامکمل مواد اور رپورٹ کردہ ٹکراؤ، ان نتائج کو ایسے گھریلو ہیومنائڈ روبوٹ کا ثبوت بننے سے بہت دور رکھتے ہیں جو کھلی نوعیت کی درخواستوں کو قابلِ اعتماد طریقے سے سمجھے اور پورا کرے۔

## ماخذ اور مزید مطالعہ

- [Cheng اور ساتھی، “In-Context Robot Learning with VLM Agents” (arXiv:2609.19138، نسخہ 1، 16 ستمبر 2026 کو جمع کرایا گیا)](https://arxiv.org/abs/2609.19138) — طریقۂ کار، جانچ اور بیان کردہ حدود کا بنیادی قبل از اشاعت مقالہ؛ ہم مرتبہ جائزے سے منظور شدہ ثبوت یا تعیناتی کی رپورٹ نہیں۔
- [مصنفین کا GPT-Policy پروجیکٹ صفحہ](https://cheng-haha.github.io/GPT-Policy/) — تجربات کی تفصیل، ویڈیوز، ہر حالت کے نتائج اور بحث۔ یہ خود مصنفین کا مواد ہے۔
- [مصنفین کا GPT-Policy کا عوامی کوڈ ذخیرہ](https://github.com/cheng-haha/GPT-Policy) — موجودہ روبوٹک بازو کے اڈاپٹرز اور عوامی ذخیرے سے خارج چیزوں کی دستاویز؛ ذخیرے کی دستیابی اکیلے یہ ثابت نہیں کرتی کہ رپورٹ کردہ تجربہ دوبارہ کیا جا سکتا ہے۔
- [اس رپورٹ کا سبب بننے والی Reddit پوسٹ](https://www.reddit.com/r/singularity/s/tjaYXdzfnI) — Unitree G1 کے دعوے کا ماخذ؛ پوسٹ اس منظرنامے کو مقالے سے جوڑنے کا ثبوت پیش نہیں کرتی۔

## Sources

- [Cheng اور ساتھی، In-Context Robot Learning with VLM Agents، arXiv:2609.19138 v1](https://arxiv.org/abs/2609.19138) — بنیادی قبل از اشاعت مقالہ، 16 ستمبر کو جمع کرایا گیا؛ مجوزہ GPT-Policy طریقۂ کار اور مصنفین کی جانچ و حدود بیان کرتا ہے؛ ہم مرتبہ جائزے یا تعیناتی کا ثبوت نہیں۔
- [مصنفین کا GPT-Policy پروجیکٹ صفحہ](https://cheng-haha.github.io/GPT-Policy/) — نظام، تجربات، نتائج کی جدولوں، ویڈیوز اور بحث کے لیے مصنفین کا بنیادی مواد؛ آزادانہ توثیق نہیں۔
- [مصنفین کا GPT-Policy کا عوامی کوڈ ذخیرہ](https://github.com/cheng-haha/GPT-Policy) — شائع شدہ اڈاپٹرز اور ذخیرے کے مواد اور اس میں شامل نہ کی گئی چیزوں کا بنیادی ثبوت؛ مکمل طور پر دوبارہ چلانے کے لیے درکار تمام کیلیبریشن، پرامپٹس یا جانچ کی تاریخ یہاں موجود نہیں۔
- [Reddit پوسٹ جس میں GPT-6 Astra کے Unitree G1 کو ایک نامانوس کمرے میں چلانے کا دعویٰ کیا گیا](https://www.reddit.com/r/singularity/s/tjaYXdzfnI) — زیرِ جانچ وائرل دعوے کا ماخذ؛ یہ اس بات کا ثبوت نہیں کہ مقالے یا اس میں درج بازو والے پلیٹ فارموں نے مذکورہ منظرنامہ انجام دیا۔
BIG CHANGE نیوز لیٹر

بڑی تصویر۔ اپنی رفتار سے۔

AI اور روبوٹکس کی تازہ کہانیاں، قابلِ توجہ تبدیلیاں اور عملی خیالات۔ روزانہ بریفنگ، ہفتہ وار خلاصہ یا ماہانہ نقطۂ نظر منتخب کریں۔