सितंबर के एक arXiv प्रीप्रिंट, “In-Context Robot Learning with VLM Agents” में GPT-Policy पेश किया गया है। यह प्रदर्शन, छवियों और बातचीत के इतिहास का इस्तेमाल करके एक स्थिर vision-language मॉडल को रोबोट टूल से जोड़ता है। इसके प्रयोगों में रोबोट-भुजा के कार्य और मोबाइल-अन्वेषण शामिल हैं। वे GPT-6 Astra और Unitree G1 के बारे में Reddit पोस्ट के दावे की पुष्टि नहीं करते।
बड़ा बदलाव
- क्या बदला: GPT-Policy सामान्य vision-language मॉडल को प्रदर्शन और मौजूदा कैमरा-दृश्यों से रोबोट-टूल अनुरोध बनाने का एक व्यवस्थित तरीका देता है। फिर निष्पादन से मिली प्रतिक्रिया के आधार पर वह अगली कार्रवाई चुनता है, जबकि मॉडल के कार्य-विशिष्ट वज़न अपडेट नहीं किए जाते।
- यह क्यों मायने रखता है: यह तरीका व्यापक दृश्य-तर्क को गति-जाँच और निष्पादन से अलग रखता है। लेखकों के सीमित परीक्षणों में, अतिरिक्त संदर्भ से कुछ कामों में मदद मिली; जबकि संपर्क-संवेदी कार्रवाइयों के लिए कभी-कभी रोबोट की कार्रवाई के साथ संरेखित संदर्भ भी चाहिए था।
- अब किन बातों पर नज़र रखें: शोधपत्र में हर परिस्थिति के केवल तीन प्रयास हैं और धीमे, विफलता-प्रवण परीक्षणों का वर्णन है, जिनमें भुजाओं की टक्कर भी हुई। लोगों के आसपास काम करने वाले रोबोटों के बारे में इन नतीजों से ठोस निष्कर्ष निकालने से पहले उन्हें दोहराना, बड़े मूल्यांकन करना और स्वतंत्र सुरक्षा नियंत्रण जाँचना ज़रूरी है।
GPT-Policy क्या करता है
शोधपत्र 16 सितंबर को arXiv पर जमा किया गया था। इसमें पूछा गया है कि क्या सामान्य vision-language मॉडल को नए शुरुआती हालात में कोई काम करने के लिए उदाहरणों और प्रतिक्रिया का उपयोग करना सिखाया जा सकता है—बिना fine-tuning या कार्य-विशिष्ट मॉडल पैरामीटर बदले। लेखक अपने ढाँचे को GPT-Policy कहते हैं और जिन मॉडलों का मूल्यांकन किया, उनमें GPT-6 Astra का नाम भी देते हैं।
सिस्टम कई तरह के संदर्भ जोड़ता है: काम का निर्देश, मौजूदा कैमरा-दृश्य और स्थिति, और वैकल्पिक रूप से मानव प्रदर्शन के वीडियो, कार्रवाई-संदर्भ वाले रोबोट प्रदर्शन, लक्ष्य-छवि, रोबोट के पहले के प्रयास या इंसान से हुई बातचीत। संदर्भ-संकलक काम से जुड़े दृश्य-परिवर्तनों को चुनकर निर्देशों, पाबंदियों और टूल के स्कीमा के साथ जोड़ता है। फिर VLM रोबोट-टूल के लिए एक संरचित अनुरोध प्रस्तावित करता है।
यह अनुरोध संबंधित रोबोट के अनुसार बने नियंत्रक तक जाता है। लेखक बताते हैं कि गति चलाने या अस्वीकार करने से पहले वे inverse-kinematics समाधान जाँचते हैं, Cartesian स्थितियों के नमूने लेते हैं और जोड़-संबंधी निर्देशों का समय तय करते हैं। नियंत्रक अगला मॉडल-निर्णय लेने के लिए दृश्य और निष्पादन की प्रतिक्रिया लौटाता है। मॉडल कार्रवाई सुझाता है; रोबोट-विशिष्ट कोड उसकी जाँच करके उसे अंजाम देता है।
यही चक्र शोधपत्र का मुख्य योगदान है। इससे स्थिर VLM बिना gradient update के उदाहरणों और हाल के नतीजों के आधार पर अपनी अगली कार्रवाई ढाल सकता है। यहाँ “in-context learning” का अर्थ है कि सिस्टम किसी काम के दौरान दी गई जानकारी का उपयोग करता है। इसका मतलब यह नहीं कि मॉडल ने स्थायी रूप से नया कौशल सीख लिया या हर रोबोट वही टूल इंटरफ़ेस चला सकता है।
परीक्षणों में क्या मापा गया
लेखक दस रोबोट कार्यों में पाँच प्रकार के प्रयोग बताते हैं; हर परिस्थिति के तीन प्रयास हुए। उनका प्रोजेक्ट पृष्ठ वास्तविक रोबोट के परीक्षण सूचीबद्ध करता है और काम के नतीजे, निर्णय तथा लगा समय प्रकाशित करता है। तौलिया उठाने के काम में GPT-6 Astra मानव के वीडियो के साथ तीन में से दो प्रयासों में सफल रहा और उसके बिना तीनों में असफल रहा। नोटबुक उठाने के काम में भी प्रदर्शन के बिना तीन में शून्य सफलता से बढ़कर उसके साथ तीन में दो सफलता हुई।
संपर्क वाले काम दिखाते हैं कि अतिरिक्त संदर्भ कोई सार्वभौमिक समाधान क्यों नहीं है। बोतल का ढक्कन खोलने में रोबोट के वीडियो से तीन में दो बार सफलता मिली; उसके साथ रोबोट की संरेखित कार्रवाइयाँ जोड़ने पर तीनों प्रयास सफल रहे। प्लग निकालकर फिर लगाने में केवल वीडियो वाली परिस्थिति में तीनों प्रयास विफल रहे, जबकि वीडियो और कार्रवाई-संदर्भ दोनों के साथ तीन में दो सफलताएँ मिलीं। ये छोटी परिस्थितियों के कुल आँकड़े हैं, विश्वसनीयता के अनुमान नहीं।
प्रोजेक्ट में लक्ष्य-छवि के अनुसार ब्लॉक और फलों की सजावट तथा इंसान से बातचीत वाले दो कामों में भी तीन में तीन सफलताएँ बताई गई हैं। अपनी पिछली बातचीत के इतिहास का उपयोग करने पर शोधपत्र “Lemon to Pink Plate” और “Movable Exploration” दोनों में तीन में तीन सफलताएँ रिपोर्ट करता है। दूसरे काम में रोबोट लक्ष्य खोजते समय सक्रिय रूप से बाधाओं से बचा; औसत समय 25.53 मिनट था। चित्र 1 में चलकर वस्तु वापस लाना भी दिखाया गया है। इससे शोधपत्र का दायरा मेज़ पर वस्तुएँ सँभालने से आगे जाता है, फिर भी हर परिस्थिति में केवल तीन प्रयास वाले चुने हुए काम ही हैं। परीक्षण मिनटों तक चले: प्रोजेक्ट पृष्ठ पर मानव के वीडियो के साथ तौलिया उठाने का औसत समय 18.9 मिनट और वीडियो तथा कार्रवाई-संदर्भ के साथ बोतल का ढक्कन खोलने का समय 17.9 मिनट बताया गया है। इसलिए व्यावहारिक विलंब और संचालन लागत अब भी खुले प्रश्न हैं।
परिशिष्ट B में शोधपत्र द्वारा वर्णित रोबोट कॉन्फ़िगरेशन के बीच Morphi Kino के साथ YAM और ARX X5 भी सूचीबद्ध हैं। उसमें Morphi Kino के बारे में बताया गया है कि उसका मोबाइल आधार, कमर और सिर तथा सात-सात जोड़ वाली दो भुजाएँ हैं। इसलिए शोधपत्र में भुजा वाले रोबोटों के अलावा मोबाइल मंच का कॉन्फ़िगरेशन भी शामिल है; परिशिष्ट में Unitree G1 का नाम नहीं है।
शोधपत्र का मोबाइल कार्य Reddit के परिदृश्य की पुष्टि नहीं करता
यह Reddit पोस्ट का दावा है कि GPT-6 Astra अपरिचित कमरे में Unitree G1 को नियंत्रित करता है, वस्तुओं की जगह याद रखता है और अस्पष्ट अनुरोधों पर उन्हें बाद में वापस लाता है। शोधपत्र “Movable Exploration” नाम के अलग कार्य की रिपोर्ट देता है और Morphi Kino को मोबाइल आधार वाले मंच के रूप में बताता है, लेकिन शोधपत्र, प्रोजेक्ट सामग्री तथा सार्वजनिक GitHub रिपॉज़िटरी Reddit पोस्ट के G1 परिदृश्य को GPT-Policy का प्रयोग नहीं बताते। पोस्ट का दावा अलग और अप्रमाणित है; इस तुलना से वह गलत सिद्ध नहीं होता।
लेखकों के प्रोजेक्ट पृष्ठ पर उनके प्रयोगों के वीडियो हैं। ये उनके बताए कामों के प्रमाण हैं, स्वतंत्र पुष्टि नहीं। सार्वजनिक कोड रिपॉज़िटरी में फिलहाल ARX X5 और I2RT/YAM के लिए अडैप्टर सूचीबद्ध हैं। उसमें यह भी कहा गया है कि परिनियोजन होस्ट, निजी प्रॉम्प्ट, परीक्षण रिकॉर्डिंग, स्थल-विशिष्ट कैलिब्रेशन और मूल्यांकन इतिहास सार्वजनिक रिपॉज़िटरी में शामिल नहीं हैं। यह सूची जारी किए गए रिपॉज़िटरी का दायरा बताती है; पूरे शोधपत्र का नहीं, जो मोबाइल-अन्वेषण की भी रिपोर्ट करता है और परिशिष्ट B में Morphi Kino को सूचीबद्ध करता है। उपलब्ध सामग्री BIG CHANGE के लिए बताए गए परीक्षण दोहराने हेतु पर्याप्त विवरण नहीं देती; हमने रोबोट का परीक्षण नहीं किया।
नियंत्रण की सीमा अब भी अहम है
प्रोजेक्ट पृष्ठ में लंबी कार्रवाई-श्रृंखलाओं और निष्पादन की कठिनाइयों का उल्लेख है। उसमें बताया गया है कि भुजाओं की टक्कर से पता चला कि मौजूदा सुरक्षा उपाय अपने-आप सुरक्षित संचालन के लिए पर्याप्त नहीं थे। लेखक शारीरिक दूरी और संपर्क की स्वतंत्र निगरानी के साथ तेज़ निचले-स्तर के नियंत्रण और अधिक सुरक्षित बहाली की माँग करते हैं। केवल कुछ अमान्य गतिविधियाँ रोक सकने वाला नियंत्रक अपने-आप में पूरी सुरक्षा-व्यवस्था नहीं है।
यह अध्ययन एक ठोस शोध-नतीजा देता है: संदर्भ से सामान्य VLM को कुछ कामों में रोबोट-टूल चलाने में मदद मिल सकती है, और संदर्भ का प्रकार मायने रखता है। मूल्यांकन का छोटा आकार, हर परीक्षण में लगा समय, दोहराने के लिए सार्वजनिक सामग्री का अधूरा होना और बताई गई टक्करें—इन सबके रहते यह नतीजा ऐसे घरेलू ह्यूमनॉइड रोबोट का प्रमाण नहीं है जो खुले निर्देशों को भरोसेमंद ढंग से समझकर पूरा करे।
स्रोत और आगे पढ़ें
- Cheng और सहलेखक, “In-Context Robot Learning with VLM Agents” (arXiv:2609.19138, संस्करण 1, 16 सितंबर 2026 को जमा) — विधि, मूल्यांकन और बताई गई सीमाओं का प्राथमिक प्रीप्रिंट; यह समकक्ष-समीक्षित साक्ष्य या परिनियोजन रिपोर्ट नहीं है।
- लेखकों का GPT-Policy प्रोजेक्ट पृष्ठ — प्रयोगों के विवरण, वीडियो, परिस्थिति-वार नतीजे और चर्चा। ये स्वयं लेखकों की सामग्री हैं।
- लेखकों की सार्वजनिक GPT-Policy कोड रिपॉज़िटरी — मौजूदा रोबोट-भुजा अडैप्टर और सार्वजनिक रिपॉज़िटरी से बाहर रखी गई सामग्री का विवरण। केवल रिपॉज़िटरी उपलब्ध होने से यह साबित नहीं होता कि रिपोर्ट किए गए प्रयोग दोहराए जा सकते हैं।
- इस रिपोर्ट की वजह बना Reddit पोस्ट — Unitree G1 वाले दावे का स्रोत; पोस्ट उस परिदृश्य को शोधपत्र से जोड़ने वाला साक्ष्य नहीं देती।



