AI-translated from English; not yet reviewed by a fluent editor.

# GPT-Policy रोबोट-हात आणि फिरत्या शोधकामांत संदर्भ तपासते

> सप्टेंबरमधील प्रीप्रिंटमध्ये रोबोटच्या हातांच्या प्रयोगांसोबत फिरत्या शोधाचे तीन-प्रयत्नांचे काम नोंदवले आहे. GPT-6 Astra आणि Unitree G1 विषयीचा वेगळा Reddit दावा त्यातून पडताळला जात नाही.

By BIG CHANGE Editorial

Published: 2026-09-27T06:11:48.387Z
Updated: 2026-09-27T06:11:48.387Z
Canonical: https://bigchange.ai/blog/gpt-policy-robot-learning-vlm-agents

![A conceptual robot arm reaches toward a bottle cap on a workbench beneath a mounted camera.](https://bigchange.ai/api/media/file/gpt-policy-robot-arm-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

सप्टेंबरमधील [arXiv प्रीप्रिंट, “VLM एजंट्ससह संदर्भातील रोबोट शिक्षण”](https://arxiv.org/html/2609.19138v1), यात GPT-Policy ची ओळख करून दिली आहे. प्रात्यक्षिके, प्रतिमा आणि संवादाचा इतिहास वापरून स्थिर दृष्टी-भाषा मॉडेलला रोबोट साधनांशी जोडणारी ही प्रणाली आहे. तिच्या प्रयोगांत रोबोटच्या हातांची कामे आणि फिरते शोधकाम समाविष्ट आहेत. मात्र त्यातून [GPT-6 Astra आणि Unitree G1 विषयीच्या Reddit पोस्टमधील दावा](https://www.reddit.com/r/singularity/s/tjaYXdzfnI) पडताळला जात नाही.

## मोठा बदल

- **काय बदलले:** GPT-Policy सर्वसाधारण दृष्टी-भाषा मॉडेलला प्रात्यक्षिके आणि सध्याची कॅमेरा-दृश्ये रोबोट-साधनांच्या विनंत्यांमध्ये रूपांतरित करण्याची संरचित पद्धत देते. त्यानंतर मॉडेलचे विशिष्ट कामासाठीचे वजन अद्ययावत न करता अंमलबजावणीचा अभिप्राय घेऊन पुढची कृती निवडता येते.
- **हे का महत्त्वाचे:** ही पद्धत व्यापक दृश्य-तर्काला हालचालीच्या तपासणीपासून आणि अंमलबजावणीपासून वेगळे ठेवते. लेखकांच्या मर्यादित प्रयोगांत काही कामांसाठी अधिक संदर्भ उपयोगी ठरला; मात्र संपर्क-संवेदनशील कृतींसाठी कधी कधी जुळवलेले रोबोट-कृती संदर्भ आवश्यक होते.
- **कशाकडे लक्ष द्यावे:** प्रत्येक स्थितीसाठी लेखात फक्त तीन प्रयत्न नोंदवले आहेत आणि प्रयत्न संथ व अपयशप्रवण असल्याचे, हातांची टक्कर झाल्याचेही वर्णन आहे. हे निकाल इतरत्र पुन्हा तपासणे, मोठे मूल्यमापन करणे आणि स्वतंत्र सुरक्षा-नियंत्रणे वापरणे आवश्यक आहे; त्याशिवाय माणसांजवळ काम करणाऱ्या रोबोट्सबद्दलचे निष्कर्ष मर्यादित राहतात.

## GPT-Policy काय करते

हा लेख 16 सप्टेंबरला arXiv वर सादर झाला. फाइन-ट्यूनिंग किंवा कामासाठी विशिष्ट मॉडेल-पॅरामीटर्स न बदलता, उदाहरणे आणि अभिप्राय वापरून सर्वसाधारण दृष्टी-भाषा मॉडेल नवीन सुरुवातीच्या स्थितीतून काम करू शकते का, हा प्रश्न तो तपासतो. लेखक त्यांच्या चौकटीला GPT-Policy म्हणतात आणि तपासलेल्या मॉडेल्समध्ये GPT-6 Astra चे नाव देतात.

प्रणाली अनेक प्रकारचे संदर्भ एकत्र करते: कामाची सूचना, सध्याची कॅमेरा-दृश्ये आणि स्थिती, तसेच पर्यायाने मानवी प्रात्यक्षिकांचे व्हिडिओ, कृती-संदर्भांसह रोबोट प्रात्यक्षिके, लक्ष्य-प्रतिमा, रोबोटचे आधीचे प्रयत्न किंवा मानवी संवाद. संदर्भ-संकलक कामाशी संबंधित दृश्यबदल निवडून सूचना, मर्यादा आणि साधनांची रचना यांच्याशी जोडतो. त्यानंतर VLM संरचित रोबोट-साधन विनंती सुचवते.

ती विनंती रोबोटच्या विशिष्ट रचनेसाठी असलेल्या नियंत्रकाकडे जाते. अंमलबजावणी किंवा हालचाल नाकारणे यापूर्वी व्यस्त-गतीशास्त्राची उत्तरे तपासणे, कार्टेशियन स्थितींचे नमुने घेणे आणि सांध्यांच्या संदर्भबिंदूंची वेळ ठरवणे, असे लेखक सांगतात. पुढील मॉडेल-निर्णयासाठी नियंत्रक निरीक्षणे व अंमलबजावणीचा अभिप्राय परत करतो. मॉडेल कृती सुचवते; रोबोटसाठीचा खास कोड त्यांची पडताळणी करून अंमलबजावणी करतो.

हा आवर्तनच लेखातील मुख्य योगदान आहे. वजनात gradient बदल न करता स्थिर VLM ला उदाहरणे आणि अलीकडील निकालांनुसार पुढची कृती जुळवता येते. येथे “संदर्भातील शिक्षण” म्हणजे कामादरम्यान पुरवलेली माहिती प्रणाली वापरते, असा अर्थ आहे. मॉडेलने कायमस्वरूपी नवे कौशल्य शिकले किंवा प्रत्येक रोबोट समान साधन-इंटरफेस चालवू शकतो, असा अर्थ नाही.

## प्रयोगांत काय मोजले

दहा रोबोट-कामांवर पाच प्रकारचे प्रयोग, प्रत्येक स्थितीसाठी तीन प्रयत्न, असे लेखक नोंदवतात. त्यांचे [प्रकल्प-पान](https://cheng-haha.github.io/GPT-Policy/) प्रत्यक्ष रोबोटच्या चाचण्या दाखवते आणि कामांचे निकाल, निर्णय व लागलेला वेळ देते. टॉवेल उचलताना मानवी व्हिडिओसह GPT-6 Astra तीनपैकी दोनदा यशस्वी झाले; व्हिडिओशिवाय एकदाही नाही. वही उचलण्याच्या कामातही प्रात्यक्षिकाशिवाय शून्य यशांवरून प्रात्यक्षिकासह तीनपैकी दोन यश मिळाले.

वस्तूला स्पर्श करणाऱ्या कामांतून अतिरिक्त संदर्भ हा सर्वसाधारण उपाय का नाही, हे दिसते. बाटलीचे झाकण उघडताना रोबोटच्या व्हिडिओमुळे तीनपैकी दोन प्रयत्न यशस्वी झाले; जुळवलेल्या रोबोट-कृती जोडल्यावर तिन्ही यशस्वी झाले. प्लग काढून पुन्हा लावण्याच्या कामात केवळ व्हिडिओ असलेल्या स्थितीत एकही यश नव्हते; व्हिडिओसोबत कृती-संदर्भ दिल्यावर तीनपैकी दोनदा यश मिळाले. ही प्रत्येक स्थितीतील लहान संख्येची मोजणी आहे; विश्वासार्हतेचा अंदाज नाही.

लक्ष्य-प्रतिमेवर आधारित ब्लॉक आणि फळांची मांडणी तसेच मानवी संवादाची दोन कामे तिन्हीपैकी तिन्ही वेळा यशस्वी झाल्याचे प्रकल्पात सांगितले आहे. स्वतःच्या संवाद-इतिहासाचा वापर करताना “लिंबू गुलाबी ताटावर” आणि “हलते शोधकाम” या दोन्ही कामांत तिन्ही प्रयत्न यशस्वी झाल्याचे लेखात नमूद आहे. दुसऱ्या कामात लक्ष्य शोधताना रोबोटने सक्रियपणे अडथळे टाळले; त्याला सरासरी 25.53 मिनिटे लागली. आकृती 1 मध्ये फिरत्या रोबोटने वस्तू परत आणणेही दाखवले आहे. त्यामुळे लेख टेबलवरील हाताळणीपलीकडची कामेही दाखवतो; तरी प्रत्येक स्थितीतील तीन प्रयत्नांची निवडक कामेच आहेत. कामांना काही मिनिटे लागली: मानवी व्हिडिओसह टॉवेल उचलण्यास सरासरी 18.9 मिनिटे आणि व्हिडिओ व कृती-संदर्भांसह बाटलीचे झाकण उघडण्यास 17.9 मिनिटे लागल्याचे प्रकल्प-पान सांगते. त्यामुळे विलंब आणि परिचालन-खर्च हे सुटलेले तपशील नसून प्रत्यक्ष वापरातील प्रश्न आहेत.

परिशिष्ट B मध्ये लेखात वर्णिलेल्या रोबोट संरचनांमध्ये YAM आणि ARX X5 सोबत Morphi Kino चा उल्लेख आहे. त्यात Morphi Kino ला फिरता पाया, कंबर, डोके आणि सात-सांध्यांचे दोन हात असल्याचे म्हटले आहे. त्यामुळे हातांच्या प्लॅटफॉर्मसोबत फिरता प्लॅटफॉर्मही लेखात आहे; मात्र परिशिष्टात Unitree G1 चा उल्लेख नाही.

## लेखातील फिरत्या कामामुळे Reddit वरील प्रसंग सिद्ध होत नाही

त्या [Reddit पोस्टमध्ये](https://www.reddit.com/r/singularity/s/tjaYXdzfnI) GPT-6 Astra अपरिचित खोलीत Unitree G1 नियंत्रित करते, वस्तू कुठे आहेत हे लक्षात ठेवते आणि अस्पष्ट सूचनेनंतर त्या परत आणते, असा दावा आहे. लेखात वेगळे “हलते शोधकाम” काम नोंदवले आहे आणि Morphi Kino चे वर्णन फिरता पाया असलेला प्लॅटफॉर्म असे केले आहे; पण लेख, प्रकल्पाची सामग्री आणि [सार्वजनिक GitHub रेपॉझिटरी](https://github.com/cheng-haha/GPT-Policy) Reddit पोस्टमधील G1 प्रसंग GPT-Policy चा प्रयोग होता, असे सांगत नाहीत. ती पोस्ट स्वतंत्र, अपडताळलेली बाब आहे; या तुलनेमुळे तिचा दावा खोटा ठरत नाही.

लेखकांच्या [प्रकल्प-पानावर](https://cheng-haha.github.io/GPT-Policy/) त्यांच्या प्रयोगांचे व्हिडिओ आहेत. ते नोंदवलेल्या कामांचे पुरावे आहेत; स्वतंत्र पडताळणी नव्हेत. सार्वजनिक [कोड रेपॉझिटरीत](https://github.com/cheng-haha/GPT-Policy) सध्या ARX X5 आणि I2RT/YAM साठी अडॅप्टर्सची नोंद आहे. सार्वजनिक फाइल्समध्ये तैनातीचे होस्ट, खाजगी प्रॉम्प्ट्स, प्रयोगांच्या नोंदी, जागेनुसार कॅलिब्रेशन आणि मूल्यमापनाचा इतिहास समाविष्ट नाही, असेही म्हटले आहे. अडॅप्टरची ही यादी प्रकाशित रेपॉझिटरीचे वर्णन करते; मोबाइल शोधकामाचा अहवाल देणाऱ्या आणि परिशिष्ट B मध्ये Morphi Kino नोंदवणाऱ्या संपूर्ण लेखाची व्याप्ती नव्हे. उपलब्ध सामग्रीवरून BIG CHANGE ला नोंदवलेल्या प्रयोगांची पुनरावृत्ती पुरेशा तपशिलाने करता आली नसती; आम्ही रोबोटची चाचणीही केली नाही.

## नियंत्रणाची सीमा अजूनही महत्त्वाची आहे

लांब कृती-क्रम आणि अंमलबजावणीतील अडचणी प्रकल्प-पानावर नोंदवल्या आहेत. हातांची एकमेकांशी झालेली टक्कर पाहता स्वायत्त तैनाती सुरक्षित ठेवण्यासाठीची विद्यमान संरक्षक साधने अपुरी होती, असे चर्चेत म्हटले आहे. शारीरिक अंतर आणि संपर्क यांचे स्वतंत्र निरीक्षण, तसेच वेगवान खालच्या-स्तरावरील नियंत्रण आणि अधिक सुरक्षित पुनर्प्राप्ती आवश्यक असल्याचेही त्यात नमूद आहे. काही अवैध हालचाली नाकारणारा नियंत्रक म्हणजे स्वतःहून संपूर्ण सुरक्षा-प्रणाली नव्हे.

या अभ्यासातून ठोस संशोधन-निकाल मिळतो: काही कामांत सर्वसाधारण VLM संदर्भाच्या मदतीने रोबोट-साधनांना मार्गदर्शन करू शकते आणि संदर्भाचा प्रकार महत्त्वाचा असतो. मूल्यमापनाचा मर्यादित आकार, प्रत्येक प्रयत्नाचा वेळ, अपूर्ण सार्वजनिक पुनरुत्पादन-सामग्री आणि नोंदवलेल्या टकरी यांमुळे खुल्या स्वरूपाच्या विनंत्या विश्वासार्हपणे समजून पूर्ण करणाऱ्या घरगुती ह्युमनॉइडचा पुरावा अजून मिळत नाही.

## स्रोत आणि पुढील वाचन

- [Cheng आणि सहलेखक, “VLM एजंट्ससह संदर्भातील रोबोट शिक्षण” (arXiv:2609.19138, आवृत्ती 1, 16 सप्टेंबर 2026 रोजी सादर)](https://arxiv.org/abs/2609.19138) — पद्धत, मूल्यमापन आणि नमूद मर्यादांचा प्राथमिक प्रीप्रिंट; समीक्षित पुरावा किंवा तैनातीचा अहवाल नाही.
- [लेखकांचे GPT-Policy प्रकल्प पान](https://cheng-haha.github.io/GPT-Policy/) — प्रयोगांची वर्णने, व्हिडिओ, प्रत्येक स्थितीचे निकाल आणि चर्चा. ही लेखकांनी स्वतः पुरवलेली सामग्री आहे.
- [लेखकांची GPT-Policy सार्वजनिक कोड रेपॉझिटरी](https://github.com/cheng-haha/GPT-Policy) — सध्याच्या रोबोट-हाताच्या अडॅप्टर्सची आणि सार्वजनिक फाइल्समधून वगळलेल्या सामग्रीची नोंद. रेपॉझिटरी उपलब्ध आहे म्हणून नोंदवलेल्या प्रयोगांची पुनरावृत्ती करता येते, असे सिद्ध होत नाही.
- [या अहवालाला कारणीभूत ठरलेली Reddit पोस्ट](https://www.reddit.com/r/singularity/s/tjaYXdzfnI) — Unitree G1 विषयीच्या दाव्याचा स्रोत; त्या प्रसंगाचा लेखाशी किंवा सूचीतील रोबोट-हात प्लॅटफॉर्मशी संबंध सिद्ध करणारा पुरावा पोस्टमध्ये नाही.

## Sources

- [Cheng आणि सहलेखक, VLM एजंट्ससह संदर्भातील रोबोट शिक्षण, arXiv:2609.19138 आवृत्ती 1](https://arxiv.org/abs/2609.19138) — 16 सप्टेंबरला सादर केलेला प्राथमिक प्रीप्रिंट. GPT-Policy पद्धत आणि लेखकांचे मूल्यमापन व मर्यादा नोंदवतो; समीक्षित किंवा तैनातीचा पुरावा नाही.
- [लेखकांचे GPT-Policy प्रकल्प पान](https://cheng-haha.github.io/GPT-Policy/) — प्रणालीचे वर्णन, प्रयोग, निकालांचे तक्ते, व्हिडिओ आणि चर्चा यांसाठी लेखकांनी दिलेला प्राथमिक स्रोत; स्वतंत्र पडताळणी नाही.
- [लेखकांची GPT-Policy सार्वजनिक कोड रेपॉझिटरी](https://github.com/cheng-haha/GPT-Policy) — प्रकाशित अडॅप्टर्स आणि रेपॉझिटरीत नसलेल्या सामग्रीचा प्राथमिक पुरावा; सहज पुनरुत्पादनासाठी आवश्यक सर्व कॅलिब्रेशन, प्रॉम्प्ट्स किंवा मूल्यमापनाचा इतिहास यात नाही.
- [GPT-6 Astra द्वारे अपरिचित खोलीत Unitree G1 नियंत्रित केल्याचा दावा करणारी Reddit पोस्ट](https://www.reddit.com/r/singularity/s/tjaYXdzfnI) — तपासल्या जात असलेल्या व्हायरल दाव्याचा उगम; लेखात किंवा नमूद केलेल्या रोबोट-हात प्लॅटफॉर्मवर त्या प्रसंगाचे प्रात्यक्षिक झाले, याचा पुरावा नाही.
