सप्टेंबरमधील arXiv प्रीप्रिंट, “VLM एजंट्ससह संदर्भातील रोबोट शिक्षण”, यात GPT-Policy ची ओळख करून दिली आहे. प्रात्यक्षिके, प्रतिमा आणि संवादाचा इतिहास वापरून स्थिर दृष्टी-भाषा मॉडेलला रोबोट साधनांशी जोडणारी ही प्रणाली आहे. तिच्या प्रयोगांत रोबोटच्या हातांची कामे आणि फिरते शोधकाम समाविष्ट आहेत. मात्र त्यातून GPT-6 Astra आणि Unitree G1 विषयीच्या Reddit पोस्टमधील दावा पडताळला जात नाही.

मोठा बदल

  • काय बदलले: GPT-Policy सर्वसाधारण दृष्टी-भाषा मॉडेलला प्रात्यक्षिके आणि सध्याची कॅमेरा-दृश्ये रोबोट-साधनांच्या विनंत्यांमध्ये रूपांतरित करण्याची संरचित पद्धत देते. त्यानंतर मॉडेलचे विशिष्ट कामासाठीचे वजन अद्ययावत न करता अंमलबजावणीचा अभिप्राय घेऊन पुढची कृती निवडता येते.
  • हे का महत्त्वाचे: ही पद्धत व्यापक दृश्य-तर्काला हालचालीच्या तपासणीपासून आणि अंमलबजावणीपासून वेगळे ठेवते. लेखकांच्या मर्यादित प्रयोगांत काही कामांसाठी अधिक संदर्भ उपयोगी ठरला; मात्र संपर्क-संवेदनशील कृतींसाठी कधी कधी जुळवलेले रोबोट-कृती संदर्भ आवश्यक होते.
  • कशाकडे लक्ष द्यावे: प्रत्येक स्थितीसाठी लेखात फक्त तीन प्रयत्न नोंदवले आहेत आणि प्रयत्न संथ व अपयशप्रवण असल्याचे, हातांची टक्कर झाल्याचेही वर्णन आहे. हे निकाल इतरत्र पुन्हा तपासणे, मोठे मूल्यमापन करणे आणि स्वतंत्र सुरक्षा-नियंत्रणे वापरणे आवश्यक आहे; त्याशिवाय माणसांजवळ काम करणाऱ्या रोबोट्सबद्दलचे निष्कर्ष मर्यादित राहतात.

GPT-Policy काय करते

हा लेख 16 सप्टेंबरला arXiv वर सादर झाला. फाइन-ट्यूनिंग किंवा कामासाठी विशिष्ट मॉडेल-पॅरामीटर्स न बदलता, उदाहरणे आणि अभिप्राय वापरून सर्वसाधारण दृष्टी-भाषा मॉडेल नवीन सुरुवातीच्या स्थितीतून काम करू शकते का, हा प्रश्न तो तपासतो. लेखक त्यांच्या चौकटीला GPT-Policy म्हणतात आणि तपासलेल्या मॉडेल्समध्ये GPT-6 Astra चे नाव देतात.

प्रणाली अनेक प्रकारचे संदर्भ एकत्र करते: कामाची सूचना, सध्याची कॅमेरा-दृश्ये आणि स्थिती, तसेच पर्यायाने मानवी प्रात्यक्षिकांचे व्हिडिओ, कृती-संदर्भांसह रोबोट प्रात्यक्षिके, लक्ष्य-प्रतिमा, रोबोटचे आधीचे प्रयत्न किंवा मानवी संवाद. संदर्भ-संकलक कामाशी संबंधित दृश्यबदल निवडून सूचना, मर्यादा आणि साधनांची रचना यांच्याशी जोडतो. त्यानंतर VLM संरचित रोबोट-साधन विनंती सुचवते.

ती विनंती रोबोटच्या विशिष्ट रचनेसाठी असलेल्या नियंत्रकाकडे जाते. अंमलबजावणी किंवा हालचाल नाकारणे यापूर्वी व्यस्त-गतीशास्त्राची उत्तरे तपासणे, कार्टेशियन स्थितींचे नमुने घेणे आणि सांध्यांच्या संदर्भबिंदूंची वेळ ठरवणे, असे लेखक सांगतात. पुढील मॉडेल-निर्णयासाठी नियंत्रक निरीक्षणे व अंमलबजावणीचा अभिप्राय परत करतो. मॉडेल कृती सुचवते; रोबोटसाठीचा खास कोड त्यांची पडताळणी करून अंमलबजावणी करतो.

हा आवर्तनच लेखातील मुख्य योगदान आहे. वजनात gradient बदल न करता स्थिर VLM ला उदाहरणे आणि अलीकडील निकालांनुसार पुढची कृती जुळवता येते. येथे “संदर्भातील शिक्षण” म्हणजे कामादरम्यान पुरवलेली माहिती प्रणाली वापरते, असा अर्थ आहे. मॉडेलने कायमस्वरूपी नवे कौशल्य शिकले किंवा प्रत्येक रोबोट समान साधन-इंटरफेस चालवू शकतो, असा अर्थ नाही.

प्रयोगांत काय मोजले

दहा रोबोट-कामांवर पाच प्रकारचे प्रयोग, प्रत्येक स्थितीसाठी तीन प्रयत्न, असे लेखक नोंदवतात. त्यांचे प्रकल्प-पान प्रत्यक्ष रोबोटच्या चाचण्या दाखवते आणि कामांचे निकाल, निर्णय व लागलेला वेळ देते. टॉवेल उचलताना मानवी व्हिडिओसह GPT-6 Astra तीनपैकी दोनदा यशस्वी झाले; व्हिडिओशिवाय एकदाही नाही. वही उचलण्याच्या कामातही प्रात्यक्षिकाशिवाय शून्य यशांवरून प्रात्यक्षिकासह तीनपैकी दोन यश मिळाले.

वस्तूला स्पर्श करणाऱ्या कामांतून अतिरिक्त संदर्भ हा सर्वसाधारण उपाय का नाही, हे दिसते. बाटलीचे झाकण उघडताना रोबोटच्या व्हिडिओमुळे तीनपैकी दोन प्रयत्न यशस्वी झाले; जुळवलेल्या रोबोट-कृती जोडल्यावर तिन्ही यशस्वी झाले. प्लग काढून पुन्हा लावण्याच्या कामात केवळ व्हिडिओ असलेल्या स्थितीत एकही यश नव्हते; व्हिडिओसोबत कृती-संदर्भ दिल्यावर तीनपैकी दोनदा यश मिळाले. ही प्रत्येक स्थितीतील लहान संख्येची मोजणी आहे; विश्वासार्हतेचा अंदाज नाही.

लक्ष्य-प्रतिमेवर आधारित ब्लॉक आणि फळांची मांडणी तसेच मानवी संवादाची दोन कामे तिन्हीपैकी तिन्ही वेळा यशस्वी झाल्याचे प्रकल्पात सांगितले आहे. स्वतःच्या संवाद-इतिहासाचा वापर करताना “लिंबू गुलाबी ताटावर” आणि “हलते शोधकाम” या दोन्ही कामांत तिन्ही प्रयत्न यशस्वी झाल्याचे लेखात नमूद आहे. दुसऱ्या कामात लक्ष्य शोधताना रोबोटने सक्रियपणे अडथळे टाळले; त्याला सरासरी 25.53 मिनिटे लागली. आकृती 1 मध्ये फिरत्या रोबोटने वस्तू परत आणणेही दाखवले आहे. त्यामुळे लेख टेबलवरील हाताळणीपलीकडची कामेही दाखवतो; तरी प्रत्येक स्थितीतील तीन प्रयत्नांची निवडक कामेच आहेत. कामांना काही मिनिटे लागली: मानवी व्हिडिओसह टॉवेल उचलण्यास सरासरी 18.9 मिनिटे आणि व्हिडिओ व कृती-संदर्भांसह बाटलीचे झाकण उघडण्यास 17.9 मिनिटे लागल्याचे प्रकल्प-पान सांगते. त्यामुळे विलंब आणि परिचालन-खर्च हे सुटलेले तपशील नसून प्रत्यक्ष वापरातील प्रश्न आहेत.

परिशिष्ट B मध्ये लेखात वर्णिलेल्या रोबोट संरचनांमध्ये YAM आणि ARX X5 सोबत Morphi Kino चा उल्लेख आहे. त्यात Morphi Kino ला फिरता पाया, कंबर, डोके आणि सात-सांध्यांचे दोन हात असल्याचे म्हटले आहे. त्यामुळे हातांच्या प्लॅटफॉर्मसोबत फिरता प्लॅटफॉर्मही लेखात आहे; मात्र परिशिष्टात Unitree G1 चा उल्लेख नाही.

लेखातील फिरत्या कामामुळे Reddit वरील प्रसंग सिद्ध होत नाही

त्या Reddit पोस्टमध्ये GPT-6 Astra अपरिचित खोलीत Unitree G1 नियंत्रित करते, वस्तू कुठे आहेत हे लक्षात ठेवते आणि अस्पष्ट सूचनेनंतर त्या परत आणते, असा दावा आहे. लेखात वेगळे “हलते शोधकाम” काम नोंदवले आहे आणि Morphi Kino चे वर्णन फिरता पाया असलेला प्लॅटफॉर्म असे केले आहे; पण लेख, प्रकल्पाची सामग्री आणि सार्वजनिक GitHub रेपॉझिटरी Reddit पोस्टमधील G1 प्रसंग GPT-Policy चा प्रयोग होता, असे सांगत नाहीत. ती पोस्ट स्वतंत्र, अपडताळलेली बाब आहे; या तुलनेमुळे तिचा दावा खोटा ठरत नाही.

लेखकांच्या प्रकल्प-पानावर त्यांच्या प्रयोगांचे व्हिडिओ आहेत. ते नोंदवलेल्या कामांचे पुरावे आहेत; स्वतंत्र पडताळणी नव्हेत. सार्वजनिक कोड रेपॉझिटरीत सध्या ARX X5 आणि I2RT/YAM साठी अडॅप्टर्सची नोंद आहे. सार्वजनिक फाइल्समध्ये तैनातीचे होस्ट, खाजगी प्रॉम्प्ट्स, प्रयोगांच्या नोंदी, जागेनुसार कॅलिब्रेशन आणि मूल्यमापनाचा इतिहास समाविष्ट नाही, असेही म्हटले आहे. अडॅप्टरची ही यादी प्रकाशित रेपॉझिटरीचे वर्णन करते; मोबाइल शोधकामाचा अहवाल देणाऱ्या आणि परिशिष्ट B मध्ये Morphi Kino नोंदवणाऱ्या संपूर्ण लेखाची व्याप्ती नव्हे. उपलब्ध सामग्रीवरून BIG CHANGE ला नोंदवलेल्या प्रयोगांची पुनरावृत्ती पुरेशा तपशिलाने करता आली नसती; आम्ही रोबोटची चाचणीही केली नाही.

नियंत्रणाची सीमा अजूनही महत्त्वाची आहे

लांब कृती-क्रम आणि अंमलबजावणीतील अडचणी प्रकल्प-पानावर नोंदवल्या आहेत. हातांची एकमेकांशी झालेली टक्कर पाहता स्वायत्त तैनाती सुरक्षित ठेवण्यासाठीची विद्यमान संरक्षक साधने अपुरी होती, असे चर्चेत म्हटले आहे. शारीरिक अंतर आणि संपर्क यांचे स्वतंत्र निरीक्षण, तसेच वेगवान खालच्या-स्तरावरील नियंत्रण आणि अधिक सुरक्षित पुनर्प्राप्ती आवश्यक असल्याचेही त्यात नमूद आहे. काही अवैध हालचाली नाकारणारा नियंत्रक म्हणजे स्वतःहून संपूर्ण सुरक्षा-प्रणाली नव्हे.

या अभ्यासातून ठोस संशोधन-निकाल मिळतो: काही कामांत सर्वसाधारण VLM संदर्भाच्या मदतीने रोबोट-साधनांना मार्गदर्शन करू शकते आणि संदर्भाचा प्रकार महत्त्वाचा असतो. मूल्यमापनाचा मर्यादित आकार, प्रत्येक प्रयत्नाचा वेळ, अपूर्ण सार्वजनिक पुनरुत्पादन-सामग्री आणि नोंदवलेल्या टकरी यांमुळे खुल्या स्वरूपाच्या विनंत्या विश्वासार्हपणे समजून पूर्ण करणाऱ्या घरगुती ह्युमनॉइडचा पुरावा अजून मिळत नाही.

स्रोत आणि पुढील वाचन