Caltech आणि Stanford येथील एका टीमने HomeBody दाखवले, ही संशोधन प्रणाली GPT Astra ला नेव्हिगेशन आणि हाताळणीची कौशल्ये वापरून Unitree G1 कडून स्वयंपाकघरातील कामे करून घेऊ देते. रोबोट प्रथम खोलीचा फेरफटका मारतो आणि वस्तू कुठे दिसल्या ते साठवतो. टीमच्या प्रात्यक्षिकांत तो कॉफीच्या पिशव्या गोळा करतो, सांगितलेले कार्टन फेकतो आणि वस्तू कॅमेऱ्याच्या दृश्यातून गेल्यानंतर कप्प्यातून औषधाची बाटली काढतो.
मोठा बदल
- काय बदलले: HomeBody दृष्टी-भाषा मॉडेलला पाहणी केलेल्या खोलीची अवकाशीय नोंद आणि रोबोट कौशल्यांसाठी एकसमान इंटरफेस देते. मॉडेल कौशल्य आणि लक्ष्य निवडते; स्थानिक सॉफ्टवेअर हालचालीचे नियोजन करून त्या पार पाडते, मग निकाल कळवते.
- हे का महत्त्वाचे: या स्वयंपाकघरासाठी नव्याने प्रशिक्षित कृती-धोरणाशिवाय मॉडेल वेगवेगळ्या जागांतील कामांचे नियोजन करू शकते आणि अभिप्राय वापरू शकते. स्मृती आणि आधीपासूनच्या मोटर-कौशल्यांचा वापर करून अधिक मोठी कामे कशी करता येतात, हे टीमच्या प्रात्यक्षिकांतून दिसते.
- काय अद्याप स्पष्ट नाही: सार्वजनिक प्रकाशनात निवडक प्रात्यक्षिके आहेत; नियंत्रित यश-दराचा अभ्यास नाही. 27 सप्टेंबरपर्यंत संशोधनपत्र आणि रोबोटचा कोड सार्वजनिकरीत्या उपलब्ध नव्हता, त्यामुळे प्रकाशनातील कामगिरीची स्वतंत्रपणे पुनरावृत्ती करता येत नाही.
रोबोट खोलीची आठवण कशी ठेवतो
HomeBody ची सुरुवात खोलीची पाहणी करण्यापासून होते. प्रकल्पाच्या तैनातीविषयक वर्णनानुसार, G1 विस्तृत कोनातून iPhone व्हिडिओ, D435i कॅमेऱ्याची निरीक्षणे, LiDAR स्कॅन, सांध्यांच्या स्थिती आणि मॉडेलने निवडलेले मार्गबिंदू गोळा करतो. LiDAR-आधारित SLAM नकाशातून खोलीची मोजलेली भूमिती मिळते. Astra त्या सामग्रीचा वापर Nvidia Isaac Sim मध्ये डिजिटल प्रतिकृती तयार करण्यासाठी करते. नोंदलेली कॅमेरा दृश्ये आणि रोबोटची सध्याची जागा एकाच निर्देशांक चौकटीत यावीत म्हणून टीम नकाशा आणि पुनर्रचना एकमेकांशी जुळवते.
सूचनेत रोबोटला सध्या दिसत नसलेल्या वस्तूचा उल्लेख असेल, तेव्हा ही पूर्वतयारी महत्त्वाची ठरते. औषधाच्या विनंतीसाठी HomeBody साठवलेल्या कॅमेरा-कीफ्रेम्स पुन्हा पाहून कप्पा शोधते, तिथे जाते, तो उघडते आणि बाटली उचलते, असे टीम सांगते. खोलीचे मॉडेल नेव्हिगेशन आणि ठिकाण आठवण्यासाठी मदत करते; प्रत्यक्ष वस्तू हाताळण्याची अंतिम क्रिया मात्र थेट कॅमेरा मार्गदर्शित करतो.
प्रकल्पाच्या पानावरील स्वयंपाकघरातील परस्परसंवादी दृश्य स्पष्टपणे केवळ स्पष्टीकरणासाठी असल्याचे नमूद केले आहे आणि ते पुनर्रचित खोलीत दाखवले आहे. त्याच पानावर G1 ने स्वयंपाकघरातील कामे करतानाचे व्हिडिओ वेगळे दिले आहेत; नेव्हिगेशन, उचलणे, ठेवणे आणि कप्पा उघडण्याच्या कौशल्यांचे क्लिप प्रत्यक्ष रोबोटचे दृश्य असल्याचे म्हटले आहे. त्या व्हिडिओंत टीमने निवडलेल्या प्रयत्नांची नोंद आहे, तर सिम्युलेशनमधील पुनर्दृश्य नियोजनाची क्रमवारी समजावते.
मॉडेलच्या निर्णयापासून हालचालीपर्यंत
मॉडेलला कामाची सूचना, सध्याचे कॅमेरा-दृश्य, नकाशाचा संदर्भ, ग्रिपरची स्थिती, पुन्हा मिळवलेली निरीक्षणे आणि मागील कौशल्याचा निकाल दिला जातो. ते कौशल्य आणि लक्ष्याचे नाव असलेली संरचित सूचना पाठवते. वस्तू उचलताना लक्ष्य 0–1000 मापनावरील प्रतिमेतील बिंदू आणि कोणता हात वापरायचा याची निवड असते. स्थानिक दृश्य-आकलन वस्तूचे विभागीकरण करते, स्टिरिओ प्रतिमांमधून तिची खोली मोजते आणि निवडीचे त्रिमितीय पकडीत रूपांतर करते. त्यानंतर हाताचा नियोजक हालचालीचा मार्ग मोजून तपासतो. नेव्हिगेशनसाठी नकाशा-निर्देशांकांतील द्विमितीय लक्ष्य आणि तोंड करण्याचा बिंदू दिला जातो; वस्तू ठेवताना त्रिमितीय सोडण्याचा बिंदू वापरतात. कप्पा उघडण्याच्या कौशल्यात हँडलशी जुळवणे, ते अडकवणे आणि मागे चालत जाणे या क्रिया एकाच कृतीत समाविष्ट आहेत.
कौशल्ये लहान दुरुस्त्या स्थानिक पातळीवर करतात. जवळ जाताना दृश्याचा मागोवा घेणे आणि पकड चुकल्यास मर्यादित वेळा पुन्हा प्रयत्न करणे, असे टीम सांगते. दुरुस्ती अयशस्वी झाल्यास कौशल्य कारणासह निकाल Astra कडे पाठवते, जे पुढचा निर्णय घेते. चालणे आणि हात पुढे करणे AMO या पूर्वप्रशिक्षित पूर्ण-शरीर नियंत्रकावर अवलंबून असते. पानानुसार हात आणि बोटांच्या आज्ञा 250 Hz वेगाने चालतात, तर AMO धोरण 50 Hz वेगाने अद्ययावत होते. Astra दूरस्थपणे चालते; दृश्य-आकलन, हालचालीचे नियोजन आणि कौशल्ये RTX 4090 GPU असलेल्या लॅपटॉपवर चालतात.
Astra ठरवते कोणती कृती करून पाहायची आणि कुठे; कौशल्य-संग्रह आणि नियंत्रक ठरवतात कसे G1 हलतो. स्वयंपाकघरातील प्रात्यक्षिकांत विशिष्ट वातावरणासाठी प्रशिक्षण-डेटा किंवा अतिरिक्त धोरण-प्रशिक्षण वापरले नाही, असे टीम सांगते. तरी पूर्वप्रशिक्षित नियंत्रण आणि खोलीची विस्तृत पुनर्रचना या मांडणीचा भाग आहेत.
प्रात्यक्षिकांतून काय सिद्ध होते
प्रकल्पाच्या पानावर यापूर्वी न पाहिलेल्या स्वयंपाकघरातील दोन प्रत्यक्ष कामांच्या क्रमांचे वर्णन आहे. एका क्रमात कॉफीच्या पिशव्या एकत्र करणे आणि सांगितलेले दूध व संत्र्याच्या रसाचे कार्टन फेकणे समाविष्ट आहे. दुसऱ्या क्रमात G1 अपुरी माहिती असलेल्या सूचनेवरून औषधाची बाटली शोधतो, कप्प्यातून काढतो, ती देतो आणि एक कार्टन फेकतो. कौशल्यांच्या क्लिपमध्ये स्वतंत्र क्रिया आणि नोंदलेले पुनःप्रयत्न दिसतात; बहुतेक पूर्वदृश्ये वेगवान केली आहेत, असे पान सांगते आणि कप्प्यातून वस्तू उचलण्याच्या एका क्रमात सतत पुन्हा प्रयत्न होत असल्याचे दाखवते.
प्रकाशनात चाचण्यांची संख्या, कामांचा यश-दर, शिकलेल्या दृश्य-भाषा-कृती धोरणाशी तुलना किंवा स्वयंपाकघरातील प्रत्येक प्रयत्नाचा वेळ आणि खर्च दिलेला नाही. त्यामुळे हे स्थापत्याचे प्रात्यक्षिक आहे; इतर स्वयंपाकघरांत ही रचना विश्वासार्हपणे काम करते, असा मोजलेला दावा नाही. दुवा दिलेली सार्वजनिक रेपॉझिटरी सध्या “कोड लवकरच” असे सांगते आणि प्रकल्पाच्या पानावरील संशोधनपत्राचा दुवा जोडलेला नाही. रेपॉझिटरीत वेबसाइट, चित्रे आणि व्हिडिओ आहेत; रोबोटची अंमलबजावणी किंवा मूल्यमापनाच्या फाइल्स नाहीत. BIG CHANGE ने HomeBody चालवलेले किंवा रोबोटची चाचणी केलेली नाही.
BIG CHANGE च्या आधीच्या GPT-Policy अहवालात रोबोटच्या कृतींसाठीच्या संदर्भावर दुसऱ्या टीमच्या संशोधनपत्राचा आढावा घेतला होता. HomeBody च्या सामग्रीत त्या संशोधनपत्राचा या प्रणालीशी संबंध असल्याचे म्हटलेले नाही.
टीम काही व्यावहारिक मर्यादाही सांगते: डिजिटल प्रतिकृती तयार करण्यासाठी पूर्वतयारीचा वेळ आणि API खर्च येतो; Astra चे दूरस्थ तर्क कौशल्यांमध्ये थांबे निर्माण करते; G1 काय करू शकतो यावर हातांची पोहोच आणि वस्तू हाताळण्याची क्षमता मर्यादा आणते; आणि दीर्घकाळ वापरल्यास बोटांचे सर्वो गरम होऊ शकतात. स्थानिक प्रणालीसाठी RTX 4090 असलेला लॅपटॉप आवश्यक आहे; अधिक जड कौशल्यांना जास्त संगणकीय क्षमता लागू शकते.
स्रोत आणि पुढील वाचन
- Caltech आणि Stanford संशोधकांचे HomeBody प्रकल्प पान — प्रणाली, स्वयंपाकघरातील प्रात्यक्षिके, सिम्युलेशनमधील पुनर्दृश्य, कौशल्यांचे इंटरफेस, नियंत्रण प्रणाली आणि नमूद मर्यादा यांचे प्राथमिक वर्णन. पानावर सप्टेंबर 2026 ही तारीख आहे; निवडक व्हिडिओ आणि वर्णने टीमने दिलेला पुरावा आहेत, स्वतंत्र मूल्यमापन नव्हे.
- Stanford TML चे HomeBody सार्वजनिक रेपॉझिटरी — प्रकल्पाच्या पानाने दिलेला दुवा. 27 सप्टेंबर 2026 रोजी तपासले असता README मध्ये कोड लवकरच येईल असे म्हटले होते; सार्वजनिक फाइल्समध्ये रोबोटची अंमलबजावणी किंवा पूर्ण संशोधनपत्राऐवजी वेबसाइटची सामग्री होती.



