செப்டம்பர் மாத “In-Context Robot Learning with VLM Agents” என்ற arXiv முன்வெளியீட்டு ஆய்வு, GPT-Policy-ஐ அறிமுகப்படுத்துகிறது. செயல்விளக்கங்கள், படங்கள், தொடர்பு வரலாறு ஆகியவற்றைப் பயன்படுத்தி, நிலையான பார்வை–மொழி மாடலை ரோபோ கருவிகளுடன் இது இணைக்கிறது. ரோபோக் கைப் பணிகளும் நகரும் சூழல் ஆராய்ச்சியும் அதன் சோதனைகளில் அடங்கும். GPT-6 Astra மற்றும் Unitree G1 குறித்த தனியான Reddit பதிவின் கூற்றை அது சரிபார்க்கவில்லை.

முக்கிய மாற்றம்

  • என்ன மாறியது: பொதுவான பார்வை–மொழி மாடல், செயல்விளக்கங்களையும் தற்போதைய கேமரா காட்சிகளையும் கட்டமைக்கப்பட்ட ரோபோ கருவிக் கோரிக்கைகளாக மாற்றி, பின்னர் இயக்கப் பின்னூட்டத்தின் அடிப்படையில் அடுத்த செயலைத் தேர்ந்தெடுக்க GPT-Policy வழிவகுக்கிறது. இதற்காக மாடலின் பணிக்கே உரிய எடைகளைப் புதுப்பிக்க வேண்டியதில்லை.
  • இது ஏன் முக்கியம்: இந்த அணுகுமுறை பரந்த காட்சிப் பகுத்தறிவையும் இயக்கச் சரிபார்ப்பு மற்றும் செயல்படுத்தலையும் தனித்தனியாகக் கையாள்கிறது. ஆசிரியர்களின் வரையறுக்கப்பட்ட சோதனைகளில், கூடுதல் சூழல் சில பணிகளுக்கு உதவியது; தொடுதல் உணர்வுள்ள செயல்களுக்கு சில நேரங்களில் ரோபோச் செயல்களுடன் சீரமைக்கப்பட்ட குறிப்புகள் தேவைப்பட்டன.
  • கவனிக்க வேண்டியது: ஒவ்வொரு நிபந்தனைக்கும் மூன்று சோதனைகள் மட்டுமே என ஆய்வறிக்கை தெரிவிக்கிறது; ரோபோக் கை மோதல்கள் உட்பட மெதுவான, தோல்வியடையக்கூடிய இயக்கங்களையும் விவரிக்கிறது. மனிதர்களைச் சுற்றி ரோபோக்கள் செயல்படுவது குறித்து இம்முடிவுகள் உறுதியாகச் சொல்வதற்கு முன், மீளுருவாக்கச் சோதனைகள், பெரிய மதிப்பீடுகள், சுயாதீனப் பாதுகாப்புக் கட்டுப்பாடுகள் அவசியம்.

GPT-Policy என்ன செய்கிறது

இந்த ஆய்வு செப்டம்பர் 16 அன்று arXiv-இல் சமர்ப்பிக்கப்பட்டது. நுணுக்கப் பயிற்சியின்றியோ, பணிக்கென அமைத்த மாடல் அளவுருக்களை மாற்றாமலோ, புதிய தொடக்கநிலையிலிருந்து ஒரு பணியைச் செய்யப் பொதுவான பார்வை–மொழி மாடல் எடுத்துக்காட்டுகளையும் பின்னூட்டத்தையும் பயன்படுத்த முடியுமா என அது கேட்கிறது. தங்கள் கட்டமைப்பை GPT-Policy என ஆசிரியர்கள் அழைத்து, மதிப்பீடு செய்த மாடல்களில் GPT-6 Astra-வையும் குறிப்பிடுகின்றனர்.

பணி அறிவுறுத்தல், தற்போதைய கேமரா காட்சிகள் மற்றும் நிலை ஆகியவற்றுடன், விருப்பத்திற்கேற்ப மனிதர் செய்த செயல்விளக்கக் காணொளிகள், செயல்க் குறிப்புகளுடன் கூடிய ரோபோ செயல்விளக்கங்கள், இலக்குப் படம், முந்தைய ரோபோ முயற்சிகள் அல்லது மனிதருடனான தொடர்பு ஆகியவற்றையும் அமைப்பு சேர்க்கிறது. சூழல் தொகுப்பி பணிக்குத் தொடர்புடைய காட்சிமாற்றங்களைத் தேர்ந்தெடுத்து, அறிவுறுத்தல்கள், கட்டுப்பாடுகள், கருவி வடிவங்களுடன் இணைக்கிறது. பின்னர் VLM, கட்டமைக்கப்பட்ட ரோபோக் கருவிக் கோரிக்கையை முன்மொழிகிறது.

அந்தக் கோரிக்கை, குறிப்பிட்ட ரோபோ உடலமைப்புக்கான கட்டுப்படுத்தியிடம் செல்கிறது. இயக்கத்தைச் செயல்படுத்துவதற்கு முன் அல்லது நிராகரிப்பதற்கு முன் inverse-kinematics தீர்வுகளைச் சரிபார்த்தல், Cartesian நிலைகளை மாதிரியாகத் தேர்ந்தெடுத்தல், மூட்டு இயக்கக் குறிப்புகளுக்கான நேரத்தை நிர்ணயித்தல் ஆகியவற்றை ஆசிரியர்கள் விவரிக்கின்றனர். அடுத்த மாடல் முடிவுக்காக கட்டுப்படுத்தி கவனிப்புகளையும் இயக்கப் பின்னூட்டத்தையும் திருப்பி வழங்குகிறது. மாடல் செயல்களை முன்மொழிகிறது; ரோபோவுக்குரிய குறியீடு அவற்றைச் சரிபார்த்துச் செயல்படுத்துகிறது.

இந்தச் சுற்றுச் செயல்முறையே ஆய்வறிக்கையின் முக்கியப் பங்களிப்பு. சாய்வு புதுப்பிப்பு இன்றியே, எடுத்துக்காட்டுகளுக்கும் அண்மைய முடிவுகளுக்கும் ஏற்ப அடுத்த செயலை நிலையான VLM மாற்றிக்கொள்ள இது உதவுகிறது. இங்கு “சூழலுக்குள் கற்றல்” என்பது ஒரு பணியின்போது வழங்கப்படும் தகவலை அமைப்பு பயன்படுத்துவதைக் குறிக்கிறது. மாடல் நிரந்தரமாகப் புதிய திறனைக் கற்றுக்கொண்டது என்றோ, எல்லா ரோபோக்களும் ஒரே கருவி இடைமுகத்தை இயக்கலாம் என்றோ இதற்குப் பொருளல்ல.

சோதனைகள் எதை அளவிட்டன

பத்து ரோபோப் பணிகளில் ஐந்து வகைச் சோதனைகளை ஆசிரியர்கள் தெரிவிக்கின்றனர்; ஒவ்வொரு நிபந்தனையிலும் மூன்று சோதனைகள் நடத்தப்பட்டன. அவர்களின் திட்டப் பக்கம் உண்மையான ரோபோ இயக்கங்களையும், பணிகளின் முடிவு, முடிவெடுப்பு, கடந்த நேரம் ஆகியவற்றையும் பட்டியலிடுகிறது. துண்டை எடுக்கும் பணியில், மனிதர் செய்த காணொளியுடன் GPT-6 Astra மூன்று சோதனைகளில் இரண்டை வென்றது; காணொளியின்றி ஒன்றையும் வெல்லவில்லை. நோட்டுப் புத்தகத்தை எடுக்கும் பணியிலும் செயல்விளக்கம் இன்றி மூன்றில் பூஜ்யத்திலிருந்து, செயல்விளக்கத்துடன் மூன்றில் இரண்டாக உயர்ந்தது.

தொடுதல் தேவைப்படும் பணிகள் கூடுதல் சூழல் ஏன் பொதுவான தீர்வு அல்ல என்பதைக் காட்டுகின்றன. பாட்டில் மூடியைத் திருகித் திறக்கும் பணியில், ரோபோக் காணொளியுடன் மூன்றில் இரண்டு முறை வெற்றி கிடைத்தது; அதனுடன் சீரமைக்கப்பட்ட ரோபோச் செயல்களையும் சேர்த்தபோது மூன்றிலும் வெற்றி கிடைத்தது. மின்செருகியை அகற்றி மீண்டும் செருகும் பணியில், காணொளி மட்டும் இருந்தபோது மூன்றிலும் வெற்றி இல்லை; காணொளியுடன் செயல்க் குறிப்புகளையும் சேர்த்தபோது இரண்டில் வெற்றி கிடைத்தது. இவை ஒவ்வொரு நிபந்தனையிலும் கிடைத்த சிறிய எண்ணிக்கைகள்; நம்பகத்தன்மை மதிப்பீடுகள் அல்ல.

இலக்குப் படத்தைக் கொண்டு கட்டங்களை அல்லது பழங்களை அமைக்கும் பணிகளிலும், மனிதருடனான இரண்டு தொடர்புப் பணிகளிலும் மூன்றுக்கு மூன்று வெற்றிகளைத் திட்டம் தெரிவிக்கிறது. தன்னுடனான தொடர்பு வரலாற்றைப் பயன்படுத்தியபோது, “Lemon to Pink Plate”, “Movable Exploration” ஆகிய இரண்டிலும் மூன்றுக்கு மூன்று வெற்றி கிடைத்ததாக ஆய்வறிக்கை கூறுகிறது. இரண்டாவது பணியில் இலக்கைத் தேடும்போது ரோபோ தடைகளைத் தீவிரமாகத் தவிர்த்தது; சராசரியாக 25.53 நிமிடங்கள் எடுத்தது. படம் 1-லும் நகரும் பொருளை மீட்டெடுப்பது காட்டப்படுகிறது. இதனால் மேசைமீது பொருட்களைக் கையாள்வதைத் தாண்டிய பணிகளும் ஆய்வில் உள்ளன; இருப்பினும் ஒவ்வொரு நிபந்தனைக்கும் மூன்று சோதனைகள் கொண்ட தேர்ந்தெடுக்கப்பட்ட பணிகளே அவை. இயக்கங்கள் நிமிடங்கள் எடுத்தன: மனிதர் செய்த காணொளியுடன் துண்டை எடுப்பதற்கு சராசரியாக 18.9 நிமிடங்களும், காணொளி மற்றும் செயல்க் குறிப்புகளுடன் பாட்டில் மூடியைத் திறப்பதற்கு 17.9 நிமிடங்களும் ஆனதாகத் திட்டப் பக்கம் தெரிவிக்கிறது. ஆகவே தாமதமும் இயக்கச் செலவும் தீர்க்கப்பட்ட விவரங்கள் அல்ல; நடைமுறையில் கவனிக்க வேண்டிய கேள்விகளாகவே உள்ளன.

ஆய்வறிக்கையில் விவரிக்கப்பட்ட ரோபோ அமைப்புகளில் YAM, ARX X5 ஆகியவற்றுடன் Morphi Kino-வையும் பின் இணைப்பு B பட்டியலிடுகிறது. Morphi Kino-வுக்கு நகரும் அடித்தளம், இடுப்பு, தலை, ஏழு மூட்டுகள் கொண்ட இரு கைகள் உள்ளதாக அது குறிப்பிடுகிறது. எனவே கைமேடை அமைப்புகளுடன் நகரும் மேடை அமைப்பும் ஆய்வில் இடம்பெறுகிறது; ஆனால் Unitree G1 எனப் பின் இணைப்பு அடையாளப்படுத்தவில்லை.

ஆய்வின் நகரும் பணி Reddit சூழலை நிறுவவில்லை

அந்த Reddit பதிவு அறிமுகமில்லாத அறையில் Unitree G1-ஐ GPT-6 Astra கட்டுப்படுத்தி, பொருட்கள் எங்கு உள்ளன என்பதை நினைவில் வைத்து, தெளிவற்ற கோரிக்கைகளின் பேரில் பின்னர் அவற்றை எடுப்பதாகக் கூறுகிறது. ஆய்வறிக்கை வேறான “Movable Exploration” பணியைத் தெரிவித்து, Morphi Kino-வை நகரும் அடித்தளமுள்ள மேடையாக விவரிக்கிறது; ஆனால் அந்த Reddit பதிவின் G1 சூழல் GPT-Policy சோதனை என ஆய்வறிக்கையோ திட்டப் பொருட்களோ பொது GitHub களஞ்சியமோ அடையாளப்படுத்தவில்லை. அந்தப் பதிவு தனியான, சரிபார்க்கப்படாத கூற்றாகவே உள்ளது; இந்த ஒப்பீடு அதை மறுக்கவும் இல்லை.

ஆசிரியர்களின் திட்டப் பக்கத்தில் பரிசோதனைகளின் காணொளிகள் உள்ளன. அவை தாங்கள் தெரிவித்த பணிகளுக்கான சான்றுகள்; சுயாதீனச் சரிபார்ப்பு அல்ல. பொது குறியீட்டுக் களஞ்சியத்தில் தற்போது ARX X5 மற்றும் I2RT/YAM-க்கான adapters மட்டும் பட்டியலிடப்பட்டுள்ளன. deployment host-கள், தனிப்பட்ட prompts, இயக்கப் பதிவுகள், தளத்துக்கே உரிய calibration, மதிப்பீட்டு வரலாறு ஆகியவை பொது கோப்பமைப்பில் இல்லை என்றும் அது கூறுகிறது. அந்த adapter பட்டியல் வெளியிடப்பட்ட களஞ்சியத்தை மட்டுமே விவரிக்கிறது; நகரும் சூழல் ஆய்வையும் பின் இணைப்பு B-இல் உள்ள Morphi Kino-வையும் சேர்த்துள்ள முழு ஆய்வறிக்கையின் வரம்பை அது வரையறுக்கவில்லை. வெளியிடப்பட்ட இயக்கங்களை BIG CHANGE மீண்டும் உருவாக்கத் தேவையான விவரங்கள் கிடைக்கும் பொருட்களில் இல்லை; நாங்களும் ரோபோவைச் சோதிக்கவில்லை.

கட்டுப்பாட்டு எல்லையும் இன்னும் முக்கியம்

நீண்ட செயல்வரிசைகளையும் செயல்படுத்தலில் ஏற்பட்ட சிக்கல்களையும் திட்டப் பக்கம் தெரிவிக்கிறது. இரு கைகளுக்கிடையே மோதல்கள் ஏற்பட்டதைப் பார்த்தபோது, பாதுகாப்பாகத் தன்னாட்சியில் இயக்கப் போதுமான பாதுகாப்புகள் இல்லை என்பது தெரியவந்ததாக அதன் விவாதம் கூறுகிறது. உடல்ரீதியான இடைவெளி மற்றும் தொடுதலைச் சுயாதீனமாகக் கண்காணித்தல், வேகமான கீழ்நிலை கட்டுப்பாடு, பாதுகாப்பான மீட்பு ஆகியவற்றை அது கோருகிறது. சில தவறான இயக்கங்களை நிராகரிக்கும் கட்டுப்படுத்தி இருப்பது மட்டுமே முழுமையான பாதுகாப்பு அமைப்பு என்பதில்லை.

இந்த ஆய்வு ஒரு தெளிவான ஆராய்ச்சி முடிவை வழங்குகிறது: குறிப்பிட்ட பணிகளில் ரோபோக் கருவிகளை வழிநடத்த பொதுவான VLM-க்கு சூழல் உதவலாம்; எந்த வகைச் சூழல் வழங்கப்படுகிறது என்பதும் முக்கியம். மதிப்பீட்டின் அளவு, ஒவ்வொரு இயக்கத்துக்கும் எடுத்த நேரம், முழுமையற்ற பொது மறுஉருவாக்கப் பொருட்கள், தெரிவிக்கப்பட்ட மோதல்கள் ஆகியவற்றைக் கருத்தில் கொண்டால், திறந்த முடிவுள்ள கோரிக்கைகளை நம்பகமாகப் புரிந்து செயல்படுத்தும் வீட்டுப் பயன்பாட்டு மனித உருவ ரோபோக்கான சான்றிலிருந்து இந்த முடிவு இன்னும் வெகுதூரத்தில் உள்ளது.

ஆதாரங்களும் மேலதிக வாசிப்பும்