செப்டம்பர் மாத “In-Context Robot Learning with VLM Agents” என்ற arXiv முன்வெளியீட்டு ஆய்வு, GPT-Policy-ஐ அறிமுகப்படுத்துகிறது. செயல்விளக்கங்கள், படங்கள், தொடர்பு வரலாறு ஆகியவற்றைப் பயன்படுத்தி, நிலையான பார்வை–மொழி மாடலை ரோபோ கருவிகளுடன் இது இணைக்கிறது. ரோபோக் கைப் பணிகளும் நகரும் சூழல் ஆராய்ச்சியும் அதன் சோதனைகளில் அடங்கும். GPT-6 Astra மற்றும் Unitree G1 குறித்த தனியான Reddit பதிவின் கூற்றை அது சரிபார்க்கவில்லை.
முக்கிய மாற்றம்
- என்ன மாறியது: பொதுவான பார்வை–மொழி மாடல், செயல்விளக்கங்களையும் தற்போதைய கேமரா காட்சிகளையும் கட்டமைக்கப்பட்ட ரோபோ கருவிக் கோரிக்கைகளாக மாற்றி, பின்னர் இயக்கப் பின்னூட்டத்தின் அடிப்படையில் அடுத்த செயலைத் தேர்ந்தெடுக்க GPT-Policy வழிவகுக்கிறது. இதற்காக மாடலின் பணிக்கே உரிய எடைகளைப் புதுப்பிக்க வேண்டியதில்லை.
- இது ஏன் முக்கியம்: இந்த அணுகுமுறை பரந்த காட்சிப் பகுத்தறிவையும் இயக்கச் சரிபார்ப்பு மற்றும் செயல்படுத்தலையும் தனித்தனியாகக் கையாள்கிறது. ஆசிரியர்களின் வரையறுக்கப்பட்ட சோதனைகளில், கூடுதல் சூழல் சில பணிகளுக்கு உதவியது; தொடுதல் உணர்வுள்ள செயல்களுக்கு சில நேரங்களில் ரோபோச் செயல்களுடன் சீரமைக்கப்பட்ட குறிப்புகள் தேவைப்பட்டன.
- கவனிக்க வேண்டியது: ஒவ்வொரு நிபந்தனைக்கும் மூன்று சோதனைகள் மட்டுமே என ஆய்வறிக்கை தெரிவிக்கிறது; ரோபோக் கை மோதல்கள் உட்பட மெதுவான, தோல்வியடையக்கூடிய இயக்கங்களையும் விவரிக்கிறது. மனிதர்களைச் சுற்றி ரோபோக்கள் செயல்படுவது குறித்து இம்முடிவுகள் உறுதியாகச் சொல்வதற்கு முன், மீளுருவாக்கச் சோதனைகள், பெரிய மதிப்பீடுகள், சுயாதீனப் பாதுகாப்புக் கட்டுப்பாடுகள் அவசியம்.
GPT-Policy என்ன செய்கிறது
இந்த ஆய்வு செப்டம்பர் 16 அன்று arXiv-இல் சமர்ப்பிக்கப்பட்டது. நுணுக்கப் பயிற்சியின்றியோ, பணிக்கென அமைத்த மாடல் அளவுருக்களை மாற்றாமலோ, புதிய தொடக்கநிலையிலிருந்து ஒரு பணியைச் செய்யப் பொதுவான பார்வை–மொழி மாடல் எடுத்துக்காட்டுகளையும் பின்னூட்டத்தையும் பயன்படுத்த முடியுமா என அது கேட்கிறது. தங்கள் கட்டமைப்பை GPT-Policy என ஆசிரியர்கள் அழைத்து, மதிப்பீடு செய்த மாடல்களில் GPT-6 Astra-வையும் குறிப்பிடுகின்றனர்.
பணி அறிவுறுத்தல், தற்போதைய கேமரா காட்சிகள் மற்றும் நிலை ஆகியவற்றுடன், விருப்பத்திற்கேற்ப மனிதர் செய்த செயல்விளக்கக் காணொளிகள், செயல்க் குறிப்புகளுடன் கூடிய ரோபோ செயல்விளக்கங்கள், இலக்குப் படம், முந்தைய ரோபோ முயற்சிகள் அல்லது மனிதருடனான தொடர்பு ஆகியவற்றையும் அமைப்பு சேர்க்கிறது. சூழல் தொகுப்பி பணிக்குத் தொடர்புடைய காட்சிமாற்றங்களைத் தேர்ந்தெடுத்து, அறிவுறுத்தல்கள், கட்டுப்பாடுகள், கருவி வடிவங்களுடன் இணைக்கிறது. பின்னர் VLM, கட்டமைக்கப்பட்ட ரோபோக் கருவிக் கோரிக்கையை முன்மொழிகிறது.
அந்தக் கோரிக்கை, குறிப்பிட்ட ரோபோ உடலமைப்புக்கான கட்டுப்படுத்தியிடம் செல்கிறது. இயக்கத்தைச் செயல்படுத்துவதற்கு முன் அல்லது நிராகரிப்பதற்கு முன் inverse-kinematics தீர்வுகளைச் சரிபார்த்தல், Cartesian நிலைகளை மாதிரியாகத் தேர்ந்தெடுத்தல், மூட்டு இயக்கக் குறிப்புகளுக்கான நேரத்தை நிர்ணயித்தல் ஆகியவற்றை ஆசிரியர்கள் விவரிக்கின்றனர். அடுத்த மாடல் முடிவுக்காக கட்டுப்படுத்தி கவனிப்புகளையும் இயக்கப் பின்னூட்டத்தையும் திருப்பி வழங்குகிறது. மாடல் செயல்களை முன்மொழிகிறது; ரோபோவுக்குரிய குறியீடு அவற்றைச் சரிபார்த்துச் செயல்படுத்துகிறது.
இந்தச் சுற்றுச் செயல்முறையே ஆய்வறிக்கையின் முக்கியப் பங்களிப்பு. சாய்வு புதுப்பிப்பு இன்றியே, எடுத்துக்காட்டுகளுக்கும் அண்மைய முடிவுகளுக்கும் ஏற்ப அடுத்த செயலை நிலையான VLM மாற்றிக்கொள்ள இது உதவுகிறது. இங்கு “சூழலுக்குள் கற்றல்” என்பது ஒரு பணியின்போது வழங்கப்படும் தகவலை அமைப்பு பயன்படுத்துவதைக் குறிக்கிறது. மாடல் நிரந்தரமாகப் புதிய திறனைக் கற்றுக்கொண்டது என்றோ, எல்லா ரோபோக்களும் ஒரே கருவி இடைமுகத்தை இயக்கலாம் என்றோ இதற்குப் பொருளல்ல.
சோதனைகள் எதை அளவிட்டன
பத்து ரோபோப் பணிகளில் ஐந்து வகைச் சோதனைகளை ஆசிரியர்கள் தெரிவிக்கின்றனர்; ஒவ்வொரு நிபந்தனையிலும் மூன்று சோதனைகள் நடத்தப்பட்டன. அவர்களின் திட்டப் பக்கம் உண்மையான ரோபோ இயக்கங்களையும், பணிகளின் முடிவு, முடிவெடுப்பு, கடந்த நேரம் ஆகியவற்றையும் பட்டியலிடுகிறது. துண்டை எடுக்கும் பணியில், மனிதர் செய்த காணொளியுடன் GPT-6 Astra மூன்று சோதனைகளில் இரண்டை வென்றது; காணொளியின்றி ஒன்றையும் வெல்லவில்லை. நோட்டுப் புத்தகத்தை எடுக்கும் பணியிலும் செயல்விளக்கம் இன்றி மூன்றில் பூஜ்யத்திலிருந்து, செயல்விளக்கத்துடன் மூன்றில் இரண்டாக உயர்ந்தது.
தொடுதல் தேவைப்படும் பணிகள் கூடுதல் சூழல் ஏன் பொதுவான தீர்வு அல்ல என்பதைக் காட்டுகின்றன. பாட்டில் மூடியைத் திருகித் திறக்கும் பணியில், ரோபோக் காணொளியுடன் மூன்றில் இரண்டு முறை வெற்றி கிடைத்தது; அதனுடன் சீரமைக்கப்பட்ட ரோபோச் செயல்களையும் சேர்த்தபோது மூன்றிலும் வெற்றி கிடைத்தது. மின்செருகியை அகற்றி மீண்டும் செருகும் பணியில், காணொளி மட்டும் இருந்தபோது மூன்றிலும் வெற்றி இல்லை; காணொளியுடன் செயல்க் குறிப்புகளையும் சேர்த்தபோது இரண்டில் வெற்றி கிடைத்தது. இவை ஒவ்வொரு நிபந்தனையிலும் கிடைத்த சிறிய எண்ணிக்கைகள்; நம்பகத்தன்மை மதிப்பீடுகள் அல்ல.
இலக்குப் படத்தைக் கொண்டு கட்டங்களை அல்லது பழங்களை அமைக்கும் பணிகளிலும், மனிதருடனான இரண்டு தொடர்புப் பணிகளிலும் மூன்றுக்கு மூன்று வெற்றிகளைத் திட்டம் தெரிவிக்கிறது. தன்னுடனான தொடர்பு வரலாற்றைப் பயன்படுத்தியபோது, “Lemon to Pink Plate”, “Movable Exploration” ஆகிய இரண்டிலும் மூன்றுக்கு மூன்று வெற்றி கிடைத்ததாக ஆய்வறிக்கை கூறுகிறது. இரண்டாவது பணியில் இலக்கைத் தேடும்போது ரோபோ தடைகளைத் தீவிரமாகத் தவிர்த்தது; சராசரியாக 25.53 நிமிடங்கள் எடுத்தது. படம் 1-லும் நகரும் பொருளை மீட்டெடுப்பது காட்டப்படுகிறது. இதனால் மேசைமீது பொருட்களைக் கையாள்வதைத் தாண்டிய பணிகளும் ஆய்வில் உள்ளன; இருப்பினும் ஒவ்வொரு நிபந்தனைக்கும் மூன்று சோதனைகள் கொண்ட தேர்ந்தெடுக்கப்பட்ட பணிகளே அவை. இயக்கங்கள் நிமிடங்கள் எடுத்தன: மனிதர் செய்த காணொளியுடன் துண்டை எடுப்பதற்கு சராசரியாக 18.9 நிமிடங்களும், காணொளி மற்றும் செயல்க் குறிப்புகளுடன் பாட்டில் மூடியைத் திறப்பதற்கு 17.9 நிமிடங்களும் ஆனதாகத் திட்டப் பக்கம் தெரிவிக்கிறது. ஆகவே தாமதமும் இயக்கச் செலவும் தீர்க்கப்பட்ட விவரங்கள் அல்ல; நடைமுறையில் கவனிக்க வேண்டிய கேள்விகளாகவே உள்ளன.
ஆய்வறிக்கையில் விவரிக்கப்பட்ட ரோபோ அமைப்புகளில் YAM, ARX X5 ஆகியவற்றுடன் Morphi Kino-வையும் பின் இணைப்பு B பட்டியலிடுகிறது. Morphi Kino-வுக்கு நகரும் அடித்தளம், இடுப்பு, தலை, ஏழு மூட்டுகள் கொண்ட இரு கைகள் உள்ளதாக அது குறிப்பிடுகிறது. எனவே கைமேடை அமைப்புகளுடன் நகரும் மேடை அமைப்பும் ஆய்வில் இடம்பெறுகிறது; ஆனால் Unitree G1 எனப் பின் இணைப்பு அடையாளப்படுத்தவில்லை.
ஆய்வின் நகரும் பணி Reddit சூழலை நிறுவவில்லை
அந்த Reddit பதிவு அறிமுகமில்லாத அறையில் Unitree G1-ஐ GPT-6 Astra கட்டுப்படுத்தி, பொருட்கள் எங்கு உள்ளன என்பதை நினைவில் வைத்து, தெளிவற்ற கோரிக்கைகளின் பேரில் பின்னர் அவற்றை எடுப்பதாகக் கூறுகிறது. ஆய்வறிக்கை வேறான “Movable Exploration” பணியைத் தெரிவித்து, Morphi Kino-வை நகரும் அடித்தளமுள்ள மேடையாக விவரிக்கிறது; ஆனால் அந்த Reddit பதிவின் G1 சூழல் GPT-Policy சோதனை என ஆய்வறிக்கையோ திட்டப் பொருட்களோ பொது GitHub களஞ்சியமோ அடையாளப்படுத்தவில்லை. அந்தப் பதிவு தனியான, சரிபார்க்கப்படாத கூற்றாகவே உள்ளது; இந்த ஒப்பீடு அதை மறுக்கவும் இல்லை.
ஆசிரியர்களின் திட்டப் பக்கத்தில் பரிசோதனைகளின் காணொளிகள் உள்ளன. அவை தாங்கள் தெரிவித்த பணிகளுக்கான சான்றுகள்; சுயாதீனச் சரிபார்ப்பு அல்ல. பொது குறியீட்டுக் களஞ்சியத்தில் தற்போது ARX X5 மற்றும் I2RT/YAM-க்கான adapters மட்டும் பட்டியலிடப்பட்டுள்ளன. deployment host-கள், தனிப்பட்ட prompts, இயக்கப் பதிவுகள், தளத்துக்கே உரிய calibration, மதிப்பீட்டு வரலாறு ஆகியவை பொது கோப்பமைப்பில் இல்லை என்றும் அது கூறுகிறது. அந்த adapter பட்டியல் வெளியிடப்பட்ட களஞ்சியத்தை மட்டுமே விவரிக்கிறது; நகரும் சூழல் ஆய்வையும் பின் இணைப்பு B-இல் உள்ள Morphi Kino-வையும் சேர்த்துள்ள முழு ஆய்வறிக்கையின் வரம்பை அது வரையறுக்கவில்லை. வெளியிடப்பட்ட இயக்கங்களை BIG CHANGE மீண்டும் உருவாக்கத் தேவையான விவரங்கள் கிடைக்கும் பொருட்களில் இல்லை; நாங்களும் ரோபோவைச் சோதிக்கவில்லை.
கட்டுப்பாட்டு எல்லையும் இன்னும் முக்கியம்
நீண்ட செயல்வரிசைகளையும் செயல்படுத்தலில் ஏற்பட்ட சிக்கல்களையும் திட்டப் பக்கம் தெரிவிக்கிறது. இரு கைகளுக்கிடையே மோதல்கள் ஏற்பட்டதைப் பார்த்தபோது, பாதுகாப்பாகத் தன்னாட்சியில் இயக்கப் போதுமான பாதுகாப்புகள் இல்லை என்பது தெரியவந்ததாக அதன் விவாதம் கூறுகிறது. உடல்ரீதியான இடைவெளி மற்றும் தொடுதலைச் சுயாதீனமாகக் கண்காணித்தல், வேகமான கீழ்நிலை கட்டுப்பாடு, பாதுகாப்பான மீட்பு ஆகியவற்றை அது கோருகிறது. சில தவறான இயக்கங்களை நிராகரிக்கும் கட்டுப்படுத்தி இருப்பது மட்டுமே முழுமையான பாதுகாப்பு அமைப்பு என்பதில்லை.
இந்த ஆய்வு ஒரு தெளிவான ஆராய்ச்சி முடிவை வழங்குகிறது: குறிப்பிட்ட பணிகளில் ரோபோக் கருவிகளை வழிநடத்த பொதுவான VLM-க்கு சூழல் உதவலாம்; எந்த வகைச் சூழல் வழங்கப்படுகிறது என்பதும் முக்கியம். மதிப்பீட்டின் அளவு, ஒவ்வொரு இயக்கத்துக்கும் எடுத்த நேரம், முழுமையற்ற பொது மறுஉருவாக்கப் பொருட்கள், தெரிவிக்கப்பட்ட மோதல்கள் ஆகியவற்றைக் கருத்தில் கொண்டால், திறந்த முடிவுள்ள கோரிக்கைகளை நம்பகமாகப் புரிந்து செயல்படுத்தும் வீட்டுப் பயன்பாட்டு மனித உருவ ரோபோக்கான சான்றிலிருந்து இந்த முடிவு இன்னும் வெகுதூரத்தில் உள்ளது.
ஆதாரங்களும் மேலதிக வாசிப்பும்
- Cheng மற்றும் இணை ஆசிரியர்கள், “In-Context Robot Learning with VLM Agents” (arXiv:2609.19138, பதிப்பு 1, 2026 செப்டம்பர் 16 அன்று சமர்ப்பிக்கப்பட்டது) — முறை, மதிப்பீடு, கூறப்பட்ட வரம்புகளுக்கான முதன்மை முன்வெளியீடு; சக மதிப்பாய்வு செய்யப்பட்ட சான்றோ செயல்படுத்தல் அறிக்கையோ அல்ல.
- ஆசிரியர்களின் GPT-Policy திட்டப் பக்கம் — சோதனை விளக்கங்கள், காணொளிகள், ஒவ்வொரு நிபந்தனைக்குமான முடிவுகள், விவாதம். இவை ஆசிரியர்களின் சொந்தப் பொருட்கள்.
- ஆசிரியர்களின் GPT-Policy பொது குறியீட்டுக் களஞ்சியம் — தற்போது வெளியிடப்பட்ட ரோபோக் கை adapters மற்றும் பொது கோப்பமைப்பில் சேர்க்கப்படாதவை குறித்து ஆவணப்படுத்துகிறது; களஞ்சியம் இருப்பதாலேயே தெரிவிக்கப்பட்ட சோதனையை மீண்டும் செய்யலாம் என நிரூபிக்கப்படாது.
- இந்த அறிக்கைக்குத் தூண்டுகோலான Reddit பதிவு — Unitree G1 குறித்த கூற்றின் மூலம்; அந்தச் சூழலை ஆய்வறிக்கையோ பட்டியலிடப்பட்ட ரோபோக் கை மேடைகளோ செய்தன என்பதற்கான சான்றை இந்தப் பதிவு வழங்கவில்லை.



