సెప్టెంబరులో వెలువడిన arXiv ప్రిప్రింట్ “In-Context Robot Learning with VLM Agents”, ప్రదర్శనలు, చిత్రాలు, పరస్పర చర్యల చరిత్రను ఉపయోగించి స్థిరమైన దృష్టి-భాషా మోడల్ను రోబోట్ టూల్స్తో అనుసంధానించే GPT-Policyని పరిచయం చేస్తుంది. ఇందులో రోబోట్ చేతి పనులు, మొబైల్ అన్వేషణ ప్రయోగాలున్నాయి. అయితే వేరుగా వచ్చిన GPT-6 Astra, Unitree G1 గురించి Reddit పోస్ట్ చేసిన వాదనను ఈ ప్రయోగాలు ధృవీకరించవు.
ముఖ్యమైన మార్పు
- ఏం మారింది: ప్రదర్శనలు, ప్రస్తుత కెమెరా దృశ్యాలను ఉపయోగించి, సాధారణ దృష్టి-భాషా మోడల్ను రోబోట్ టూల్ అభ్యర్థనలుగా మార్చే క్రమబద్ధమైన పద్ధతిని GPT-Policy అందిస్తుంది. ఆ తర్వాత అమలు ఫీడ్బ్యాక్ను ఉపయోగించి, మోడల్ తన పని-నిర్దిష్ట బరువులను నవీకరించకుండా తదుపరి చర్యను ఎంచుకుంటుంది.
- ఇది ఎందుకు ముఖ్యం: ఈ విధానం విస్తృత దృశ్య తర్కాన్ని కదలిక తనిఖీలు, అమలు నుంచి వేరు చేస్తుంది. రచయితలు నిర్వహించిన పరిమిత పరీక్షల్లో, అదనపు సందర్భం కొన్ని పనుల్లో సహాయపడింది; వస్తువును తాకి చేసే కొన్ని చర్యలకు మాత్రం సరిపోల్చిన రోబోట్-చర్య సూచనలు అవసరమయ్యాయి.
- ఏమి గమనించాలి: ఒక్కో పరిస్థితికి మూడు ప్రయత్నాలనే పరిశోధనా పత్రం నివేదిస్తుంది; చేతికి ఢీకొన్న సందర్భాలు సహా నెమ్మదిగా, తరచూ విఫలమైన ప్రయోగాలను వివరిస్తుంది. ఈ ఫలితాలు మనుషుల సమీపంలో పనిచేసే రోబోట్ల గురించి చెప్పేముందు, మళ్లీ పరీక్షించడం, పెద్ద మూల్యాంకనాలు, స్వతంత్ర భద్రతా నియంత్రణలు ముఖ్యం.
GPT-Policy ఏం చేస్తుంది
ఈ పత్రం సెప్టెంబర్ 16న arXivకు సమర్పించబడింది. సార్వత్రిక దృష్టి-భాషా మోడల్, సన్నగా సర్దుబాటు చేయకుండా లేదా పని-నిర్దిష్ట మోడల్ పరామితులను మార్చకుండా, ఉదాహరణలు, ఫీడ్బ్యాక్తో కొత్త ప్రారంభ స్థితి నుంచి పని చేయగలదా అని ఇది పరిశీలిస్తుంది. తమ విధానానికి రచయితలు GPT-Policy అని పేరు పెట్టారు; మూల్యాంకనం చేసిన మోడళ్లలో GPT-6 Astraనూ చేర్చారు.
వ్యవస్థ అనేక రకాల సందర్భాలను సమీకరిస్తుంది: పనికి సంబంధించిన ఆదేశం, ప్రస్తుత కెమెరా దృశ్యాలు, స్థితి; అదనంగా ఐచ్చికంగా మానవ ప్రదర్శన వీడియోలు, చర్య సూచనలతో కూడిన రోబోట్ ప్రదర్శనలు, లక్ష్య చిత్రం, రోబోట్ గత ప్రయత్నాలు లేదా మానవ పరస్పర చర్య. సందర్భ సంకలకం పనికి సంబంధించిన దృశ్య మార్పులను ఎంచుకుని, ఆదేశాలు, పరిమితులు, టూల్ నిర్మాణాలతో కలుపుతుంది. ఆ తర్వాత దృష్టి-భాషా మోడల్ క్రమబద్ధమైన రోబోట్-టూల్ అభ్యర్థనను ప్రతిపాదిస్తుంది.
ఆ అభ్యర్థన నిర్దిష్ట రోబోట్ రూపకల్పనకు చెందిన కంట్రోలర్కి వెళ్తుంది. అమలు చేయడానికి లేదా తిరస్కరించడానికి ముందు, inverse kinematics పరిష్కారాలను తనిఖీ చేయడం, Cartesian భంగిమలను నమూనా చేయడం, జాయింట్ సూచనల సమయాన్ని నిర్దేశించడం గురించి రచయితలు వివరిస్తారు. తదుపరి మోడల్ నిర్ణయానికి కంట్రోలర్ పరిశీలనలు, అమలు ఫీడ్బ్యాక్ను తిరిగి ఇస్తుంది. మోడల్ చర్యలను ప్రతిపాదిస్తుంది; రోబోట్-నిర్దిష్ట కోడ్ వాటిని ధృవీకరించి అమలు చేస్తుంది.
ఈ చక్రమే పరిశోధనా పత్రం ప్రధాన కృషి. గ్రేడియంట్తో మోడల్ను నవీకరించకుండానే, ఉదాహరణలు, ఇటీవలి ఫలితాల ఆధారంగా స్థిరమైన VLM తన తదుపరి చర్యను మార్చుకోగలదు. ఇక్కడ “సందర్భంలో అభ్యాసం” అంటే పని సమయంలో అందించిన సమాచారాన్ని వ్యవస్థ ఉపయోగించడమే. మోడల్ కొత్త నైపుణ్యాన్ని శాశ్వతంగా నేర్చుకుందని లేదా ప్రతి రోబోట్ ఒకే టూల్ ఇంటర్ఫేస్ను ఉపయోగించగలదని దీని అర్థం కాదు.
ప్రయోగాలు ఏం కొలిచాయి
రచయితలు పది రోబోట్ పనుల్లో ఐదు ప్రయోగాల సమూహాలను, ఒక్కో పరిస్థితికి మూడు ప్రయత్నాల చొప్పున నివేదించారు. వారి ప్రాజెక్ట్ పేజీ నిజమైన రోబోట్ ప్రయోగాలను చూపి, పనుల ఫలితాలు, నిర్ణయాలు, గడిచిన సమయాన్ని ప్రచురిస్తుంది. టవల్ ఎత్తే పనిలో, మానవ ప్రదర్శన వీడియో ఉన్నప్పుడు GPT-6 Astra మూడు ప్రయత్నాల్లో రెండింటిలో విజయం సాధించింది; అది లేకుండా మూడింటిలోనూ విఫలమైంది. నోట్బుక్ ఎత్తే పనిలోనూ, ప్రదర్శన లేకుండా సున్నా విజయాల నుంచి, దానితో రెండు విజయాలకు మారింది.
వస్తువులను తాకి చేసే పనుల్లో అదనపు సందర్భం ఎందుకు సార్వత్రిక పరిష్కారం కాదో తెలుస్తుంది. సీసా మూత విప్పడంలో, రోబోట్ వీడియో మూడు ప్రయత్నాల్లో రెండింటిని విజయవంతం చేసింది; దానికి సరిపోల్చిన రోబోట్ చర్యలను జోడించినప్పుడు మూడింటిలో మూడూ విజయవంతమయ్యాయి. ప్లగ్ తీసి మళ్లీ పెట్టే పనిలో, వీడియో మాత్రమే ఉన్నప్పుడు మూడు ప్రయత్నాల్లో ఒక్కటీ విజయవంతం కాలేదు; వీడియోకు చర్య సూచనలు జతచేసినప్పుడు రెండింటిలో విజయం సాధించారు. ఇవి ప్రతి పరిస్థితిలోని చిన్న సంఖ్యలు మాత్రమే; విశ్వసనీయత అంచనాలు కావు.
లక్ష్య చిత్రం ఆధారంగా బ్లాక్లు, పండ్లను అమర్చే పనులు, మానవులతో చేసిన రెండు పనుల్లోనూ మూడు ప్రయత్నాలకు మూడింటిలో విజయం సాధించినట్లు ప్రాజెక్ట్ చెబుతోంది. గత పరస్పర చర్యల చరిత్రను ఉపయోగించి, “నిమ్మకాయను గులాబీ రంగు పలకపై ఉంచు”, “స్థానం మార్చి అన్వేషించు” అనే రెండు పనుల్లోనూ మూడింటికి మూడింటిలో విజయాలు వచ్చాయని పరిశోధనా పత్రం నివేదిస్తుంది. రెండో పనిలో లక్ష్యాన్ని వెతికేటప్పుడు రోబోట్ అడ్డంకులను చురుకుగా తప్పించుకుంది; సగటున 25.53 నిమిషాలు పట్టింది. చిత్రం 1లో కదిలే వస్తువును తిరిగి తీసుకురావడమూ చూపబడింది. ఈ ఫలితాలు బల్లపై చేసే పనులకు మించి పరిశోధన విస్తరించినట్లు చూపుతాయి; అయినా ప్రతి పరిస్థితిలో మూడు ప్రయత్నాలున్న ఎంపిక చేసిన పనులే. ప్రయోగాలు నిమిషాల కొద్దీ సాగాయి: మానవుడి వీడియోతో టవల్ ఎత్తే పనికి సగటున 18.9 నిమిషాలు, వీడియో, చర్య సూచనలతో బాటిల్ మూత పనికి 17.9 నిమిషాలు పట్టాయని ప్రాజెక్ట్ పేజీ చెబుతోంది. కాబట్టి ఆలస్యం, నిర్వహణ ఖర్చు పరిష్కరించిన అంశాలు కావు; అవి ఇంకా ఆచరణాత్మక ప్రశ్నలుగానే మిగిలాయి.
పరిశోధనా పత్రం వివరించే రోబోట్ అమరికల్లో YAM, ARX X5లతో పాటు Morphi Kinoనూ అనుబంధం B జాబితా చేస్తుంది. దానికి కదిలే అడుగు భాగం, నడుము, తల, ఏడు జాయింట్లు ఉన్న రెండు చేతులు ఉన్నాయని పేర్కొంటుంది. కాబట్టి చేతి రోబోట్ అమరికలతో పాటు కదిలే వేదికనూ అధ్యయనం చేర్చింది; అయితే అనుబంధం Unitree G1ను పేర్కొనదు.
పత్రంలోని మొబైల్ పని Reddit దృశ్యాన్ని నిర్ధారించదు
ఆ Reddit పోస్ట్ GPT-6 Astra అపరిచిత గదిలో Unitree G1ను నియంత్రిస్తూ, వస్తువులు ఎక్కడున్నాయో గుర్తుంచుకుని, అస్పష్టమైన అభ్యర్థనలపై తర్వాత వాటిని తీసుకొస్తుందని వాదిస్తుంది. పత్రం మాత్రం వేరే “నగులుతూ అన్వేషణ” పనిని నివేదించి, Morphi Kinoను మొబైల్ బేస్ ఉన్న వేదికగా వివరిస్తుంది; అయినా పత్రం, ప్రాజెక్టు సామగ్రి, బహిరంగ GitHub రిపాజిటరీ ఆ Reddit పోస్ట్లోని G1 దృశ్యాన్ని GPT-Policy ప్రయోగంగా గుర్తించవు. ఆ పోస్ట్ వేరైన, ధృవీకరించని వాదనగానే ఉంది; ఈ పోలిక దాన్ని ఖండించదు.
రచయితల ప్రాజెక్ట్ పేజీ వారి ప్రయోగాల వీడియోలను కలిగి ఉంది. అవి నివేదించిన పనులకు ఆధారం; స్వతంత్ర ధృవీకరణ కావు. బహిరంగ కోడ్ రిపాజిటరీ. ఆ రిపాజిటరీలో ప్రస్తుతం ARX X5, I2RT/YAM కోసం అడాప్టర్లు ఉన్నాయని పేర్కొంటూ, అమలు హోస్ట్లు, ప్రైవేట్ ప్రాంప్ట్లు, రన్ రికార్డింగ్లు, స్థలానికి ప్రత్యేక కాలిబ్రేషన్, మూల్యాంకన చరిత్ర బహిరంగ ఫైళ్లలో లేవని చెబుతుంది. ఆ అడాప్టర్ల జాబితా విడుదలైన రిపాజిటరీని మాత్రమే వివరిస్తుంది; మొబైల్ అన్వేషణను కూడా నివేదించి, అనుబంధం Bలో Morphi Kinoను జాబితా చేసే మొత్తం పరిశోధనా పత్రం పరిధిని కాదు. అందుబాటులో ఉన్న సామగ్రితో BIG CHANGE నివేదించిన ప్రయోగాలను మళ్లీ నిర్వహించలేదు; మేమూ రోబోట్ను పరీక్షించలేదు.
నియంత్రణ సరిహద్దు ఇప్పటికీ ముఖ్యం
చర్యల సుదీర్ఘ క్రమాలను ప్రాజెక్ట్ పేజీ నివేదిస్తూ, అమలులో ఎదురైన ఇబ్బందులను గుర్తిస్తుంది. ఆటోనమస్ అమలును సురక్షితంగా నిర్వహించేందుకు అప్పటి రక్షణలు సరిపోలేదని, చేతుల మధ్య ఢీకొన్న ఘటనలు చూపాయని వారి చర్చ చెబుతుంది. భౌతిక దూరం, సంపర్కాన్ని స్వతంత్రంగా పర్యవేక్షించడంతో పాటు, వేగమైన దిగువ-స్థాయి నియంత్రణ, మరింత సురక్షితమైన పునరుద్ధరణ అవసరమని అది సూచిస్తుంది. కొన్ని చెల్లని కదలికలను కంట్రోలర్ తిరస్కరించగలదన్న ఒక్క కారణంతోనే అది పూర్తి భద్రతా వ్యవస్థ కాదు.
ఈ అధ్యయనం స్పష్టమైన పరిశోధనా ఫలితాన్ని అందిస్తుంది: నిర్దిష్ట పనుల్లో రోబోట్ టూల్స్కు సాధారణ VLM మార్గనిర్దేశం చేయడానికి సందర్భం తోడ్పడవచ్చు; ఏ రకమైన సందర్భం ఇస్తున్నామన్నదీ ముఖ్యం. మూల్యాంకనం చిన్నది, ఒక్కో ప్రయత్నానికి ఎక్కువ సమయం పడుతుంది, బహిరంగంగా పునరుత్పత్తి చేయడానికి అవసరమైన పదార్థాలు అసంపూర్ణం, ఢీకొన్న ఘటనలూ నివేదించబడ్డాయి. కాబట్టి ఇంటి హ్యూమనాయిడ్ రోబోట్ అస్పష్టమైన తెరచిన అభ్యర్థనలను విశ్వసనీయంగా అర్థం చేసుకుని అమలు చేస్తుందనే ఆధారానికి ఈ ఫలితం ఇంకా దూరంగా ఉంది.
మూలాలు, మరింత చదవడానికి
- Cheng తదితరులు, “In-Context Robot Learning with VLM Agents” (arXiv:2609.19138, సంచిక 1, 2026 సెప్టెంబర్ 16న సమర్పితం) — పద్ధతి, మూల్యాంకనం, పేర్కొన్న పరిమితులకు ప్రాథమిక ప్రిప్రింట్; ఇది సహచరుల సమీక్ష పొందిన ఆధారం లేదా అమలు నివేదిక కాదు.
- రచయితల GPT-Policy ప్రాజెక్ట్ పేజీ — ప్రయోగాల వివరణలు, వీడియోలు, ఒక్కో పరిస్థితి ఫలితాలు, చర్చ. ఇవి రచయితల స్వంత సామగ్రి.
- రచయితల బహిరంగ GPT-Policy కోడ్ రిపాజిటరీ — ప్రస్తుతం ఉన్న రోబోట్-చేయి అడాప్టర్లు, బహిరంగ ఫైళ్లలో చేర్చని అంశాలను వివరిస్తుంది; రిపాజిటరీ అందుబాటులో ఉందన్నదే నివేదించిన ప్రయోగాలను మళ్లీ చేయవచ్చని నిరూపించదు.
- ఈ నివేదికకు కారణమైన Reddit పోస్ట్ — Unitree G1 వాదనకు మూలం; ఆ దృశ్యాన్ని పరిశోధనా పత్రంతో అనుసంధానించే ఆధారాన్ని పోస్ట్ చూపదు.



