AI-translated from English; not yet reviewed by a fluent editor.

# GPT-Policy sumusubok ng in-context na pagkatuto sa mga gawaing gumagamit ng robot arm at mobile exploration

> Iniulat ng isang preprint noong Setyembre ang isang mobile-exploration task na may tatlong pagsubok, kasabay ng mga eksperimento sa robot arm. Hindi nito pinatutunayan ang hiwalay na pahayag sa Reddit tungkol sa GPT-6 Astra at Unitree G1.

By BIG CHANGE Editorial

Published: 2026-09-27T06:11:48.387Z
Updated: 2026-09-27T06:11:48.387Z
Canonical: https://bigchange.ai/blog/gpt-policy-robot-learning-vlm-agents

![A conceptual robot arm reaches toward a bottle cap on a workbench beneath a mounted camera.](https://bigchange.ai/api/media/file/gpt-policy-robot-arm-hero-v1.png)
AI-generated conceptual illustration by BIG CHANGE.

Isang [preprint sa arXiv na isinumite noong Setyembre, “In-Context Robot Learning with VLM Agents”](https://arxiv.org/html/2609.19138v1) ang nagpapakilala sa GPT-Policy, na nag-uugnay ng nakapirming vision-language model sa mga tool ng robot gamit ang mga demonstrasyon, larawan at kasaysayan ng interaksiyon. Kabilang sa mga eksperimento nito ang mga gawaing gumagamit ng robot arm at mobile exploration. Hindi pinatutunayan ng mga ito ang hiwalay na [pahayag sa Reddit tungkol sa GPT-6 Astra at Unitree G1](https://www.reddit.com/r/singularity/s/tjaYXdzfnI).

## Ang malaking pagbabago

- **Ano ang nagbago:** Binibigyan ng GPT-Policy ang isang pangkalahatang vision-language model ng nakabalangkas na paraan para gawing mga kahilingan sa tool ng robot ang mga demonstrasyon at kasalukuyang tanaw ng kamera, saka gumamit ng feedback mula sa pagsasagawa upang pumili ng susunod na kilos nang hindi ina-update ang mga bigat ng modelo para sa partikular na task.
- **Bakit ito mahalaga:** Pinaghihiwalay ng paraang ito ang malawak na visual reasoning mula sa pagsusuri ng galaw at aktuwal na pagpapatakbo. Sa limitadong mga pagsubok ng mga may-akda, nakatulong ang dagdag na konteksto sa ilang task, samantalang kinailangan minsan ng mga kilos na sensitibo sa pagdikit ng mga robot-action reference na nakaayon sa isa't isa.
- **Ano ang dapat bantayan:** Tatlong pagsubok lang bawat kondisyon ang iniulat ng papel, at inilalarawan nito ang mabagal at madalas pumalyang mga run, kabilang ang mga banggaan ng mga arm. Mahalaga ang muling pagsasagawa ng eksperimento, mas malawak na pagsusuri at mga independiyenteng kontrol sa kaligtasan bago masabi ng mga resultang ito kung paano gagana ang mga robot sa paligid ng tao.

## Ano ang ginagawa ng GPT-Policy

Isinumite ang papel sa arXiv noong Setyembre 16. Sinusuri nito kung magagamit ng isang pangkalahatang vision-language model ang mga halimbawa at feedback para magsagawa ng task mula sa bagong panimulang estado nang hindi nagfi-fine-tune o nagbabago ng mga parameter ng modelo para sa partikular na task. GPT-Policy ang tawag ng mga may-akda sa balangkas nila, at kabilang ang GPT-6 Astra sa mga modelong sinuri nila.

Pinagsasama ng sistema ang ilang uri ng konteksto: tagubilin sa task, kasalukuyang tanaw at estado ng kamera, at opsyonal na mga video ng demonstrasyon ng tao, demonstrasyon ng robot na may mga action reference, target na larawan, mga naunang pagtatangka ng robot o interaksiyon ng tao. Pinipili ng context compiler ang mga pagbabagong biswal na may kaugnayan sa task at pinagsasama ang mga ito sa mga tagubilin, limitasyon at schema ng tool. Pagkatapos, nagmumungkahi ang VLM ng isang nakabalangkas na kahilingan sa tool ng robot.

Ipinapasa ang kahilingang iyon sa isang controller na para sa partikular na embodiment ng robot. Inilalarawan ng mga may-akda ang pagsusuri sa mga solusyon ng inverse kinematics, pagsa-sample ng mga Cartesian pose at pagtatakda ng tiyempo ng mga joint reference bago isagawa o tanggihan ang galaw. Ibinabalik ng controller ang mga obserbasyon at feedback sa pagsasagawa para sa susunod na pasya ng modelo. Nagmumungkahi ng mga kilos ang modelo; sinusuri at isinasagawa naman ang mga ito ng code na partikular sa robot.

Ito ang pangunahing ambag ng papel: naiaangkop ng nakapirming VLM ang susunod nitong kilos batay sa mga halimbawa at kamakailang kinalabasan nang walang gradient update. Dito, inilalarawan ng “in-context learning” kung paano ginagamit ng sistema ang impormasyong ibinibigay habang ginagawa ang task. Hindi ito nangangahulugang permanenteng natuto ng bagong kasanayan ang modelo o kayang gumamit ng lahat ng robot ng iisang interface ng tool.

## Ano ang sinukat ng mga pagsubok

Iniulat ng mga may-akda ang limang pangkat ng eksperimento sa sampung robot task, na may tatlong pagsubok bawat kondisyon. Inililista ng kanilang [pahina ng proyekto](https://cheng-haha.github.io/GPT-Policy/) ang mga run sa aktuwal na robot at inilalathala ang kinalabasan ng task, mga pasya at tagal. Sa pagpulot ng tuwalya, nagtagumpay ang GPT-6 Astra sa dalawa sa tatlong pagsubok na may video ng tao, at wala sa tatlo kapag wala nito. Umangat din ang pagpulot ng notebook mula sero sa tatlo nang walang demonstrasyon tungo sa dalawa sa tatlo kapag mayroon nito.

Ipinakikita ng mga task na may pagdikit kung bakit hindi pangkalahatang solusyon ang dagdag na konteksto. Sa pag-alis ng takip ng bote, dalawang tagumpay sa tatlong pagsubok ang naitala gamit ang video ng robot; naging tatlo sa tatlo nang idagdag ang magkakatugmang kilos ng robot. Sa pagtanggal at muling pagsaksak ng plug, walang tagumpay sa tatlong pagsubok sa kondisyong video lamang, samantalang umabot sa dalawa ang video na may mga action reference. Maliliit na bilang ito para sa bawat kondisyon, hindi mga pagtataya ng pagiging maaasahan.

Nag-ulat din ang proyekto ng tagumpay sa tatlo sa tatlong pagsubok para sa pag-aayos ng mga bloke at prutas batay sa target na larawan, gayundin sa dalawang task na may interaksiyon ng tao. Sa paggamit ng kasaysayan ng sariling interaksiyon, nagtagumpay ang papel sa tatlo sa tatlong pagsubok kapwa sa “Lemon to Pink Plate” at “Movable Exploration.” Sa huli, aktibong umiwas sa mga hadlang ang robot habang hinahanap ang target; 25.53 minuto ang karaniwang tagal nito. Ipinakikita rin sa Figure 1 ang mobile na pagkuha ng bagay. Pinalalawak ng mga resultang ito ang papel lampas sa manipulasyon sa ibabaw ng mesa, ngunit piling task pa rin ang mga ito na may tatlong pagsubok bawat kondisyon. Tumagal nang ilang minuto ang mga run: iniulat ng pahina ng proyekto ang karaniwang 18.9 minuto para sa pagpulot ng tuwalya na may video ng tao at 17.9 minuto para sa task sa takip ng bote na may video at mga action reference. Kaya nananatiling praktikal na tanong ang latency at gastos sa pagpapatakbo; hindi pa nalulutas ang mga ito.

Inililista sa Appendix B ang Morphi Kino kasama ng YAM at ARX X5 bilang mga robot configuration na inilalarawan sa papel. Ayon dito, may mobile base, baywang at ulo ang Morphi Kino, pati dalawang arm na may tig-pitong joint. Samakatuwid, may mobile-platform configuration ang papel bukod sa mga arm platform; hindi tinutukoy sa apendiks ang Unitree G1.

## Hindi pinatutunayan ng mobile task ng papel ang senaryo sa Reddit

Sinasabi ng [post sa Reddit](https://www.reddit.com/r/singularity/s/tjaYXdzfnI) na kinokontrol ng GPT-6 Astra ang isang Unitree G1 sa di-pamilyar na silid, naaalala nito kung nasaan ang mga bagay at kinukuha ang mga ito kalaunan mula sa malalabong kahilingan. Iniulat ng papel ang hiwalay na task na “Movable Exploration” at inilalarawan ang Morphi Kino bilang platform na may mobile base, ngunit hindi tinutukoy sa papel, mga materyal ng proyekto at [pampublikong GitHub repository](https://github.com/cheng-haha/GPT-Policy) ang senaryo sa G1 ng post sa Reddit bilang eksperimento ng GPT-Policy. Hiwalay at hindi pa napapatunayan ang pahayag sa post; hindi rin ito pinabubulaanan ng paghahambing na ito.

May mga video ng mga eksperimento ang [pahina ng proyekto](https://cheng-haha.github.io/GPT-Policy/) ng mga may-akda. Ebidensiya ang mga ito para sa mga task na iniulat nila, hindi independiyenteng pagpapatunay. Kasalukuyang naglilista ang pampublikong [code repository](https://github.com/cheng-haha/GPT-Policy) ng mga adapter para sa ARX X5 at I2RT/YAM, at sinasabing hindi kasama sa pampublikong tree ang mga deployment host, pribadong prompt, recording ng mga run, kalibrasyong para sa partikular na lugar at kasaysayan ng pagsusuri. Inilalarawan ng listahan ng adapter ang inilabas na repository; hindi nito itinatakda ang buong saklaw ng papel, na nag-uulat din ng mobile exploration at naglilista sa Morphi Kino sa Appendix B. Hindi sapat ang mga materyal na makukuha para muling maisagawa ng BIG CHANGE ang mga iniulat na run, at hindi kami sumubok ng robot.

## Mahalaga pa rin ang hangganan ng kontrol

Iniulat ng pahina ng proyekto ang mahahabang sunod-sunod na kilos at binanggit ang mga suliranin sa pagsasagawa. Ayon sa talakayan nito, ipinakita ng mga naobserbahang banggaan sa pagitan ng mga arm na hindi sapat ang kasalukuyang pananggalang para sa ligtas na awtonomong deployment. Iminumungkahi nito ang independiyenteng pagsubaybay sa pisikal na pagitan at pagdikit, kasama ng mas mabilis na low-level control at mas ligtas na pagbangon mula sa pagkabigo. Hindi awtomatikong ganap na sistema ng kaligtasan ang isang controller dahil lamang tinatanggihan nito ang ilang di-wastong galaw.

Nagbibigay ang pag-aaral ng kongkretong resulta sa pananaliksik: makatutulong ang konteksto sa isang pangkalahatang VLM para gabayan ang mga tool ng robot sa ilang task, at mahalaga ang uri ng konteksto. Dahil sa liit ng pagsusuri, tagal ng bawat run, kakulangan ng pampublikong materyales para sa muling pagsasagawa at mga iniulat na banggaan, malayo pa ang resulta sa pagiging ebidensiya ng isang humanoid sa bahay na maaasahang nakauunawa at tumutupad sa mga bukas na kahilingan.

## Mga sanggunian at karagdagang babasahin

- [Cheng et al., “In-Context Robot Learning with VLM Agents” (arXiv:2609.19138, bersiyon 1, isinumite noong Setyembre 16, 2026)](https://arxiv.org/abs/2609.19138) — Pangunahing preprint para sa pamamaraan, pagsusuri at mga limitasyong binanggit; hindi ito peer-reviewed na ebidensiya o ulat ng deployment.
- [Pahina ng proyekto ng GPT-Policy ng mga may-akda](https://cheng-haha.github.io/GPT-Policy/) — Mga paglalarawan ng eksperimento, video, resulta sa bawat kondisyon at talakayan. Sariling materyal ito ng mga may-akda.
- [Pampublikong code repository ng GPT-Policy ng mga may-akda](https://github.com/cheng-haha/GPT-Policy) — Inilalarawan ang kasalukuyang mga adapter ng robot arm at ang mga hindi kasama sa pampublikong tree; hindi pinatutunayan ng pagkakaroon ng repository lamang na maaaring muling isagawa ang iniulat na eksperimento.
- [Ang post sa Reddit na nag-udyok sa ulat na ito](https://www.reddit.com/r/singularity/s/tjaYXdzfnI) — Pinagmulan ng pahayag tungkol sa Unitree G1; walang binabanggit na ebidensiya ang post na nag-uugnay sa senaryong iyon sa papel.

## Sources

- [Cheng et al., In-Context Robot Learning with VLM Agents, arXiv:2609.19138 v1](https://arxiv.org/abs/2609.19138) — Pangunahing preprint na isinumite noong Setyembre 16; inilalahad ang iminungkahing GPT-Policy at iniuulat ang pagsusuri at mga limitasyong binanggit ng mga may-akda; hindi ito peer-reviewed o ebidensiya ng deployment.
- [Pahina ng proyekto ng GPT-Policy ng mga may-akda](https://cheng-haha.github.io/GPT-Policy/) — Pangunahing materyal ng mga may-akda para sa paglalarawan ng sistema, mga eksperimento, talahanayan ng resulta, video at talakayan; hindi ito independiyenteng pagpapatunay.
- [Pampublikong code repository ng GPT-Policy ng mga may-akda](https://github.com/cheng-haha/GPT-Policy) — Pangunahing ebidensiya para sa mga inilathalang adapter at nilalaman/mga hindi kasama sa repository; hindi nito ipinakikita ang lahat ng kalibrasyon, prompt o kasaysayan ng pagsusuring kailangan para sa agarang muling pagsasagawa.
- [Post sa Reddit na nagsasabing kinokontrol ng GPT-6 Astra ang isang Unitree G1 sa di-pamilyar na silid](https://www.reddit.com/r/singularity/s/tjaYXdzfnI) — Pinagmulan ng viral na pahayag na sinusuri; hindi ebidensiya na isinagawa ng papel o ng mga nakalistang robot-arm platform ang inilalarawang senaryo.
