AI-translated from English; not yet reviewed by a fluent editor.
# GPT-Policy испитује контекст у задацима са роботском руком и мобилним истраживањем
> Септембарски препринт описује задатак мобилног истраживања са три пробе, уз експерименте са роботском руком. Не потврђује засебну тврдњу са Reddit-а о GPT-6 Астра и роботу Unitree G1.
By BIG CHANGE Editorial
Published: 2026-09-27T06:11:48.387Z
Updated: 2026-09-27T06:11:48.387Z
Canonical: https://bigchange.ai/blog/gpt-policy-robot-learning-vlm-agents

AI-generated conceptual illustration by BIG CHANGE.
Септембарски [In-Context Robot Learning with VLM Agents](https://arxiv.org/html/2609.19138v1) представља GPT-Policy, који повезује фиксни визуелно-језички модел са роботским алатима помоћу демонстрација, слика и историје интеракција. Експерименти обухватају задатке са роботском руком и мобилно истраживање. Не потврђују засебну тврдњу у [објави на Reddit-у о GPT-6 Астра и роботу Unitree G1](https://www.reddit.com/r/singularity/s/tjaYXdzfnI).
## Суштинска промена
- **Шта се променило:** GPT-Policy даје општем визуелно-језичком моделу структурисан начин да демонстрације и актуелни приказ камере претвори у захтеве за роботске алате, па да на основу повратних информација о извршавању изабере следећу радњу без ажурирања тежина модела за конкретан задатак.
- **Зашто је то важно:** Овај приступ раздваја опште визуелно резоновање од провера кретања и извршавања. У ограниченом броју проба аутора, додатни контекст помогао је у неким задацима, док су за радње осетљиве на контакт понекад биле потребне усклађене референце роботских покрета.
- **На шта обратити пажњу:** У раду се наводе само три пробе по услову и описују спора извршавања склона грешкама, укључујући сударе роботских руку. Пре него што ти резултати много говоре о раду робота у близини људи, важни су понављање експеримента, веће евалуације и независне безбедносне контроле.
## Шта ради GPT-Policy
Рад је предат на arXiv 16. септембра. Поставља питање да ли општи визуелно-језички модел може да користи примере и повратне информације за обављање задатка из новог почетног стања, без финог подешавања или измене параметара модела за тај задатак. Аутори свој оквир називају GPT-Policy и наводе GPT-6 Астра међу моделима које су евалуирали.
Систем обједињује више врста контекста: упутство за задатак, тренутни приказ камере и стање, као и опционе видео-демонстрације људи, роботске демонстрације са референтним радњама, циљну слику, претходне покушаје робота или људску интеракцију. Компајлер контекста бира визуелне прелазе важне за задатак и комбинује их са упутствима, ограничењима и шемама алата. Визуелно-језички модел затим предлаже структурисани захтев за роботски алат.
Тај захтев прослеђује се контролеру прилагођеном конкретном телу робота. Аутори описују проверу решења инверзне кинематике, узорковање Декартових поза и временско усклађивање референци зглобова пре извршавања или одбацивања покрета. Контролер враћа опажања и повратне информације о извршавању за следећу одлуку модела. Модел предлаже радње, а код за конкретан робот их проверава и извршава.
Ова повратна спрега главни је допринос рада. Она омогућава фиксном визуелно-језичком моделу да прилагоди следећу радњу примерима и недавним исходима, без ажурирања градијентима. „Учење у контексту“ овде описује начин на који систем користи информације достављене током задатка. То не значи да је модел трајно научио нову вештину нити да сваки робот може да користи исти интерфејс алата.
## Шта су пробе мериле
Аутори извештавају о пет група експеримената у десет задатака са роботима, уз три пробе по услову. На њиховој [страници пројекта](https://cheng-haha.github.io/GPT-Policy/) наведена су тестирања на правим роботима, исходи задатака, одлуке и протекло време. При подизању пешкира GPT-6 Астра је успео у две од три пробе уз људски видео-снимак, а ни у једној од три без њега. И код подизања свеске резултат се променио са нула успеха од три без демонстрације на два од три уз демонстрацију.
Задаци који укључују контакт показују зашто додатни контекст није опште решење. При одвртању чепа боце, видео-снимак робота донео је два успеха у три пробе, док су уз додавање усклађених роботских радњи успела сва три покушаја. При вађењу и поновном укључивању утикача, није било успеха у три пробе само са видеом, док су видео и референце радњи заједно донели два успеха. То су мали бројеви по условима, а не процене поузданости.
Пројекат такође наводи три успеха у три пробе за распоред блокова и воћа према циљној слици и за два задатка са људском интеракцијом. Уз историју сопствених интеракција, у раду се наводе три успеха у три пробе и за задатке „Лимун на розе тањиру“ и „Мобилно истраживање“. У другом задатку робот је активно избегавао препреке док је тражио циљ; просечно протекло време износило је 25,53 минута. На слици 1 приказано је и преузимање покретног предмета. Ови резултати проширују обухват рада изван манипулације на столу, али се и даље односе на одабране задатке са три пробе по услову. Пробе су трајале по неколико минута: на страници пројекта наводи се просечно 18,9 минута за подизање пешкира уз људски видео-снимак и 17,9 минута за задатак са чепом уз видео и референце радњи. Латенција и оперативни трошкови зато остају практична питања, а не решени детаљи.
У додатку Б се међу описаним конфигурацијама робота у раду наводе Morphi Kino, YAM и ARX X5. За Morphi Kino наводи се да има мобилну основу, струк и главу, као и две руке са по седам зглобова. Рад зато поред роботских руку обухвата и конфигурацију мобилне платформе; у додатку се не помиње Unitree G1.
## Мобилни задатак из рада не потврђује сценарио са Reddit-а
У [објави на Reddit-у](https://www.reddit.com/r/singularity/s/tjaYXdzfnI) тврди се да GPT-6 Астра управља роботом Unitree G1 у непознатој просторији, памти где се налазе предмети и касније их доноси на основу неодређених захтева. У раду се описује засебан задатак „Мобилно истраживање“ и наводи да Morphi Kino има мобилну основу, али ни у раду ни у материјалима пројекта ни у [јавном репозиторијуму на GitHub-у](https://github.com/cheng-haha/GPT-Policy) не наводи се да је GPT-Policy тестиран у сценарију са роботом Г1 из објаве на Reddit-у. Објава остаје засебна, непотврђена тврдња; ово поређење је не оповргава.
На [страници пројекта аутора](https://cheng-haha.github.io/GPT-Policy/) налазе се видео-снимци експеримената, који су доказ о задацима о којима аутори извештавају, а не независна потврда. У јавном [репозиторијуму кода](https://github.com/cheng-haha/GPT-Policy) тренутно се наводе адаптери за ARX X5 и И2RT/YAM, а пише и да јавно стабло не обухвата сервере за примену, приватне упите, снимке извршавања, калибрацију за конкретну локацију нити историју евалуација. Списак адаптера описује објављени репозиторијум, а не пун обухват рада, у коме се такође описује мобилно истраживање и наводи Morphi Kino у додатку Б. Доступни материјали нису довољни да BIG CHANGE понови пријављене пробе; нисмо тестирали робота.
## Граница контроле и даље је важна
На страници пројекта наводе се дугачки низови радњи и тешкоће при извршавању. У расправи се каже да су уочени судари између роботских руку показали да постојеће заштитне мере нису довољне за безбедну аутономну примену. Аутори позивају на независно праћење физичког растојања и контакта, уз бржу контролу на ниском нивоу и безбеднији опоравак од грешака. То што контролер одбацује неке неисправне покрете само по себи не значи да представља потпун безбедносни систем.
Студија даје конкретан истраживачки резултат: контекст може да помогне општем визуелно-језичком моделу да усмерава роботске алате у одређеним задацима, а врста контекста је важна. Мали обим евалуације, трајање проба, непотпуни јавни материјали за понављање и пријављени судари далеко су од доказа да кућни хуманоидни робот поуздано разуме и извршава отворене захтеве.
## Извори и додатна литература
- [Cheng et al., “In-Context Robot Learning with VLM Agents” (arXiv:2609.19138, v1, submitted September 16, 2026)](https://arxiv.org/abs/2609.19138) — примарни препринт о методи, евалуацији и наведеним ограничењима; није рецензирани доказ нити извештај о примени.
- [Author project page for GPT-Policy](https://cheng-haha.github.io/GPT-Policy/) — описи експеримената, снимци, резултати по условима и расправа. Реч је о материјалима самих аутора.
- [Authors’ public GPT-Policy code repository](https://github.com/cheng-haha/GPT-Policy) — документује тренутно објављене адаптере за роботске руке и оно што није доступно у јавном стаблу; сама доступност репозиторијума не доказује да се пријављени експеримент може поновити.
- [Објава на Reddit-у која је подстакла овај извештај](https://www.reddit.com/r/singularity/s/tjaYXdzfnI) — извор тврдње о роботу Unitree G1; у објави се не наводе докази који повезују тај сценарио са радом.
## Sources
- [Cheng et al., In-Context Robot Learning with VLM Agents, arXiv:2609.19138, version 1](https://arxiv.org/abs/2609.19138) — Примарни препринт, предат 16. септембра; описује предложену методу GPT-Policy и извештава о евалуацији и ограничењима аутора. Није прошао стручну рецензију и не представља доказ о примени.
- [Authors’ GPT-Policy project page](https://cheng-haha.github.io/GPT-Policy/) — Примарни материјали аутора за опис система, експерименте, табеле резултата, видео-снимке и расправу; нису независна потврда.
- [Authors’ public GPT-Policy code repository](https://github.com/cheng-haha/GPT-Policy) — Примарни доказ о објављеним адаптерима и садржају и изостављеним деловима репозиторијума; не пружа све податке о калибрацији, упитима и историји евалуације потребне за непосредно понављање.
- [Објава на Reddit-у у којој се тврди да GPT-6 Астра управља роботом Unitree G1 у непознатој просторији](https://www.reddit.com/r/singularity/s/tjaYXdzfnI) — Извор виралне тврдње која се проверава; није доказ да су рад или наведене платформе са роботским рукама извели описани сценарио.
Билтен BIG CHANGE
Шира слика. Вашим темпом.
Недавне приче о вештачкој интелигенцији и роботици, промене вредне праћења и практичне идеје за примену. Изаберите дневни преглед, недељни сажетак или месечну перспективу.
Шаље се у 09:00 по београдском времену: свакодневно, понедељком или првог дана у месецу. Прво издање стиже при следећем заказаном слању након потврде.
Ваша приватност, ваш избор.
Неопходно складиште доприноси безбедности сајта и памти ваше изборе. Опционални Google Analytics остаје искључен док га не дозволите. Све чланке можете читати само уз неопходно складиштење података. Детаљи о приватности