Септембарски In-Context Robot Learning with VLM Agents представља GPT-Policy, који повезује фиксни визуелно-језички модел са роботским алатима помоћу демонстрација, слика и историје интеракција. Експерименти обухватају задатке са роботском руком и мобилно истраживање. Не потврђују засебну тврдњу у објави на Reddit-у о GPT-6 Астра и роботу Unitree G1.

Суштинска промена

  • Шта се променило: GPT-Policy даје општем визуелно-језичком моделу структурисан начин да демонстрације и актуелни приказ камере претвори у захтеве за роботске алате, па да на основу повратних информација о извршавању изабере следећу радњу без ажурирања тежина модела за конкретан задатак.
  • Зашто је то важно: Овај приступ раздваја опште визуелно резоновање од провера кретања и извршавања. У ограниченом броју проба аутора, додатни контекст помогао је у неким задацима, док су за радње осетљиве на контакт понекад биле потребне усклађене референце роботских покрета.
  • На шта обратити пажњу: У раду се наводе само три пробе по услову и описују спора извршавања склона грешкама, укључујући сударе роботских руку. Пре него што ти резултати много говоре о раду робота у близини људи, важни су понављање експеримента, веће евалуације и независне безбедносне контроле.

Шта ради GPT-Policy

Рад је предат на arXiv 16. септембра. Поставља питање да ли општи визуелно-језички модел може да користи примере и повратне информације за обављање задатка из новог почетног стања, без финог подешавања или измене параметара модела за тај задатак. Аутори свој оквир називају GPT-Policy и наводе GPT-6 Астра међу моделима које су евалуирали.

Систем обједињује више врста контекста: упутство за задатак, тренутни приказ камере и стање, као и опционе видео-демонстрације људи, роботске демонстрације са референтним радњама, циљну слику, претходне покушаје робота или људску интеракцију. Компајлер контекста бира визуелне прелазе важне за задатак и комбинује их са упутствима, ограничењима и шемама алата. Визуелно-језички модел затим предлаже структурисани захтев за роботски алат.

Тај захтев прослеђује се контролеру прилагођеном конкретном телу робота. Аутори описују проверу решења инверзне кинематике, узорковање Декартових поза и временско усклађивање референци зглобова пре извршавања или одбацивања покрета. Контролер враћа опажања и повратне информације о извршавању за следећу одлуку модела. Модел предлаже радње, а код за конкретан робот их проверава и извршава.

Ова повратна спрега главни је допринос рада. Она омогућава фиксном визуелно-језичком моделу да прилагоди следећу радњу примерима и недавним исходима, без ажурирања градијентима. „Учење у контексту“ овде описује начин на који систем користи информације достављене током задатка. То не значи да је модел трајно научио нову вештину нити да сваки робот може да користи исти интерфејс алата.

Шта су пробе мериле

Аутори извештавају о пет група експеримената у десет задатака са роботима, уз три пробе по услову. На њиховој страници пројекта наведена су тестирања на правим роботима, исходи задатака, одлуке и протекло време. При подизању пешкира GPT-6 Астра је успео у две од три пробе уз људски видео-снимак, а ни у једној од три без њега. И код подизања свеске резултат се променио са нула успеха од три без демонстрације на два од три уз демонстрацију.

Задаци који укључују контакт показују зашто додатни контекст није опште решење. При одвртању чепа боце, видео-снимак робота донео је два успеха у три пробе, док су уз додавање усклађених роботских радњи успела сва три покушаја. При вађењу и поновном укључивању утикача, није било успеха у три пробе само са видеом, док су видео и референце радњи заједно донели два успеха. То су мали бројеви по условима, а не процене поузданости.

Пројекат такође наводи три успеха у три пробе за распоред блокова и воћа према циљној слици и за два задатка са људском интеракцијом. Уз историју сопствених интеракција, у раду се наводе три успеха у три пробе и за задатке „Лимун на розе тањиру“ и „Мобилно истраживање“. У другом задатку робот је активно избегавао препреке док је тражио циљ; просечно протекло време износило је 25,53 минута. На слици 1 приказано је и преузимање покретног предмета. Ови резултати проширују обухват рада изван манипулације на столу, али се и даље односе на одабране задатке са три пробе по услову. Пробе су трајале по неколико минута: на страници пројекта наводи се просечно 18,9 минута за подизање пешкира уз људски видео-снимак и 17,9 минута за задатак са чепом уз видео и референце радњи. Латенција и оперативни трошкови зато остају практична питања, а не решени детаљи.

У додатку Б се међу описаним конфигурацијама робота у раду наводе Morphi Kino, YAM и ARX X5. За Morphi Kino наводи се да има мобилну основу, струк и главу, као и две руке са по седам зглобова. Рад зато поред роботских руку обухвата и конфигурацију мобилне платформе; у додатку се не помиње Unitree G1.

Мобилни задатак из рада не потврђује сценарио са Reddit-а

У објави на Reddit-у тврди се да GPT-6 Астра управља роботом Unitree G1 у непознатој просторији, памти где се налазе предмети и касније их доноси на основу неодређених захтева. У раду се описује засебан задатак „Мобилно истраживање“ и наводи да Morphi Kino има мобилну основу, али ни у раду ни у материјалима пројекта ни у јавном репозиторијуму на GitHub-у не наводи се да је GPT-Policy тестиран у сценарију са роботом Г1 из објаве на Reddit-у. Објава остаје засебна, непотврђена тврдња; ово поређење је не оповргава.

На страници пројекта аутора налазе се видео-снимци експеримената, који су доказ о задацима о којима аутори извештавају, а не независна потврда. У јавном репозиторијуму кода тренутно се наводе адаптери за ARX X5 и И2RT/YAM, а пише и да јавно стабло не обухвата сервере за примену, приватне упите, снимке извршавања, калибрацију за конкретну локацију нити историју евалуација. Списак адаптера описује објављени репозиторијум, а не пун обухват рада, у коме се такође описује мобилно истраживање и наводи Morphi Kino у додатку Б. Доступни материјали нису довољни да BIG CHANGE понови пријављене пробе; нисмо тестирали робота.

Граница контроле и даље је важна

На страници пројекта наводе се дугачки низови радњи и тешкоће при извршавању. У расправи се каже да су уочени судари између роботских руку показали да постојеће заштитне мере нису довољне за безбедну аутономну примену. Аутори позивају на независно праћење физичког растојања и контакта, уз бржу контролу на ниском нивоу и безбеднији опоравак од грешака. То што контролер одбацује неке неисправне покрете само по себи не значи да представља потпун безбедносни систем.

Студија даје конкретан истраживачки резултат: контекст може да помогне општем визуелно-језичком моделу да усмерава роботске алате у одређеним задацима, а врста контекста је важна. Мали обим евалуације, трајање проба, непотпуни јавни материјали за понављање и пријављени судари далеко су од доказа да кућни хуманоидни робот поуздано разуме и извршава отворене захтеве.

Извори и додатна литература