Сентябрьский препринт arXiv «Обучение роботов в контексте с агентами VLM», представляет GPT-Policy — систему, которая связывает неизменяемую мультимодальную языковую модель с инструментами робота, используя демонстрации, изображения и историю взаимодействия. В эксперименты входят задачи с роботизированной рукой и мобильная разведка. Они не подтверждают отдельное заявление в публикации на Reddit о GPT-6 Astra и Unitree G1.
Главное изменение
- Что изменилось: GPT-Policy предлагает общей мультимодальной языковой модели структурированный способ преобразовывать демонстрации и текущие изображения с камер в запросы к инструментам робота, а затем использовать обратную связь о выполнении для выбора следующего действия без изменения весов модели под конкретную задачу.
- Почему это важно: Такой подход отделяет широкое визуальное рассуждение от проверки движений и их выполнения. В ограниченных испытаниях авторов дополнительный контекст помог в некоторых задачах, а действия, чувствительные к контакту, иногда требовали согласованных эталонных записей действий робота.
- За чем следить: В статье описано всего по три испытания на каждое условие, а запуски характеризуются как медленные и подверженные сбоям; среди них были столкновения роботизированных рук. Прежде чем эти результаты можно будет распространить на роботов, работающих рядом с людьми, важны воспроизведение эксперимента, более масштабные оценки и независимые средства безопасности.
Что такое GPT-Policy
Статью подали на arXiv 16 сентября. В ней рассматривается, может ли общая мультимодальная языковая модель выполнять задачу из нового начального состояния, используя примеры и обратную связь, без дообучения и изменения параметров модели под конкретную задачу. Авторы называют свой подход GPT-Policy и указывают GPT-6 Astra среди оцененных моделей.
Система объединяет несколько видов контекста: инструкцию к задаче, текущие изображения с камер и состояние робота, а также дополнительные видео человеческих демонстраций, демонстрации робота с эталонными действиями, целевое изображение, предыдущие попытки робота или взаимодействие с человеком. Компилятор контекста отбирает визуальные переходы, относящиеся к задаче, и объединяет их с инструкциями, ограничениями и схемами инструментов. Затем мультимодальная языковая модель предлагает структурированный запрос к инструменту робота.
Этот запрос передается контроллеру, специфичному для конкретного воплощения. Авторы описывают проверку решений обратной кинематики, выборку декартовых поз и синхронизацию суставных траекторий перед выполнением или отклонением движения. Контроллер возвращает наблюдения и обратную связь о выполнении для следующего решения модели. Модель предлагает действия, а специализированный для робота код проверяет и выполняет их.
Этот цикл — основной вклад статьи. Он позволяет неизменяемой мультимодальной языковой модели адаптировать следующее действие с учетом примеров и недавних результатов, не обновляя веса градиентным методом. «Обучение в контексте» здесь означает использование системой информации, предоставленной во время выполнения задачи. Это не означает, что модель навсегда освоила новый навык или что любой робот может использовать тот же интерфейс инструментов.
Что измеряли испытания
Авторы сообщают о пяти группах экспериментов в десяти задачах для робота, по три испытания на каждое условие. На странице проекта перечислены запуски на реальном роботе и опубликованы результаты задач, принятые решения и затраченное время. При подборе полотенца GPT-6 Astra справилась в двух из трех испытаний с видео человека и ни в одном из трех без него. При подборе блокнота результат также изменился: с нуля из трех без демонстрации до двух из трех с ней.
Задачи, связанные с контактом, показывают, почему дополнительный контекст не является универсальным решением. При отвинчивании крышки бутылки видеозапись действий робота дала два успешных результата из трех; добавление согласованных записей действий робота — три из трех. При извлечении и повторной установке вилки видеозапись без дополнительных данных не дала ни одного успеха из трех, тогда как видео вместе с эталонными действиями дало два успеха. Это небольшие результаты по отдельным условиям, а не оценка надежности.
Кроме того, в проекте сообщается о трех успехах из трех при размещении блоков и фруктов согласно целевому изображению, а также в двух задачах взаимодействия с человеком. При использовании истории собственных взаимодействий статья сообщает о трех успехах из трех в задачах «Лимон на розовую тарелку» и «Мобильная разведка». Во второй задаче робот активно обходил препятствия в поисках цели; среднее затраченное время составило 25,53 минуты. На рисунке 1 также показано извлечение предмета мобильным роботом. Эти результаты расширяют охват статьи за пределы манипуляций на столе, но остаются избранными задачами с тремя испытаниями на условие. Запуски занимали минуты: на странице проекта указано среднее время 18,9 минуты для подбора полотенца с видео человека и 17,9 минуты для отвинчивания крышки с видео и эталонными действиями. Поэтому задержка и стоимость эксплуатации остаются практическими вопросами, а не решенными задачами.
В приложении B среди описанных в статье конфигураций роботов наряду с YAM и ARX X5 указана Morphi Kino. Уточняется, что у Morphi Kino есть мобильная база, корпус и голова, а также две руки с семью степенями подвижности каждая. Таким образом, в статье рассматривается конфигурация на мобильной платформе наряду с платформами с роботизированными руками; в приложении не упоминается Unitree G1.
Мобильная задача из статьи не подтверждает сценарий из публикации на Reddit
В публикации на Reddit утверждается, что GPT-6 Astra управляет Unitree G1 в незнакомом помещении, запоминает расположение предметов и позднее достает их по расплывчатым просьбам. В статье описана отдельная задача «Мобильная разведка» и упоминается Morphi Kino как платформа с мобильной базой, однако ни статья, ни материалы проекта, ни публичный репозиторий на GitHub не связывают описанный на Reddit сценарий с G1 с экспериментом GPT-Policy. Это отдельное неподтвержденное заявление; данное сравнение не опровергает его.
На странице проекта авторов размещены видео экспериментов. Они подтверждают, какие задачи, по словам авторов, выполнялись, но не являются независимой проверкой. В общедоступном репозитории с кодом сейчас перечислены адаптеры для ARX X5 и I2RT/YAM; также сказано, что публичный репозиторий не содержит среды развертывания, закрытых промптов, записей запусков, калибровки для конкретного участка и истории оценивания. Этот список адаптеров описывает опубликованный репозиторий, а не полный охват статьи, в которой также сообщается о мобильной разведке и упоминается Morphi Kino в приложении B. Доступных материалов недостаточно, чтобы BIG CHANGE мог воспроизвести запуски; мы не испытывали робота.
Граница управления по-прежнему важна
На странице проекта описаны длинные последовательности действий и отмечены трудности при выполнении. По обсуждению авторов, наблюдавшиеся столкновения рук показывают, что имеющихся мер защиты недостаточно для безопасного автономного применения. Авторы призывают к независимому контролю физического расстояния и контакта, а также к более быстрому управлению нижнего уровня и безопасному восстановлению после сбоев. То, что контроллер отклоняет некоторые недопустимые движения, само по себе не делает его полноценной системой безопасности.
Исследование предлагает конкретный результат: контекст может помочь общей мультимодальной языковой модели управлять инструментами робота в некоторых задачах, и вид контекста имеет значение. Небольшой масштаб оценки, длительность запусков, неполные материалы для публичного воспроизведения и описанные столкновения не позволяют считать эти результаты доказательством того, что домашний гуманоид надежно понимает и выполняет открытые запросы.
Источники и дополнительная литература
- Чен и соавт., «Обучение роботов в контексте с агентами VLM» (arXiv:2609.19138, версия 1, подана 16 сентября 2026 года) — основной препринт с описанием метода, оценки и заявленных ограничений; это не рецензированное доказательство и не отчет о развертывании.
- Страница проекта GPT-Policy авторов — описания экспериментов, видео, результаты по отдельным условиям и обсуждение. Это собственные материалы авторов.
- Публичный репозиторий кода GPT-Policy авторов — описывает опубликованные адаптеры для рук роботов и то, чего нет в публичном репозитории; наличие репозитория само по себе не доказывает, что заявленный эксперимент можно воспроизвести.
- Публикация на Reddit, послужившая поводом для этого материала — источник заявления об Unitree G1; в публикации не приводятся доказательства связи этого сценария со статьей или испытанными роботами.



