AI-translated from English; not yet reviewed by a fluent editor.
# GPT-Policy проверяет использование контекста в задачах с роботизированной рукой и мобильной разведкой
> В сентябрьском препринте описана задача мобильной разведки с тремя испытаниями наряду с экспериментами с роботизированной рукой. Он не подтверждает отдельное заявление на Reddit о GPT-6 Astra и Unitree G1.
By BIG CHANGE Editorial
Published: 2026-09-27T06:11:48.387Z
Updated: 2026-09-27T06:11:48.387Z
Canonical: https://bigchange.ai/blog/gpt-policy-robot-learning-vlm-agents

AI-generated conceptual illustration by BIG CHANGE.
Сентябрьский [препринт arXiv «Обучение роботов в контексте с агентами VLM»](https://arxiv.org/html/2609.19138v1), представляет GPT-Policy — систему, которая связывает неизменяемую мультимодальную языковую модель с инструментами робота, используя демонстрации, изображения и историю взаимодействия. В эксперименты входят задачи с роботизированной рукой и мобильная разведка. Они не подтверждают отдельное заявление в [публикации на Reddit о GPT-6 Astra и Unitree G1](https://www.reddit.com/r/singularity/s/tjaYXdzfnI).
## Главное изменение
- **Что изменилось:** GPT-Policy предлагает общей мультимодальной языковой модели структурированный способ преобразовывать демонстрации и текущие изображения с камер в запросы к инструментам робота, а затем использовать обратную связь о выполнении для выбора следующего действия без изменения весов модели под конкретную задачу.
- **Почему это важно:** Такой подход отделяет широкое визуальное рассуждение от проверки движений и их выполнения. В ограниченных испытаниях авторов дополнительный контекст помог в некоторых задачах, а действия, чувствительные к контакту, иногда требовали согласованных эталонных записей действий робота.
- **За чем следить:** В статье описано всего по три испытания на каждое условие, а запуски характеризуются как медленные и подверженные сбоям; среди них были столкновения роботизированных рук. Прежде чем эти результаты можно будет распространить на роботов, работающих рядом с людьми, важны воспроизведение эксперимента, более масштабные оценки и независимые средства безопасности.
## Что такое GPT-Policy
Статью подали на arXiv 16 сентября. В ней рассматривается, может ли общая мультимодальная языковая модель выполнять задачу из нового начального состояния, используя примеры и обратную связь, без дообучения и изменения параметров модели под конкретную задачу. Авторы называют свой подход GPT-Policy и указывают GPT-6 Astra среди оцененных моделей.
Система объединяет несколько видов контекста: инструкцию к задаче, текущие изображения с камер и состояние робота, а также дополнительные видео человеческих демонстраций, демонстрации робота с эталонными действиями, целевое изображение, предыдущие попытки робота или взаимодействие с человеком. Компилятор контекста отбирает визуальные переходы, относящиеся к задаче, и объединяет их с инструкциями, ограничениями и схемами инструментов. Затем мультимодальная языковая модель предлагает структурированный запрос к инструменту робота.
Этот запрос передается контроллеру, специфичному для конкретного воплощения. Авторы описывают проверку решений обратной кинематики, выборку декартовых поз и синхронизацию суставных траекторий перед выполнением или отклонением движения. Контроллер возвращает наблюдения и обратную связь о выполнении для следующего решения модели. Модель предлагает действия, а специализированный для робота код проверяет и выполняет их.
Этот цикл — основной вклад статьи. Он позволяет неизменяемой мультимодальной языковой модели адаптировать следующее действие с учетом примеров и недавних результатов, не обновляя веса градиентным методом. «Обучение в контексте» здесь означает использование системой информации, предоставленной во время выполнения задачи. Это не означает, что модель навсегда освоила новый навык или что любой робот может использовать тот же интерфейс инструментов.
## Что измеряли испытания
Авторы сообщают о пяти группах экспериментов в десяти задачах для робота, по три испытания на каждое условие. На [странице проекта](https://cheng-haha.github.io/GPT-Policy/) перечислены запуски на реальном роботе и опубликованы результаты задач, принятые решения и затраченное время. При подборе полотенца GPT-6 Astra справилась в двух из трех испытаний с видео человека и ни в одном из трех без него. При подборе блокнота результат также изменился: с нуля из трех без демонстрации до двух из трех с ней.
Задачи, связанные с контактом, показывают, почему дополнительный контекст не является универсальным решением. При отвинчивании крышки бутылки видеозапись действий робота дала два успешных результата из трех; добавление согласованных записей действий робота — три из трех. При извлечении и повторной установке вилки видеозапись без дополнительных данных не дала ни одного успеха из трех, тогда как видео вместе с эталонными действиями дало два успеха. Это небольшие результаты по отдельным условиям, а не оценка надежности.
Кроме того, в проекте сообщается о трех успехах из трех при размещении блоков и фруктов согласно целевому изображению, а также в двух задачах взаимодействия с человеком. При использовании истории собственных взаимодействий статья сообщает о трех успехах из трех в задачах «Лимон на розовую тарелку» и «Мобильная разведка». Во второй задаче робот активно обходил препятствия в поисках цели; среднее затраченное время составило 25,53 минуты. На рисунке 1 также показано извлечение предмета мобильным роботом. Эти результаты расширяют охват статьи за пределы манипуляций на столе, но остаются избранными задачами с тремя испытаниями на условие. Запуски занимали минуты: на странице проекта указано среднее время 18,9 минуты для подбора полотенца с видео человека и 17,9 минуты для отвинчивания крышки с видео и эталонными действиями. Поэтому задержка и стоимость эксплуатации остаются практическими вопросами, а не решенными задачами.
В приложении B среди описанных в статье конфигураций роботов наряду с YAM и ARX X5 указана Morphi Kino. Уточняется, что у Morphi Kino есть мобильная база, корпус и голова, а также две руки с семью степенями подвижности каждая. Таким образом, в статье рассматривается конфигурация на мобильной платформе наряду с платформами с роботизированными руками; в приложении не упоминается Unitree G1.
## Мобильная задача из статьи не подтверждает сценарий из публикации на Reddit
В [публикации на Reddit](https://www.reddit.com/r/singularity/s/tjaYXdzfnI) утверждается, что GPT-6 Astra управляет Unitree G1 в незнакомом помещении, запоминает расположение предметов и позднее достает их по расплывчатым просьбам. В статье описана отдельная задача «Мобильная разведка» и упоминается Morphi Kino как платформа с мобильной базой, однако ни статья, ни материалы проекта, ни [публичный репозиторий на GitHub](https://github.com/cheng-haha/GPT-Policy) не связывают описанный на Reddit сценарий с G1 с экспериментом GPT-Policy. Это отдельное неподтвержденное заявление; данное сравнение не опровергает его.
На [странице проекта авторов](https://cheng-haha.github.io/GPT-Policy/) размещены видео экспериментов. Они подтверждают, какие задачи, по словам авторов, выполнялись, но не являются независимой проверкой. В общедоступном [репозитории с кодом](https://github.com/cheng-haha/GPT-Policy) сейчас перечислены адаптеры для ARX X5 и I2RT/YAM; также сказано, что публичный репозиторий не содержит среды развертывания, закрытых промптов, записей запусков, калибровки для конкретного участка и истории оценивания. Этот список адаптеров описывает опубликованный репозиторий, а не полный охват статьи, в которой также сообщается о мобильной разведке и упоминается Morphi Kino в приложении B. Доступных материалов недостаточно, чтобы BIG CHANGE мог воспроизвести запуски; мы не испытывали робота.
## Граница управления по-прежнему важна
На странице проекта описаны длинные последовательности действий и отмечены трудности при выполнении. По обсуждению авторов, наблюдавшиеся столкновения рук показывают, что имеющихся мер защиты недостаточно для безопасного автономного применения. Авторы призывают к независимому контролю физического расстояния и контакта, а также к более быстрому управлению нижнего уровня и безопасному восстановлению после сбоев. То, что контроллер отклоняет некоторые недопустимые движения, само по себе не делает его полноценной системой безопасности.
Исследование предлагает конкретный результат: контекст может помочь общей мультимодальной языковой модели управлять инструментами робота в некоторых задачах, и вид контекста имеет значение. Небольшой масштаб оценки, длительность запусков, неполные материалы для публичного воспроизведения и описанные столкновения не позволяют считать эти результаты доказательством того, что домашний гуманоид надежно понимает и выполняет открытые запросы.
## Источники и дополнительная литература
- [Чен и соавт., «Обучение роботов в контексте с агентами VLM» (arXiv:2609.19138, версия 1, подана 16 сентября 2026 года)](https://arxiv.org/abs/2609.19138) — основной препринт с описанием метода, оценки и заявленных ограничений; это не рецензированное доказательство и не отчет о развертывании.
- [Страница проекта GPT-Policy авторов](https://cheng-haha.github.io/GPT-Policy/) — описания экспериментов, видео, результаты по отдельным условиям и обсуждение. Это собственные материалы авторов.
- [Публичный репозиторий кода GPT-Policy авторов](https://github.com/cheng-haha/GPT-Policy) — описывает опубликованные адаптеры для рук роботов и то, чего нет в публичном репозитории; наличие репозитория само по себе не доказывает, что заявленный эксперимент можно воспроизвести.
- [Публикация на Reddit, послужившая поводом для этого материала](https://www.reddit.com/r/singularity/s/tjaYXdzfnI) — источник заявления об Unitree G1; в публикации не приводятся доказательства связи этого сценария со статьей или испытанными роботами.
## Sources
- [Чен и соавт. «Обучение роботов в контексте с агентами VLM», arXiv:2609.19138, версия 1](https://arxiv.org/abs/2609.19138) — Основной препринт, поданный 16 сентября; описывает предложенный метод GPT-Policy, оценку авторов и ограничения. Это не прошедшее рецензирование исследование и не отчет о развертывании.
- [Страница проекта GPT-Policy авторов](https://cheng-haha.github.io/GPT-Policy/) — Основные материалы авторов с описанием системы, экспериментов, таблиц результатов, видео и обсуждения; это не независимая проверка.
- [Публичный репозиторий кода GPT-Policy авторов](https://github.com/cheng-haha/GPT-Policy) — Основной источник о доступных адаптерах и материалах, отсутствующих в репозитории; он не содержит всей калибровки, промптов и истории оценивания, необходимых для воспроизведения без дополнительной подготовки.
- [Публикация на Reddit с заявлением об управлении GPT-6 Astra роботом Unitree G1 в незнакомом помещении](https://www.reddit.com/r/singularity/s/tjaYXdzfnI) — Источник проверяемого вирусного заявления; не доказывает, что описанный сценарий выполнялся в статье или на перечисленных платформах с роботизированными руками.
Рассылка BIG CHANGE
Общая картина. В вашем темпе.
Свежие материалы об ИИ и робототехнике, важные перемены и практические идеи. Выберите ежедневную сводку, еженедельный дайджест или ежемесячный обзор.
Отправка в 09:00 по белградскому времени: ежедневно, по понедельникам или первого числа месяца. Первый выпуск придёт при ближайшей запланированной отправке после подтверждения.
Ваша конфиденциальность — ваш выбор.
Необходимое хранилище помогает защитить сайт и запомнить ваши настройки. Необязательная Google Analytics отключена, пока вы её не разрешите. Все статьи доступны для чтения только с необходимым хранилищем. Подробнее о конфиденциальности