Команда из Калтеха и Стэнфорда представила HomeBody, исследовательскую систему, в которой GPT Astra управляет роботом Unitree G1 при выполнении кухонных задач, вызывая навыки навигации и манипуляции. Сначала робот исследует помещение и сохраняет сведения о местах, где видел предметы. В демонстрациях команды он собирает пакеты кофе, выбрасывает указанные коробки и достает из ящика флакон лекарства, даже когда предмет уже исчез из поля зрения камеры.
Главное изменение
- Что изменилось: HomeBody предоставляет мультимодальной языковой модели доступ к пространственной записи исследованного помещения и общему интерфейсу навыков робота. Модель выбирает навык и цель; локальное ПО планирует движение и выполняет его, а затем сообщает результат.
- Почему это важно: Модель может планировать действия в разных местах и использовать обратную связь без обучения новой политике действий для этой кухни. Демонстрации команды показывают, как память и уже имеющиеся моторные навыки можно объединить для выполнения более длинных задач.
- Что пока остается неизвестным: В открытой публикации показаны отдельные демонстрации, но не результаты контролируемого исследования успешности. По состоянию на 27 сентября полная статья и код робота публично недоступны, поэтому заявленные результаты пока нельзя независимо воспроизвести по материалам релиза.
Как робот запоминает помещение
Работа HomeBody начинается с исследования помещения. Согласно описанию развертывания проекта, G1 собирает видео с широкоугольного iPhone, данные камеры D435i, сканы лидара, положения суставов и выбранные моделью путевые точки. Лидарная SLAM-карта задает измеренную геометрию помещения. Astra использует эти материалы для построения цифрового двойника в Nvidia Isaac Sim. Команда совмещает карту с реконструкцией, чтобы сохраненные изображения с камеры и текущее положение робота находились в одной системе координат.
Такая подготовка важна, когда в инструкции упоминается предмет, которого робот сейчас не видит. По словам команды, для поиска лекарства HomeBody обращается к сохраненным ключевым кадрам камеры, чтобы найти ящик, подъезжает к нему, открывает его и берет флакон. Модель помещения помогает с навигацией и восстановлением местоположения; при непосредственном физическом взаимодействии робот по-прежнему ориентируется на изображение с камеры.
Интерактивный виртуальный проход по кухне — на странице проекта прямо обозначен как иллюстративный и происходит в реконструированном помещении. Отдельно там опубликованы видео, на которых G1 выполняет кухонные задачи; ролики с навыками навигации, захвата, размещения и открытия ящика обозначены как съемка реального робота. Эти видео документируют отдельные запуски, выбранные командой, а симулированное воспроизведение поясняет последовательность планирования.
От решения модели к движению
Модель получает задачу, текущее изображение с камеры, контекст карты, состояние захвата, восстановленные наблюдения и результат предыдущего навыка. Она отправляет структурированный вызов с названием навыка и целью. Для захвата цель задается точкой на изображении по шкале от 0 до 1000 и выбором руки. Локальная система восприятия сегментирует предмет, оценивает глубину по стереоизображениям и преобразует выбор в трехмерную точку захвата. Затем планировщик руки рассчитывает и проверяет траекторию движения. Навигация использует двумерную цель и направление взгляда в координатах карты; размещение — трехмерную точку отпускания. Открытие ящика объединяет выравнивание по ручке, зацеп и движение назад в одно действие.
Навыки выполняют небольшие корректировки на локальном уровне. Команда описывает визуальное отслеживание при приближении и ограниченное число повторных попыток, если захват не удался. Если восстановить выполнение не получается, навык возвращает Astra причину для следующего решения. Ходьба и дотягивание опираются на предварительно обученный контроллер всего тела AMO. На странице сказано, что команды руке и кисти выполняются с частотой 250 Гц, а политика AMO обновляется с частотой 50 Гц. Astra работает удаленно; восприятие, планирование движений и навыки выполняются на ноутбуке с графическим процессором RTX 4090.
Astra выбирает какое действие попробовать и где; библиотека навыков и контроллеры определяют как движется G1. По словам команды, для кухонных демонстраций не использовались данные обучения, специфичные для этой среды, и не проводилось дополнительное обучение политики. Однако в системе по-прежнему задействованы предварительно обученное управление и существенная реконструкция помещения.
Что показывают демонстрации
На странице проекта описаны две физические последовательности задач в незнакомой кухне. В одной G1 собирает пакеты кофе в одном месте и выбрасывает указанные коробки из-под молока и апельсинового сока. В другой робот находит флакон лекарства по недостаточно конкретной просьбе, достает его из ящика, передает человеку и выбрасывает коробку. В роликах с отдельными навыками показаны действия и записанные повторные попытки; страница уточняет, что большинство превью ускорено, и отдельно отмечает последовательность захвата из ящика с непрерывными повторными попытками.
В публикации нет числа испытаний, доли успешно выполненных задач, сравнения с обученной политикой vision-language-action или данных о времени и стоимости каждого завершенного кухонного запуска. Поэтому материалы демонстрируют архитектуру, но не подтверждают количественно, что решение надежно работает на других кухнях. В связанном публичном репозитории сейчас написано «Код скоро появится», а у метки Paper на странице проекта нет ссылки на рукопись. В репозитории размещены сайт, иллюстрации и видео, но нет реализации для робота или файлов с оценкой результатов. BIG CHANGE не запускал HomeBody и не испытывал робота.
В более раннем материале BIG CHANGE о системе GPT-Policy рассматривалась статья другой команды о контексте для действий робота. В материалах HomeBody не сказано, что эта статья относится к данной системе.
Команда перечисляет практические ограничения: создание цифрового двойника требует времени на настройку и затрат на API; удаленная обработка запросов Astra вызывает паузы между навыками; дальность движения и возможности манипуляции ограничивают действия G1; сервоприводы пальцев могут перегреваться при длительной работе. Для локальной системы нужен ноутбук с RTX 4090, а более ресурсоемким навыкам может потребоваться дополнительная вычислительная мощность.
Источники и дополнительная литература
- Страница проекта HomeBody исследователей из Калтеха и Стэнфорда — первичный рассказ о системе, кухонных демонстрациях, симулированном воспроизведении, интерфейсах навыков, системе управления и заявленных ограничениях. Страница датирована сентябрем 2026 года; избранные видео и описания отражают свидетельства самой команды, а не независимую оценку.
- Публичный репозиторий HomeBody группы Stanford TML — на него ссылается страница проекта. По состоянию на 27 сентября 2026 года в README сказано, что код появится позднее; в публичном дереве находятся материалы сайта, а не реализация робота или полная статья.



