9월 arXiv 프리프린트 ‘In-Context Robot Learning with VLM Agents’는 고정된 비전-언어 모델을 시연 데이터와 이미지, 상호작용 이력을 이용해 로봇 도구에 연결하는 GPT-Policy를 소개한다. 실험에는 로봇 팔 과제와 이동 탐색이 포함된다. 하지만 별도로 제기된 Reddit 게시물의 GPT-6 Astra와 Unitree G1 관련 주장은 이 연구로 검증되지 않았다.

큰 변화

  • 달라진 점: GPT-Policy는 일반 비전-언어 모델이 시연과 현재 카메라 화면을 구조화된 로봇 도구 요청으로 바꾸고, 모델의 과제별 가중치를 업데이트하지 않은 채 실행 피드백을 이용해 다음 동작을 선택하는 방법을 제시한다.
  • 중요한 이유: 이 접근 방식은 폭넓은 시각 추론을 동작 점검 및 실행과 분리한다. 저자들의 제한된 시험에서는 추가 맥락이 일부 과제에 도움이 됐지만, 접촉에 민감한 동작에는 로봇 동작 참조를 정렬해 제공해야 하는 경우도 있었다.
  • 지켜볼 점: 논문은 조건별 시험이 3회뿐이라고 보고하며, 느리고 실패가 잦은 실행과 로봇 팔 충돌도 설명한다. 이 결과가 사람 주변에서 작동하는 로봇에 관해 의미 있는 근거가 되려면 재현, 더 큰 규모의 평가, 독립적인 안전 제어가 중요하다.

GPT-Policy의 작동 방식

논문은 9월 16일 arXiv에 제출됐다. 미세 조정이나 과제별 모델 매개변수 변경 없이 일반 비전-언어 모델이 예시와 피드백을 이용해 새로운 초기 상태에서 과제를 수행할 수 있는지를 묻는다. 저자들은 프레임워크를 GPT-Policy라고 부르며 평가 모델 중 하나로 GPT-6 Astra를 언급한다.

시스템은 과제 지시, 현재 카메라 화면과 상태, 선택적으로 제공되는 사람 시연 영상, 동작 참조가 포함된 로봇 시연, 목표 이미지, 이전 로봇 시도 또는 사람과의 상호작용 등 여러 종류의 맥락을 구성한다. 맥락 컴파일러는 과제와 관련된 시각적 전환을 선택하고 이를 지시, 제약 조건, 도구 스키마와 결합한다. 그러면 VLM이 구조화된 로봇 도구 요청을 제안한다.

그 요청은 로봇 형태별 컨트롤러로 전달된다. 저자들은 동작을 실행하거나 거부하기 전에 역기구학 해를 점검하고, 데카르트 좌표 포즈를 표본화하며, 관절 참조 타이밍을 조정한다고 설명한다. 컨트롤러는 다음 모델 결정에 필요한 관측과 실행 피드백을 돌려준다. 모델은 동작을 제안하고 로봇별 코드는 이를 검증하고 수행한다.

이 루프가 논문의 핵심 기여다. 경사하강 업데이트 없이 고정된 VLM이 예시와 최근 결과에 따라 다음 동작을 조정할 수 있다. 여기서 ‘문맥 내 학습’은 과제 중 제공된 정보를 시스템이 사용하는 방식을 뜻한다. 모델이 새 기술을 영구적으로 학습했거나 모든 로봇이 같은 도구 인터페이스를 실행할 수 있다는 의미는 아니다.

시험에서 측정한 것

저자들은 10개 로봇 과제에서 다섯 실험군을 수행하고 조건마다 세 번씩 시험했다고 보고한다. 연구 프로젝트 페이지에는 실제 로봇 실행과 과제 결과, 결정 과정, 경과 시간이 공개돼 있다. 수건 집기에서는 사람 시연 영상을 제공했을 때 GPT-6 Astra가 세 번 중 두 번 성공했고, 영상을 제공하지 않았을 때는 한 번도 성공하지 못했다. 노트북 집기도 시연이 없을 때 세 번 중 0회였던 성공 횟수가 시연을 제공하자 두 번으로 늘었다.

접촉 과제는 추가 맥락이 일반적인 해결책이 아닌 이유를 보여 준다. 병뚜껑을 돌려 여는 과제에서 로봇 영상만 제공하면 세 번 중 두 번 성공했고, 정렬된 로봇 동작을 추가하면 세 번 모두 성공했다. 플러그를 뽑았다가 다시 꽂는 과제에서는 영상만 제공한 조건에서 세 번 모두 실패했지만, 영상과 동작 참조를 함께 제공한 조건에서는 두 번 성공했다. 이는 조건별 표본이 적은 횟수이지 신뢰도 추정치가 아니다.

프로젝트는 목표 이미지로 제시한 블록 및 과일 배열 과제와 두 가지 사람 상호작용 과제에서도 각각 세 번 중 세 번 성공했다고 보고한다. 자기 상호작용 이력을 활용한 경우 논문은 ‘Lemon to Pink Plate’와 ‘Movable Exploration’에서 모두 세 번 중 세 번 성공했다고 보고한다. 후자에서 로봇은 목표물을 찾는 동안 장애물을 적극적으로 피했다. 평균 경과 시간은 25.53분이었다. 그림 1에는 이동 플랫폼으로 물체를 회수하는 장면도 나온다. 이러한 결과는 논문의 범위를 탁상 조작보다 넓히지만, 조건별 시험이 세 번인 선택된 과제라는 한계는 그대로다. 실행에는 수 분이 걸렸다. 프로젝트 페이지에 따르면 사람 영상을 사용한 수건 집기는 평균 18.9분, 영상과 동작 참조를 사용한 병뚜껑 과제는 17.9분이 걸렸다. 따라서 지연 시간과 운영 비용은 해결된 세부 사항이 아니라 남은 실무 과제다.

부록 B는 논문에서 설명한 로봇 구성으로 Morphi Kino를 YAM 및 ARX X5와 함께 열거한다. Morphi Kino는 이동형 베이스와 허리, 머리, 7관절 팔 두 개를 갖춘 것으로 기재돼 있다. 따라서 논문에는 팔 플랫폼 외에 이동 플랫폼 구성도 포함되지만, 부록은 Unitree G1을 언급하지 않는다.

논문의 이동 과제가 Reddit 게시물의 상황을 입증하지는 않는다

해당 Reddit 게시물은 GPT-6 Astra가 낯선 방에서 Unitree G1을 제어하고 물체 위치를 기억했다가 나중에 모호한 요청을 받아 물체를 가져온다고 주장한다. 논문은 별도의 ‘Movable Exploration’ 과제를 보고하고 Morphi Kino를 이동형 베이스 플랫폼으로 설명한다. 그러나 논문과 프로젝트 자료, 공개 GitHub 저장소는 Reddit 게시물에서 주장한 G1 상황이 GPT-Policy 실험이었다고 밝히지 않는다. 해당 게시물은 별도로 검증되지 않은 주장으로 남아 있으며, 이 비교가 그 주장을 반증하는 것은 아니다.

저자들의 프로젝트 페이지에는 실험 영상이 있다. 이는 보고된 과제의 근거이지 독립적인 검증은 아니다. 공개 코드 저장소에는 현재 ARX X5와 I2RT/YAM용 어댑터가 기재돼 있으며, 배포 호스트와 비공개 프롬프트, 실행 기록, 장소별 보정, 평가 이력은 공개 저장소에 포함되지 않는다고 설명한다. 어댑터 목록은 공개된 저장소의 범위를 설명할 뿐, 이동 탐색을 보고하고 부록 B에 Morphi Kino를 기재한 논문 전체의 범위를 정의하지 않는다. 공개 자료만으로는 보고된 실행을 BIG CHANGE가 재현하기에 충분한 세부 사항을 알 수 없으며, 로봇 시험도 하지 않았다.

제어 경계는 여전히 중요하다

프로젝트 페이지는 긴 동작 순서와 실행상의 어려움을 보고한다. 설명에 따르면 실제로 관찰된 팔 사이 충돌은 기존 안전장치만으로는 안전한 자율 배포에 충분하지 않다는 점을 보여 줬다. 저자들은 더 빠른 저수준 제어와 안전한 복구에 더해 물리적 간격과 접촉을 독립적으로 감시해야 한다고 제안한다. 일부 잘못된 동작을 거부하는 컨트롤러가 있다는 사실만으로 완전한 안전 시스템이라고 할 수는 없다.

이 연구는 구체적인 연구 결과를 제시한다. 맥락은 일반 VLM이 특정 과제에서 로봇 도구를 안내하는 데 도움이 될 수 있으며 어떤 맥락을 주느냐도 중요하다. 평가 규모와 실행 시간, 불완전한 공개 재현 자료, 보고된 충돌을 고려하면, 이 결과만으로 가정용 휴머노이드가 개방형 요청을 안정적으로 이해하고 수행한다고 볼 수는 없다.

출처 및 더 읽을거리