Sebuah pracetak arXiv bulan September, “In-Context Robot Learning with VLM Agents” memperkenalkan GPT-Policy, yang menghubungkan model visi-bahasa tetap dengan alat robot menggunakan demonstrasi, gambar, dan riwayat interaksi. Eksperimennya mencakup tugas lengan robot dan eksplorasi bergerak. Eksperimen itu tidak memvalidasi klaim dalam unggahan Reddit tentang GPT-6 Astra dan Unitree G1.
Perubahan besar
- Yang berubah: GPT-Policy memberi model visi-bahasa umum cara terstruktur untuk mengubah demonstrasi dan tampilan kamera terkini menjadi permintaan alat robot, lalu menggunakan umpan balik eksekusi untuk memilih tindakan berikutnya tanpa memperbarui bobot khusus tugas pada model.
- Mengapa ini penting: Pendekatan ini memisahkan penalaran visual umum dari pemeriksaan gerakan dan eksekusi. Dalam percobaan terbatas penulis, konteks tambahan membantu pada beberapa tugas, sedangkan tindakan yang peka terhadap kontak terkadang memerlukan acuan tindakan robot yang diselaraskan.
- Yang perlu dicermati: Makalah hanya melaporkan tiga percobaan per kondisi dan menggambarkan pelaksanaan yang lambat serta rentan gagal, termasuk tabrakan lengan. Replikasi, evaluasi yang lebih besar, dan kendali keselamatan independen diperlukan sebelum hasil ini banyak menjelaskan kemampuan robot bekerja di sekitar manusia.
Cara kerja GPT-Policy
Makalah diajukan ke arXiv pada 16 September. Makalah ini menanyakan apakah model visi-bahasa umum dapat menggunakan contoh dan umpan balik untuk menjalankan tugas dari keadaan awal baru tanpa fine-tuning atau mengubah parameter model khusus tugas. Para penulis menyebut kerangka kerja mereka GPT-Policy dan mencantumkan GPT-6 Astra di antara model yang mereka evaluasi.
Sistem menggabungkan beberapa jenis konteks: instruksi tugas, tampilan kamera dan keadaan saat ini, ditambah opsi video demonstrasi manusia, demonstrasi robot dengan acuan tindakan, gambar sasaran, percobaan robot sebelumnya, atau interaksi manusia. Kompiler konteks memilih transisi visual yang relevan dengan tugas dan menggabungkannya dengan instruksi, batasan, serta skema alat. VLM kemudian mengusulkan permintaan alat robot yang terstruktur.
Permintaan itu diteruskan ke pengendali khusus untuk perwujudan robot terkait. Penulis menjelaskan pemeriksaan solusi kinematika terbalik, pengambilan sampel pose Kartesius, dan pengaturan waktu acuan sendi sebelum gerakan dijalankan atau ditolak. Pengendali mengembalikan pengamatan dan umpan balik eksekusi untuk keputusan model berikutnya. Model mengusulkan tindakan; kode khusus robot memvalidasi dan menjalankannya.
Putaran ini merupakan kontribusi utama makalah. Putaran tersebut memungkinkan VLM tetap menyesuaikan tindakan berikutnya berdasarkan contoh dan hasil terbaru tanpa pembaruan gradien. “Pembelajaran dalam konteks” di sini menjelaskan cara sistem menggunakan informasi yang diberikan selama suatu tugas. Ini tidak berarti model mempelajari keterampilan baru secara permanen atau bahwa setiap robot dapat memakai antarmuka alat yang sama.
Apa yang diukur dalam percobaan
Penulis melaporkan lima kelompok eksperimen pada sepuluh tugas robot, dengan tiga percobaan per kondisi. Halaman proyek mereka mencantumkan percobaan robot nyata dan menerbitkan hasil, keputusan, serta waktu yang berlalu. Dalam tugas mengambil handuk, GPT-6 Astra berhasil pada dua dari tiga percobaan dengan video manusia dan nol dari tiga tanpa video. Tugas mengambil buku catatan juga meningkat dari nol dari tiga tanpa demonstrasi menjadi dua dari tiga dengan demonstrasi.
Tugas yang melibatkan kontak menunjukkan mengapa konteks tambahan bukan solusi umum. Untuk membuka tutup botol, video robot menghasilkan dua keberhasilan dari tiga percobaan; penambahan tindakan robot yang diselaraskan menghasilkan tiga dari tiga. Untuk melepas dan memasang kembali steker, kondisi video saja tidak berhasil dalam tiga percobaan, sedangkan video beserta acuan tindakan mencapai dua. Ini adalah jumlah kecil per kondisi, bukan estimasi keandalan.
Proyek tersebut juga melaporkan keberhasilan tiga dari tiga untuk susunan balok dan buah berdasarkan gambar sasaran serta dua tugas interaksi manusia. Dengan riwayat interaksi mandiri, makalah melaporkan keberhasilan tiga dari tiga untuk “Lemon ke Piring Merah Muda” dan “Eksplorasi Bergerak”. Dalam tugas terakhir, robot secara aktif menghindari rintangan saat mencari sasaran; waktu rata-ratanya 25,53 menit. Gambar 1 juga memperlihatkan pengambilan objek saat bergerak. Hasil ini memperluas cakupan makalah melampaui manipulasi di atas meja, tetapi tetap berupa tugas pilihan dengan tiga percobaan per kondisi. Pelaksanaan tugas berlangsung beberapa menit: halaman proyek melaporkan rata-rata 18,9 menit untuk mengambil handuk dengan video manusia dan 17,9 menit untuk tugas tutup botol dengan video serta acuan tindakan. Karena itu, latensi dan biaya operasi masih menjadi pertanyaan praktis, bukan hal yang telah diatasi.
Lampiran B mencantumkan Morphi Kino bersama YAM dan ARX X5 di antara konfigurasi robot yang dijelaskan dalam makalah. Lampiran itu mengidentifikasi Morphi Kino memiliki alas bergerak, pinggang, kepala, serta dua lengan dengan tujuh sendi masing-masing. Jadi makalah mencakup konfigurasi platform bergerak di samping platform berlengan; lampiran tersebut tidak menyebut Unitree G1.
Tugas bergerak dalam makalah tidak membuktikan skenario Reddit
Unggahan Reddit mengklaim GPT-6 Astra mengendalikan Unitree G1 di ruangan asing, mengingat lokasi benda, lalu mengambilnya kemudian berdasarkan permintaan yang samar. Makalah melaporkan tugas berbeda bernama “Eksplorasi Bergerak” dan menggambarkan Morphi Kino sebagai platform beralas bergerak, tetapi makalah, materi proyek, dan repositori GitHub publik tidak mengidentifikasi skenario G1 dalam unggahan Reddit sebagai eksperimen GPT-Policy. Unggahan tersebut tetap merupakan klaim terpisah yang belum diverifikasi; perbandingan ini tidak membantahnya.
Para penulis menyediakan materi di halaman proyek GPT-Policy yang memuat video eksperimen mereka, yang menjadi bukti tugas yang mereka laporkan, bukan validasi independen. Pohon publik repositori kode saat ini mencantumkan adaptor untuk ARX X5 dan I2RT/YAM serta menyatakan bahwa host penerapan, prompt privat, rekaman proses, kalibrasi khusus lokasi, dan riwayat evaluasi tidak disertakan dalam pohon publik. Daftar adaptor itu menggambarkan repositori yang dirilis; daftar tersebut tidak menentukan seluruh cakupan makalah, yang juga melaporkan eksplorasi bergerak dan mencantumkan Morphi Kino di Lampiran B. Materi yang tersedia tidak cukup terperinci bagi BIG CHANGE untuk mereproduksi proses yang dilaporkan, dan kami tidak menguji robot.
Batas kendali tetap penting
Halaman proyek melaporkan rangkaian tindakan yang panjang dan menyebut kesulitan eksekusi. Pembahasannya menyatakan bahwa tabrakan antarlengan yang teramati menunjukkan perlindungan yang ada belum memadai untuk penerapan otonom yang aman. Penulis menyerukan pemantauan independen atas jarak fisik dan kontak, disertai kendali tingkat rendah yang lebih cepat dan pemulihan yang lebih aman. Pengendali yang menolak sebagian gerakan tidak valid belum tentu merupakan sistem keselamatan yang lengkap.
Studi ini menawarkan hasil riset yang konkret: konteks dapat membantu VLM umum mengarahkan alat robot dalam tugas tertentu, dan jenis konteks berpengaruh. Skala evaluasi, waktu per pelaksanaan, materi publik untuk replikasi yang tidak lengkap, serta tabrakan yang dilaporkan membuat hasil ini masih jauh dari bukti bahwa humanoid rumah tangga dapat memahami dan menjalankan permintaan terbuka secara andal.
Sumber & bacaan lanjutan
- Cheng dkk., “In-Context Robot Learning with VLM Agents” (arXiv:2609.19138, versi 1, diajukan 16 September 2026) — Pracetak utama untuk metode, evaluasi, dan keterbatasan yang dinyatakan; bukan bukti telaah sejawat atau laporan penerapan.
- Halaman proyek GPT-Policy para penulis — Uraian eksperimen, video, hasil per kondisi, dan pembahasan. Ini adalah materi dari para penulis sendiri.
- Repositori kode publik GPT-Policy para penulis — Mendokumentasikan adaptor lengan robot saat ini dan hal-hal yang tidak disertakan dalam pohon publik; ketersediaan repositori saja tidak membuktikan eksperimen yang dilaporkan dapat direproduksi.
- Unggahan Reddit yang memicu laporan ini — Sumber klaim mengenai Unitree G1; unggahan tersebut tidak mengutip bukti yang menghubungkan skenario itu dengan makalah.



