Runway telah mengumumkan Praxis-1, sebuah kebijakan robot yang menurut perusahaan dibangun di atas prapelatihan video berskala besar di balik model dunia mereka. Perusahaan melaporkan pengujian bersama mitra robotika terpilih pada mesin milik mitra. Runway berencana merilis bobot model ke publik dalam beberapa bulan mendatang; bobot tersebut belum tersedia di halaman pengumuman ketika BIG CHANGE memeriksanya pada 3 Oktober. Runway mencantumkan September 2026 sebagai tanggal halaman itu, tanpa menyebut hari tertentu.

Pertanyaan yang melatarinya adalah apakah video sehari-hari dapat memberi kebijakan robot pengetahuan yang berguna sebelum kebijakan itu belajar dari demonstrasi robot. Runway menyajikan perbandingan galat penempatan dan beberapa klip tugas pilihan. Rincian yang diperlukan untuk mereproduksi hasilnya belum dipublikasikan.

Perubahan besar

  • Apa yang berubah: Runway menerapkan prapelatihan video pada prediksi tindakan robot dan melaporkan pengujian pada beberapa jenis perangkat keras milik mitra. Pendekatan ini membuka kemungkinan penggunaan rekaman sudut pandang orang ketiga yang melimpah di bidang yang biaya pengumpulan data demonstrasi robotnya tinggi. Akses ke Praxis-1 masih terbatas pada mitra terpilih.
  • Mengapa ini penting: Diagram Runway melaporkan galat penempatan akhir setelah penyetelan halus sebesar 16,1 cm untuk prapelatihan dengan video web dan 16,0 cm untuk prapelatihan dengan video robot yang dikendalikan operator. Estimasi titik yang ditampilkan berdekatan. Batang ±1 SEM untuk 93 pasangan evaluasi tidak membuktikan adanya perbedaan signifikan ataupun kesetaraan, dan protokol yang dipublikasikan terlalu terbatas untuk menilai kinerja pada robot lain.
  • Yang perlu diperhatikan: Rilis bobot publik, rincian evaluasi per tugas, dan hasil dari mitra akan membantu peneliti menilai seberapa besar kontribusi prapelatihan video serta adaptasi yang dibutuhkan tiap robot. Runway telah menjanjikan bobotnya, tetapi belum memberikan tanggal rilis pasti.

Bagaimana video menjadi bagian dari kebijakan

Halaman riset Praxis-1 dari Runway menyatakan bahwa model video berskala besar mereka mempelajari pola perilaku objek, gerakan tangan, dan tugas fisik. Menurut perusahaan, Praxis-1 membawa prapelatihan tersebut ke dalam kebijakan robot generalis. Argumen mereka: rekaman sudut pandang orang ketiga dapat menjadi titik awal yang berguna sebelum pelatihan robot khusus untuk suatu tugas. Halaman itu menyebut kinerja kebijakan meningkat seiring bertambahnya video sudut pandang orang ketiga.

Halaman tersebut tidak menjelaskan format observasi Praxis-1, keluaran tindakan, prosedur penyetelan halus, antarmuka inferensi, ataupun frekuensi kendali. Halaman itu juga tidak menyediakan berkas bobot atau persyaratan perangkat keras. Kekosongan informasi tersebut penting bagi teknisi yang ingin memperkirakan adaptasi yang diperlukan untuk kamera, penjepit, atau basis bergerak tertentu. Runway memiliki halaman produk model kebijakan GWM-1 yang terpisah dan menjelaskan pengaturan penyetelan halus khusus serta SDK cloud. Antarmuka dan ketentuan komersial produk tersebut tidak boleh dianggap berlaku untuk Praxis-1.

Klip Runway memperlihatkan instruksi menempatkan bola tenis, basis bergerak yang mendekati rak lalu mengambil buku, dan contoh yang melibatkan objek berulang, barang berantakan, bahan transparan, serta kain. Klip lain diberi keterangan bahwa kebijakan yang sama berpindah antara studio dan dapur tanpa pelatihan ulang. Contoh-contoh ini dipilih oleh pengembang; halaman tersebut tidak melaporkan jumlah percobaan atau tingkat keberhasilan untuk contoh-contoh itu.

Apa yang ditunjukkan diagram galat penempatan

Satu-satunya perbandingan numerik pada halaman Runway adalah galat penempatan akhir setelah penyetelan halus, diukur dalam sentimeter; nilai yang lebih rendah berarti lebih baik. Diagramnya mencantumkan prapelatihan video web dari awal sebesar 16,1 cm dan prapelatihan video robot teleoperasi dari awal sebesar 16,0 cm. Runway memetakan jam prapelatihan video serta menyatakan batang galat dan pita menunjukkan ±1 galat baku dari rerata untuk 93 pasangan evaluasi. Catatannya menyebut perbedaan yang lebih kecil daripada satu batang tidak signifikan.

Estimasi titik yang ditampilkan berbeda 0,1 cm. Pada halaman ini, Runway belum memublikasikan komposisi tugas, jumlah robot atau lingkungan, cara membentuk 93 pasangan itu, banyaknya data robot yang digunakan untuk penyetelan halus, ataupun uji statistik lengkap. Dalam perbandingan yang dipilih untuk ditampilkan Runway, estimasi titik galat penempatan akhir yang dilaporkan berdekatan setelah penyetelan halus. Diagram tersebut tidak membuktikan adanya perbedaan yang signifikan secara statistik ataupun kesetaraan untuk ukuran itu. Diagram itu juga tidak menunjukkan keberhasilan andal dalam menyelesaikan tugas yang lebih panjang di dalam klip, maupun pengurangan kebutuhan data dari penerapan nyata.

Runway juga menyebut korelasi 0,95 antara hasil simulasi dan hasil kebijakan robot di dunia nyata. Angka tersebut berasal dari riset evaluasi kebijakan sebelumnya, yang memberi peringkat pada delapan kebijakan untuk tugas di atas meja dengan satu lengan Franka Panda. Itu adalah studi terpisah tentang evaluasi kebijakan, bukan ukuran kinerja Praxis-1 di lapangan.

Status akses

Runway menyebut Noble Machines, Standard Bots, dan Ultra sebagai mitra awal yang menggunakan Praxis-1 pada perangkat keras mereka sendiri. Pada bagian itu, pengumuman menjelaskan manipulasi dengan dua tangan, lengan enam derajat kebebasan, dan basis bergerak. Runway menyatakan bahwa mereka mengevaluasi efektivitas dan keselamatan di berbagai perwujudan dan lingkungan sebelum menyediakan produk secara umum, serta mengundang mitra terpilih lainnya untuk menghubungi tim robotik mereka.

Bagi peneliti di luar program itu, materi yang tersedia hanyalah pengumuman, diagram, dan klip. Halaman tersebut tidak menautkan unduhan bobot Praxis-1 untuk publik, prosedur integrasi yang dipublikasikan, ataupun paket evaluasi yang dapat direproduksi. Runway tidak menyebut biaya akses, lisensi bobot pada masa mendatang, kebutuhan komputasi, atau tanggal peluncuran umum. Tim yang mempertimbangkan akses awal dapat menggunakan informasi publik untuk menyusun pembahasan tentang perangkat keras dan kebutuhan evaluasinya sendiri, tetapi tidak dapat mereproduksi perbandingan yang dilaporkan hanya dari pengumuman itu. BIG CHANGE tidak meminta akses ataupun menguji robot.

Laporan kami sebelumnya tentang GPT-Policy dan HomeBody membahas pertanyaan riset yang berbeda. GPT-Policy memberi konteks demonstrasi dan masukan robot kepada model visi-bahasa tetap melalui prompt; HomeBody menghubungkan ingatan ruang milik humanoid dengan keterampilan yang dapat digunakan kembali. Praxis-1 menguji apakah prapelatihan video yang luas dapat meningkatkan kebijakan itu sendiri. Runway belum merilis implementasinya atau rincian evaluasi yang cukup untuk memeriksa kinerjanya di luar perbandingan yang dilaporkan.

Sumber & bacaan lebih lanjut