Skip to content

Odyssey-3 mempelajari GTA V dari rekaman berdurasi dua jam, lalu menunggang kuda di Red Dead Redemption 2

Odyssey, perusahaan model dunia yang didirikan pada 2023 oleh Oliver Cameron dan Jeff Hawke, memperkenalkan Odyssey-3 pada 15 September. Gagasannya adalah satu model pralatih yang memahami perilaku dunia fisik, dengan "dekoder aksi" kecil yang dipasang untuk mengendalikan tubuh tertentu: lengan robot, humanoid, mobil, drone, atau karakter dalam gim video. Hasil di ranah gim inilah yang membuat kami terpukau. Kebijakan pergerakan yang dilatih dengan rekaman GTA V berdurasi sekitar dua jam berhasil menunggang kuda di Red Dead Redemption 2 dan mengendarai sepeda motor di Sleeping Dogs, tanpa pelatihan pada kedua gim tersebut. Pengumuman Odyssey.

Kebijakan Odyssey-3 menunggang kuda melintasi alam terbuka di Red Dead Redemption 2, dengan tombol WASD yang ditekan ditampilkan sebagai overlay

Odyssey-3 menunggang kuda di Red Dead Redemption 2 dengan kebijakan yang hanya dilatih menggunakan GTA V. Overlay memperlihatkan tombol yang ditekan. Gambar: Odyssey.

Satu model, banyak tubuh

Odyssey-3 adalah transformer difusi autoregresif yang dilatih menggunakan apa yang disebut perusahaan sebagai kumpulan observasi visual yang sangat besar, dengan tujuan mempelajari model umum dan kausal tentang cara dunia berperilaku. Model tersebut tetap dibekukan. Untuk setiap bentuk tubuh, Odyssey melatih dekoder aksi kecil menggunakan pasangan observasi dan aksi, lalu dekoder itu bertugas menerjemahkan keadaan internal model dunia menjadi kontrol yang dibutuhkan tubuh tersebut.

Klaimnya adalah bahwa model yang dibekukan menyimpan sebagian besar pemahaman, sehingga dekodernya hanya memerlukan sedikit data. Lengan robot belajar dari demonstrasi berdurasi puluhan jam, dan pengumuman tersebut memperlihatkan satu robot yang pulih setelah gagal mencengkeram, lalu mengambil objek yang mendarat dalam orientasi yang tidak biasa. Humanoid, dalam kolaborasi dengan Flexion, belajar dari teleoperasi berdurasi puluhan jam. Drone belajar terbang menuju titik tujuan dari simulasi penerbangan berdurasi puluhan jam. Angka untuk berkendara adalah yang paling konkret: kebijakan yang dilatih menggunakan simulasi berkendara selama 20 jam mampu menempuh sekitar 77% jarak antara intervensi pengemudi keselamatan di jalanan India yang ramai dibandingkan kebijakan yang dilatih menggunakan rekaman nyata. Semua itu merupakan klaim vendor dari demo vendor, dan belum ada satu pun yang direproduksi di luar Odyssey.

Berapa banyak data yang dibutuhkan setiap dekoder aksiMenurut laporan Odyssey. Model dunianya sendiri digunakan bersama dan dibekukan.LENGAN ROBOTPuluhan jamdemonstrasiHUMANOIDPuluhan jamteleoperasiMOBIL20 jam, simulasi77% hasil data nyataDRONEPuluhan jampenerbangan simulasiGIMSekitar 2 jamrekaman GTA VKebijakan GTA V ditransfer ke Red Dead Redemption 2 dan Sleeping DogsKarakter, kendaraan, dan dunia berbeda. Tanpa pelatihan kebijakan tambahan pada kedua gim.

Agen gim melihat piksel dan menekan tombol

Dekoder gim dilatih menggunakan rekaman permainan yang dipasangkan dengan input papan ketik dan tetikus yang menghasilkannya. Saat dijalankan, kebijakan mengamati frame terbaru, menghasilkan penekanan tombol dan gerakan tetikus, lalu mengamati apa yang terjadi berikutnya. Tidak ada API yang terhubung ke dalam gim dan tidak ada akses ke status internalnya. Agen ini bermain seperti seseorang bermain di laptop, dan itulah sebabnya rekaman demo juga menampilkan overlay WASD kecil di sudut: itulah tombol-tombol yang sedang ditekan.

Odyssey melaporkan sesi panjang di GTA V yang mencakup mengemudi, menembak, dan pertarungan tangan kosong. Hasil transfernya adalah bagian yang mencolok. Kebijakan mobilitas yang dilatih menggunakan rekaman GTA berdurasi sekitar dua jam mampu menggerakkan karakter yang menunggang kuda di Red Dead Redemption 2—gim berbeda dengan karakter, kendaraan, dan dunia yang berbeda—serta mengendarai sepeda motor di Sleeping Dogs. Dua jam bukanlah apa-apa. Artinya, dekoder tersebut tidak terlalu mempelajari "GTA", melainkan belajar memetakan konsep model dunia tentang bergerak melintasi suatu tempat ke empat tombol dan sebuah tetikus.

Kebijakan Odyssey-3 berlari menyusuri jalanan Los Santos yang berkabut di GTA V saat senja, dengan overlay WASD yang memperlihatkan tombol W ditekan

Kebijakan yang sama di GTA V, gim yang benar-benar digunakan untuk melatihnya. Gambar: Odyssey.

Pengumuman itu juga memperlihatkan model yang menghasilkan lingkungan dan membiarkan agen menjelajahinya, dengan argumen bahwa simulator yang cukup baik dapat melatih agen yang berjalan di dalamnya, sementara kegagalan agen menunjukkan bagian yang keliru dari simulator. Siklus itulah produk sebenarnya. Robot, mobil, dan gim adalah demonstrasi bahwa siklus tersebut dapat berjalan utuh. Odyssey mengatakan akan merilis model itu secara publik dalam beberapa minggu mendatang, tanpa menyebutkan bentuk rilisnya.

Robot berlengan ganda menjangkau ke dalam peti biru berisi bahan makanan di atas meja kayu, salah satu demo manipulasi robot Odyssey

Model beku yang sama mengendalikan robot berlengan dua untuk menyelesaikan tugas dengan peti bahan makanan. Gambar: Odyssey.

Mengapa ini relevan bagi kami

Tahun ini kami telah membahas tiga kisah tentang model dunia, dan ketiganya mengarah ke arah yang berbeda. MIRA menggantikan mesin gim dan merender pertandingan yang dapat dimainkan langsung dari model. Atlas dari World Labs menghasilkan, merekonstruksi, dan menyimulasikan dunia itu sendiri. Odyssey-3 membiarkan mesin gim tetap bekerja dan bermain di dalamnya. Dari ketiganya, inilah yang bersinggungan dengan gim yang sudah Anda buat.

Setiap gim yang dibuat dengan Game Creator kami berjalan di peramban dan menerima input papan ketik serta tetikus, persis seperti antarmuka yang digunakan kebijakan ini. Agen yang dapat bergerak di GTA V setelah mempelajari rekaman berdurasi dua jam kemungkinan besar dapat bergerak di dalam gim kecil buatan kreator dengan data yang lebih sedikit. Itu berarti hadirnya penguji gim yang tidak pernah bosan, tidak memerlukan instruksi, dan dapat memberi tahu Anda dalam waktu satu menit apakah kontrol gim Anda masuk akal. Kami sudah mencurahkan banyak upaya untuk pertanyaan tersebut, karena kamera terbalik dan lompatan yang tidak responsif merupakan alasan paling umum sebuah gim baru ditinggalkan. Agen murah yang menandai "Saya tidak bisa melewati pintu pertama" sebelum gim dilihat manusia akan mengubah cara kami melakukan pengujian.

Namun, ada sisi lainnya. Jika kemampuan bergerak dalam dunia 3D dapat ditransfer antargim semudah ini, sisi model dunia dari agen pemain gim akan segera menjadi komoditas, dan bagian yang penting adalah dekodernya: bagaimana sebuah gim menyediakan kontrol, seberapa mudah umpan baliknya dipahami, dan apakah agen dapat mengetahui bahwa tindakannya benar. Itu adalah karakteristik yang sama yang membuat gim dapat dimainkan oleh manusia. Membangun untuk agen dan membangun untuk pemain mungkin pada akhirnya merupakan pekerjaan yang sama.

Referensi