Skip to content

Odyssey-3 iki saatlik görüntüden GTA V'i öğreniyor, ardından Red Dead Redemption 2'de ata biniyor

Oliver Cameron ve Jeff Hawke tarafından 2023'te kurulan dünya modeli şirketi Odyssey, 15 Eylül'de Odyssey-3'ü tanıttı. Önerinin temelinde, fiziksel dünyanın nasıl davrandığını anlayan ve belirli bir bedeni —robot kolu, insansı robot, otomobil, dron veya video oyunundaki bir karakter— yönetmek için küçük "eylem kod çözücüleri" eklenen, önceden eğitilmiş tek bir model bulunuyor. Bizim dikkatimizi çeken sonuç ise oyunlarla ilgili olanıydı. Yaklaşık iki saatlik GTA V görüntüsüyle eğitilen bir hareket politikası, bu oyunların hiçbirinde eğitilmeden Red Dead Redemption 2'de ata bindi ve Sleeping Dogs'ta motosiklet sürdü. Odyssey'nin duyurusu.

Red Dead Redemption 2'de açık arazide at süren bir Odyssey-3 politikası; bastığı WASD tuşları görüntünün üzerinde gösteriliyor

Yalnızca GTA V ile eğitilmiş bir politikanın Red Dead Redemption 2'de Odyssey-3 ile at sürmesi. Görüntünün üzerindeki katman, basılan tuşları gösteriyor. Görsel: Odyssey.

Tek model, birçok beden

Odyssey-3, şirketin çok geniş bir görsel gözlem koleksiyonu olarak tanımladığı veri kümesiyle eğitilmiş otoregresif bir difüzyon transformatörüdür. Amaç, dünyanın nasıl davrandığına ilişkin genel ve nedensel bir model öğrenmektir. Bu model daha sonra dondurulur. Odyssey, her beden yapısı için gözlem-eylem çiftleriyle küçük bir eylem kod çözücüsü eğitir; kod çözücünün görevi, dünya modelinin iç durumunu o bedenin ihtiyaç duyduğu kontrollere çevirmektir.

İddiaya göre anlayışın büyük bölümünü dondurulmuş model taşıyor, dolayısıyla kod çözücüler çok az veriye ihtiyaç duyuyor. Robot kolları onlarca saatlik gösterimden öğreniyor ve duyuruda, başarısız bir kavrama girişiminden sonra toparlanıp alışılmadık bir yönde düşmüş nesneyi alan bir robot gösteriliyor. Flexion ile yürütülen çalışmadaki insansı robotlar, onlarca saatlik uzaktan operasyondan öğreniyor. Dronlar, onlarca saatlik simüle edilmiş uçuştan ara noktalara uçmayı öğreniyor. Sürüşle ilgili sayı en somut olanı: 20 saatlik simüle edilmiş sürüşle eğitilen bir politika, yoğun Hindistan yollarında güvenlik sürücüsünün müdahaleleri arasında, gerçek görüntülerle eğitilen bir politikanın katettiği mesafenin yaklaşık %77'sini katetti. Bunların tümü, bir sağlayıcının kendi demosunda sunduğu iddialardır ve hiçbiri Odyssey dışında yeniden üretilmemiştir.

Her eylem kod çözücüsünün ihtiyaç duyduğu veri miktarıOdyssey'nin bildirdiği üzere. Dünya modelinin kendisi ortaktır ve dondurulmuştur.ROBOT KOLLARIOnlarca saatgösterimİNSANSI ROBOTLAROnlarca saatuzaktan operasyonOTOMOBİLLER20 saat, simülasyonGerçek veri sonucunun %77'siDRONLAROnlarca saatsimüle edilmiş uçuşOYUNLARYaklaşık 2 saatGTA V görüntüsüGTA V politikası Red Dead Redemption 2 ve Sleeping Dogs'a aktarıldıFarklı karakter, araç ve dünya. İki oyunda da ek politika eğitimi yok.

Oyun ajanı pikselleri görüyor ve tuşlara basıyor

Oyun kod çözücüsü, oynanış kayıtları ile bunları oluşturan klavye ve fare girdilerinin eşleştirildiği verilerle eğitiliyor. Çalışma sırasında politika son kareleri izliyor, tuş basımları ve fare hareketleri üretiyor, ardından ne olduğunu gözlemliyor. Oyunun API'sine veya durum bilgisine erişimi yok. Tıpkı dizüstü bilgisayarda oynayan bir insan gibi oynuyor; demo görüntülerinin köşesinde küçük bir WASD katmanı bulunmasının nedeni de bu: bunlar, bastığı tuşlar.

Odyssey, GTA V'te araç kullanma, ateş etme ve yakın dövüşü içeren uzun süreli oturumlar bildiriyor. Çarpıcı olan kısım ise aktarım sonucu. Yaklaşık iki saatlik GTA görüntüsüyle eğitilen bir hareketlilik politikası, farklı bir karaktere, araca ve dünyaya sahip başka bir oyun olan Red Dead Redemption 2'de at üstündeki bir karakteri hareket ettirdi ve Sleeping Dogs'ta motosiklet sürdü. İki saat yok denecek kadar az. Bu, kod çözücünün "GTA"yı öğrenmekten ziyade, dünya modelinin bir mekânda hareket etme kavrayışını dört tuş ve bir fareye eşlemeyi öğrendiği anlamına geliyor.

Alacakaranlıkta sisli bir Los Santos sokağında koşan bir Odyssey-3 politikası; WASD katmanında W tuşuna basıldığı gösteriliyor

Aynı politika, gerçekten eğitildiği oyun olan GTA V'te. Görsel: Odyssey.

Duyuruda ayrıca modelin ortamlar ürettiği ve ajanların bunları keşfetmesine izin verdiği gösteriliyor. Buradaki sav, yeterince iyi bir simülatörün içinde çalışan ajanları eğitebileceği ve ajanların başarısızlıklarının simülatörün neleri yanlış yaptığını göstereceğidir. Asıl ürün bu döngüdür. Robotlar, otomobiller ve oyunlar, döngünün tamamlandığını gösteren demolar. Odyssey, hangi biçimde olacağını belirtmeden modeli önümüzdeki haftalarda herkese açık olarak yayımlayacağını söylüyor.

Ahşap bir masanın üzerindeki mavi erzak kasasına uzanan çift kollu bir robot; Odyssey'nin robotik manipülasyon demolarından biri

Bir erzak kasası görevinde çift kollu robotu yöneten aynı dondurulmuş model. Görsel: Odyssey.

Bunun bizi neden ilgilendirdiği

Bu yıl üç dünya modeli haberini ele aldık ve her biri farklı bir yöne işaret ediyor. MIRA, oyun motorunun yerini alarak doğrudan modelden oynanabilir bir karşılaşma oluşturdu. World Labs'in Atlas'ı, dünyanın kendisini üretiyor, yeniden oluşturuyor ve simüle ediyor. Odyssey-3 ise oyun motoruna dokunmadan onun içinde oynuyor. Üçü arasında, daha önce oluşturduğunuz bir oyuna doğrudan temas eden yaklaşım bu.

Oyun Oluşturucumuzda geliştirilen her oyun tarayıcıda çalışıyor ve klavye ile fare girdisi alıyor; bu da tam olarak bu politikanın kullandığı arayüz. İki saatlik görüntüden GTA V içinde hareket etmeyi öğrenebilen bir ajan, büyük olasılıkla içerik üreticilerinin yaptığı küçük bir oyunda daha da az veriyle hareket edebilir. Böylece hiç sıkılmayan, talimatlara ihtiyaç duymayan ve kontrollerinizin anlaşılır olup olmadığını bir dakika içinde söyleyebilen bir oyun test uzmanına sahip olursunuz. Bu soru üzerinde zaten çok çaba harcıyoruz; çünkü ters çevrilmiş kameralar ve tepki vermeyen zıplamalar, yeni bir oyunun terk edilmesinin en yaygın nedenleri arasında. Bir insan oyunu görmeden önce "ilk kapıyı geçemedim" uyarısı verebilen ucuz bir ajan, test yöntemimizi değiştirirdi.

Bunun ters yönde de sonuçları var. Bir 3D dünyada hareket etmek oyunlar arasında bu kadar kolay aktarılabiliyorsa, oyun oynayan ajanın dünya modeli tarafı standart bir ürüne dönüşmeye yakın demektir ve önemli olan kısım kod çözücü olacaktır: oyunun kontrolleri nasıl sunduğu, geri bildiriminin ne kadar anlaşılır olduğu ve ajanın doğru şeyi yapıp yapmadığını anlayabilmesi. Bunlar, bir oyunu insanlar için oynanabilir kılan özelliklerle aynı. Ajan için geliştirme yapmakla oyuncu için geliştirme yapmak, sonunda aynı iş çıkabilir.

Kaynaklar