Odyssey-3 ने दो घंटे की फुटेज से GTA V सीखा, फिर Red Dead Redemption 2 में घुड़सवारी की
Oliver Cameron और Jeff Hawke द्वारा 2023 में स्थापित वर्ल्ड-मॉडल कंपनी Odyssey ने 15 सितंबर को Odyssey-3 पेश किया। इसका विचार एक ऐसा पूर्व-प्रशिक्षित मॉडल बनाना है जो समझता हो कि भौतिक दुनिया कैसे व्यवहार करती है, और जिसमें किसी खास शरीर को चलाने के लिए छोटे "एक्शन डिकोडर" जोड़े जा सकें: जैसे रोबोटिक भुजा, ह्यूमनॉइड, कार, ड्रोन या वीडियो गेम का कोई किरदार। गेमिंग से जुड़ा परिणाम ऐसा था जिसने हमारा ध्यान खींचा। GTA V की लगभग दो घंटे की फुटेज पर प्रशिक्षित एक मूवमेंट पॉलिसी ने Red Dead Redemption 2 में घुड़सवारी और Sleeping Dogs में मोटरसाइकिल चलाकर दिखाई, जबकि उसे इनमें से किसी भी गेम पर प्रशिक्षित नहीं किया गया था। Odyssey की घोषणा।

केवल GTA V पर प्रशिक्षित पॉलिसी के साथ Red Dead Redemption 2 में घुड़सवारी करता Odyssey-3। ओवरले उसके द्वारा दबाई जा रही कुंजियां दिखाता है। चित्र: Odyssey।
एक मॉडल, कई शरीर
Odyssey-3 एक ऑटोरिग्रेसिव डिफ्यूजन ट्रांसफॉर्मर है, जिसे कंपनी के अनुसार दृश्य अवलोकनों के विशाल संग्रह पर प्रशिक्षित किया गया है। इसका लक्ष्य दुनिया के व्यवहार का एक सामान्य, कारणात्मक मॉडल सीखना है। इस मॉडल को स्थिर रखा जाता है। प्रत्येक भौतिक रूप के लिए Odyssey अवलोकन और क्रिया के युग्मों पर एक छोटा एक्शन डिकोडर प्रशिक्षित करता है, जिसका काम वर्ल्ड मॉडल की आंतरिक स्थिति को उस शरीर के लिए आवश्यक नियंत्रणों में बदलना है।
दावा यह है कि अधिकांश समझ स्थिर वर्ल्ड मॉडल में मौजूद होती है, इसलिए डिकोडर को बहुत कम डेटा की जरूरत पड़ती है। रोबोटिक भुजाएं कुछ दर्जन घंटों के प्रदर्शनों से सीखती हैं, और घोषणा में एक भुजा को असफल पकड़ के बाद संभलते हुए तथा असामान्य दिशा में गिरी वस्तु को उठाते हुए दिखाया गया है। Flexion के साथ किए गए काम में ह्यूमनॉइड कुछ दर्जन घंटों के टेलीऑपरेशन से सीखते हैं। ड्रोन कुछ दर्जन घंटों की सिम्युलेटेड उड़ान से वेपॉइंट तक उड़ना सीखते हैं। ड्राइविंग का आंकड़ा सबसे ठोस है: 20 घंटे की सिम्युलेटेड ड्राइविंग पर प्रशिक्षित एक पॉलिसी ने व्यस्त भारतीय सड़कों पर सुरक्षा चालक के हस्तक्षेपों के बीच, वास्तविक फुटेज पर प्रशिक्षित पॉलिसी की तुलना में लगभग 77% दूरी तय की। ये सभी दावे विक्रेता के अपने डेमो से आए हैं और इनमें से किसी को भी Odyssey के बाहर दोहराया नहीं गया है।
गेम एजेंट पिक्सेल देखता है और कुंजियां दबाता है
गेमिंग डिकोडर को गेमप्ले रिकॉर्डिंग के साथ उन्हें उत्पन्न करने वाले कीबोर्ड और माउस इनपुट के युग्मों पर प्रशिक्षित किया जाता है। चलते समय पॉलिसी हाल के फ्रेम देखती है, कुंजियां दबाती और माउस चलाती है, फिर देखती है कि आगे क्या होता है। उसके पास गेम के भीतर कोई API या उसकी स्थिति तक पहुंच नहीं है। वह उसी तरह खेल रही है जैसे कोई व्यक्ति लैपटॉप पर खेलता है। यही कारण है कि डेमो फुटेज के कोने में छोटा-सा WASD ओवरले भी दिखाई देता है: ये वही कुंजियां हैं जिन्हें वह दबा रही है।
Odyssey ने GTA V में लंबे सत्रों की जानकारी दी है, जिनमें ड्राइविंग, गोलीबारी और आमने-सामने की लड़ाई शामिल हैं। लेकिन स्थानांतरण का परिणाम सबसे प्रभावशाली है। GTA की लगभग दो घंटे की फुटेज पर प्रशिक्षित एक गतिशीलता पॉलिसी ने Red Dead Redemption 2 में घोड़े पर सवार किरदार को चलाया—जो अलग किरदार, वाहन और दुनिया वाला एक अलग गेम है—और Sleeping Dogs में मोटरसाइकिल चलाई। दो घंटे लगभग कुछ भी नहीं हैं। इसका मतलब है कि डिकोडर "GTA" सीखने के बजाय किसी जगह में आगे बढ़ने की वर्ल्ड मॉडल की समझ को चार कुंजियों और एक माउस से जोड़ना सीख रहा है।

GTA V में वही पॉलिसी, जिस गेम पर उसे वास्तव में प्रशिक्षित किया गया था। चित्र: Odyssey।
घोषणा में मॉडल को परिवेश उत्पन्न करते और एजेंटों को उनका अन्वेषण करने देते हुए भी दिखाया गया है। तर्क यह है कि पर्याप्त अच्छा सिम्युलेटर अपने भीतर चलने वाले एजेंटों को प्रशिक्षित कर सकता है, और एजेंटों की विफलताएं बताती हैं कि सिम्युलेटर कहां गलत है। यही चक्र वास्तविक उत्पाद है। रोबोट, कारें और गेम यह दिखाने वाले प्रदर्शन हैं कि यह चक्र पूरा होता है। Odyssey का कहना है कि वह आने वाले हफ्तों में मॉडल को सार्वजनिक रूप से जारी करेगा, हालांकि उसने यह नहीं बताया कि वह किस रूप में उपलब्ध होगा।

किराने के सामान वाले क्रेट का काम पूरा करने के लिए दो भुजाओं वाले रोबोट को चलाता वही स्थिर मॉडल। चित्र: Odyssey।
यह हमारे लिए क्यों मायने रखता है
हमने इस साल वर्ल्ड मॉडल से जुड़ी तीन खबरें प्रकाशित की हैं और वे अलग-अलग दिशाओं की ओर इशारा करती हैं। MIRA ने गेम इंजन की जगह ली और सीधे मॉडल से खेलने योग्य मैच रेंडर किया। World Labs का Atlas दुनिया को स्वयं उत्पन्न, पुनर्निर्मित और सिम्युलेट करता है। Odyssey-3 इंजन को जस का तस छोड़कर उसके भीतर खेलता है। इन तीनों में यही तरीका आपके पहले से बनाए हुए गेम को सीधे प्रभावित करता है।
हमारे गेम क्रिएटर में बना हर गेम ब्राउज़र में चलता है और कीबोर्ड तथा माउस इनपुट लेता है—ठीक वही इंटरफेस जिसका यह पॉलिसी उपयोग करती है। दो घंटे की फुटेज से GTA V में चलना सीख सकने वाला एजेंट बहुत संभव है कि क्रिएटर द्वारा बनाए गए किसी छोटे गेम में इससे भी कम डेटा के साथ चल सके। ऐसा प्लेटेस्टर कभी ऊबता नहीं, उसे निर्देशों की जरूरत नहीं होती और वह एक मिनट के भीतर बता सकता है कि आपके नियंत्रण समझ में आते हैं या नहीं। हम पहले से ही इस सवाल पर काफी मेहनत करते हैं, क्योंकि उलटे कैमरा नियंत्रण और प्रतिक्रिया न देने वाली छलांगें नए गेम को छोड़ देने के सबसे आम कारण हैं। कोई सस्ता एजेंट, जो किसी इंसान के गेम देखने से पहले ही बता दे कि "मैं पहले दरवाजे के आगे नहीं जा सका", हमारे परीक्षण का तरीका बदल देगा।
इसका दूसरा पहलू भी है। अगर किसी 3D दुनिया में चलना इतनी आसानी से अलग-अलग गेमों के बीच स्थानांतरित हो सकता है, तो गेम खेलने वाले एजेंट का वर्ल्ड-मॉडल वाला हिस्सा जल्द ही सामान्य रूप से उपलब्ध तकनीक बन जाएगा। तब असली महत्व डिकोडर का होगा: कोई गेम अपने नियंत्रण कैसे उपलब्ध कराता है, उसकी प्रतिक्रिया कितनी स्पष्ट है और क्या एजेंट समझ सकता है कि उसने सही काम किया। यही गुण किसी गेम को इंसान के लिए भी खेलने योग्य बनाते हैं। संभव है कि एजेंट के लिए गेम बनाना और खिलाड़ी के लिए गेम बनाना अंततः एक ही काम साबित हो।