Skip to content

Odyssey-3 ने दो घंटे की फुटेज से GTA V सीखा, फिर Red Dead Redemption 2 में घुड़सवारी की

Oliver Cameron और Jeff Hawke द्वारा 2023 में स्थापित वर्ल्ड-मॉडल कंपनी Odyssey ने 15 सितंबर को Odyssey-3 पेश किया। इसका विचार एक ऐसा पूर्व-प्रशिक्षित मॉडल बनाना है जो समझता हो कि भौतिक दुनिया कैसे व्यवहार करती है, और जिसमें किसी खास शरीर को चलाने के लिए छोटे "एक्शन डिकोडर" जोड़े जा सकें: जैसे रोबोटिक भुजा, ह्यूमनॉइड, कार, ड्रोन या वीडियो गेम का कोई किरदार। गेमिंग से जुड़ा परिणाम ऐसा था जिसने हमारा ध्यान खींचा। GTA V की लगभग दो घंटे की फुटेज पर प्रशिक्षित एक मूवमेंट पॉलिसी ने Red Dead Redemption 2 में घुड़सवारी और Sleeping Dogs में मोटरसाइकिल चलाकर दिखाई, जबकि उसे इनमें से किसी भी गेम पर प्रशिक्षित नहीं किया गया था। Odyssey की घोषणा

Red Dead Redemption 2 के खुले इलाके में घोड़ा चला रही Odyssey-3 पॉलिसी, ओवरले में उसके द्वारा दबाई जा रही WASD कुंजियां दिखाई गई हैं

केवल GTA V पर प्रशिक्षित पॉलिसी के साथ Red Dead Redemption 2 में घुड़सवारी करता Odyssey-3। ओवरले उसके द्वारा दबाई जा रही कुंजियां दिखाता है। चित्र: Odyssey।

एक मॉडल, कई शरीर

Odyssey-3 एक ऑटोरिग्रेसिव डिफ्यूजन ट्रांसफॉर्मर है, जिसे कंपनी के अनुसार दृश्य अवलोकनों के विशाल संग्रह पर प्रशिक्षित किया गया है। इसका लक्ष्य दुनिया के व्यवहार का एक सामान्य, कारणात्मक मॉडल सीखना है। इस मॉडल को स्थिर रखा जाता है। प्रत्येक भौतिक रूप के लिए Odyssey अवलोकन और क्रिया के युग्मों पर एक छोटा एक्शन डिकोडर प्रशिक्षित करता है, जिसका काम वर्ल्ड मॉडल की आंतरिक स्थिति को उस शरीर के लिए आवश्यक नियंत्रणों में बदलना है।

दावा यह है कि अधिकांश समझ स्थिर वर्ल्ड मॉडल में मौजूद होती है, इसलिए डिकोडर को बहुत कम डेटा की जरूरत पड़ती है। रोबोटिक भुजाएं कुछ दर्जन घंटों के प्रदर्शनों से सीखती हैं, और घोषणा में एक भुजा को असफल पकड़ के बाद संभलते हुए तथा असामान्य दिशा में गिरी वस्तु को उठाते हुए दिखाया गया है। Flexion के साथ किए गए काम में ह्यूमनॉइड कुछ दर्जन घंटों के टेलीऑपरेशन से सीखते हैं। ड्रोन कुछ दर्जन घंटों की सिम्युलेटेड उड़ान से वेपॉइंट तक उड़ना सीखते हैं। ड्राइविंग का आंकड़ा सबसे ठोस है: 20 घंटे की सिम्युलेटेड ड्राइविंग पर प्रशिक्षित एक पॉलिसी ने व्यस्त भारतीय सड़कों पर सुरक्षा चालक के हस्तक्षेपों के बीच, वास्तविक फुटेज पर प्रशिक्षित पॉलिसी की तुलना में लगभग 77% दूरी तय की। ये सभी दावे विक्रेता के अपने डेमो से आए हैं और इनमें से किसी को भी Odyssey के बाहर दोहराया नहीं गया है।

प्रत्येक एक्शन डिकोडर को कितना डेटा चाहिए थाOdyssey के अनुसार। वर्ल्ड मॉडल स्वयं साझा और स्थिर है।रोबोटिक भुजाएंकुछ दर्जन घंटेप्रदर्शनों केह्यूमनॉइडकुछ दर्जन घंटेटेलीऑपरेशन केकारें20 घंटे, सिम्युलेटेडवास्तविक डेटा का 77%ड्रोनकुछ दर्जन घंटेसिम्युलेटेड उड़ान केगेमलगभग 2 घंटेGTA V फुटेज केGTA V पॉलिसी Red Dead Redemption 2 और Sleeping Dogs में स्थानांतरित हुईअलग किरदार, वाहन और दुनिया। किसी भी गेम पर अतिरिक्त पॉलिसी प्रशिक्षण नहीं।

गेम एजेंट पिक्सेल देखता है और कुंजियां दबाता है

गेमिंग डिकोडर को गेमप्ले रिकॉर्डिंग के साथ उन्हें उत्पन्न करने वाले कीबोर्ड और माउस इनपुट के युग्मों पर प्रशिक्षित किया जाता है। चलते समय पॉलिसी हाल के फ्रेम देखती है, कुंजियां दबाती और माउस चलाती है, फिर देखती है कि आगे क्या होता है। उसके पास गेम के भीतर कोई API या उसकी स्थिति तक पहुंच नहीं है। वह उसी तरह खेल रही है जैसे कोई व्यक्ति लैपटॉप पर खेलता है। यही कारण है कि डेमो फुटेज के कोने में छोटा-सा WASD ओवरले भी दिखाई देता है: ये वही कुंजियां हैं जिन्हें वह दबा रही है।

Odyssey ने GTA V में लंबे सत्रों की जानकारी दी है, जिनमें ड्राइविंग, गोलीबारी और आमने-सामने की लड़ाई शामिल हैं। लेकिन स्थानांतरण का परिणाम सबसे प्रभावशाली है। GTA की लगभग दो घंटे की फुटेज पर प्रशिक्षित एक गतिशीलता पॉलिसी ने Red Dead Redemption 2 में घोड़े पर सवार किरदार को चलाया—जो अलग किरदार, वाहन और दुनिया वाला एक अलग गेम है—और Sleeping Dogs में मोटरसाइकिल चलाई। दो घंटे लगभग कुछ भी नहीं हैं। इसका मतलब है कि डिकोडर "GTA" सीखने के बजाय किसी जगह में आगे बढ़ने की वर्ल्ड मॉडल की समझ को चार कुंजियों और एक माउस से जोड़ना सीख रहा है।

शाम के समय GTA V में Los Santos की धुंधली सड़क पर दौड़ती Odyssey-3 पॉलिसी, WASD ओवरले में W कुंजी दबाई हुई दिखाई गई है

GTA V में वही पॉलिसी, जिस गेम पर उसे वास्तव में प्रशिक्षित किया गया था। चित्र: Odyssey।

घोषणा में मॉडल को परिवेश उत्पन्न करते और एजेंटों को उनका अन्वेषण करने देते हुए भी दिखाया गया है। तर्क यह है कि पर्याप्त अच्छा सिम्युलेटर अपने भीतर चलने वाले एजेंटों को प्रशिक्षित कर सकता है, और एजेंटों की विफलताएं बताती हैं कि सिम्युलेटर कहां गलत है। यही चक्र वास्तविक उत्पाद है। रोबोट, कारें और गेम यह दिखाने वाले प्रदर्शन हैं कि यह चक्र पूरा होता है। Odyssey का कहना है कि वह आने वाले हफ्तों में मॉडल को सार्वजनिक रूप से जारी करेगा, हालांकि उसने यह नहीं बताया कि वह किस रूप में उपलब्ध होगा।

लकड़ी की मेज पर किराने के सामान से भरे नीले क्रेट में हाथ डालता दो भुजाओं वाला रोबोट, Odyssey के रोबोटिक मैनिपुलेशन डेमो में से एक

किराने के सामान वाले क्रेट का काम पूरा करने के लिए दो भुजाओं वाले रोबोट को चलाता वही स्थिर मॉडल। चित्र: Odyssey।

यह हमारे लिए क्यों मायने रखता है

हमने इस साल वर्ल्ड मॉडल से जुड़ी तीन खबरें प्रकाशित की हैं और वे अलग-अलग दिशाओं की ओर इशारा करती हैं। MIRA ने गेम इंजन की जगह ली और सीधे मॉडल से खेलने योग्य मैच रेंडर किया। World Labs का Atlas दुनिया को स्वयं उत्पन्न, पुनर्निर्मित और सिम्युलेट करता है। Odyssey-3 इंजन को जस का तस छोड़कर उसके भीतर खेलता है। इन तीनों में यही तरीका आपके पहले से बनाए हुए गेम को सीधे प्रभावित करता है।

हमारे गेम क्रिएटर में बना हर गेम ब्राउज़र में चलता है और कीबोर्ड तथा माउस इनपुट लेता है—ठीक वही इंटरफेस जिसका यह पॉलिसी उपयोग करती है। दो घंटे की फुटेज से GTA V में चलना सीख सकने वाला एजेंट बहुत संभव है कि क्रिएटर द्वारा बनाए गए किसी छोटे गेम में इससे भी कम डेटा के साथ चल सके। ऐसा प्लेटेस्टर कभी ऊबता नहीं, उसे निर्देशों की जरूरत नहीं होती और वह एक मिनट के भीतर बता सकता है कि आपके नियंत्रण समझ में आते हैं या नहीं। हम पहले से ही इस सवाल पर काफी मेहनत करते हैं, क्योंकि उलटे कैमरा नियंत्रण और प्रतिक्रिया न देने वाली छलांगें नए गेम को छोड़ देने के सबसे आम कारण हैं। कोई सस्ता एजेंट, जो किसी इंसान के गेम देखने से पहले ही बता दे कि "मैं पहले दरवाजे के आगे नहीं जा सका", हमारे परीक्षण का तरीका बदल देगा।

इसका दूसरा पहलू भी है। अगर किसी 3D दुनिया में चलना इतनी आसानी से अलग-अलग गेमों के बीच स्थानांतरित हो सकता है, तो गेम खेलने वाले एजेंट का वर्ल्ड-मॉडल वाला हिस्सा जल्द ही सामान्य रूप से उपलब्ध तकनीक बन जाएगा। तब असली महत्व डिकोडर का होगा: कोई गेम अपने नियंत्रण कैसे उपलब्ध कराता है, उसकी प्रतिक्रिया कितनी स्पष्ट है और क्या एजेंट समझ सकता है कि उसने सही काम किया। यही गुण किसी गेम को इंसान के लिए भी खेलने योग्य बनाते हैं। संभव है कि एजेंट के लिए गेम बनाना और खिलाड़ी के लिए गेम बनाना अंततः एक ही काम साबित हो।

संदर्भ