Skip to content

World Labs का Atlas एक ऐसा मॉडल है जो 3D दुनिया बनाता, पुनर्निर्मित करता और सिमुलेट करता है

Fei-Fei Li की World Labs ने 1 सितंबर को Atlas प्रकाशित किया और इसे "स्थानिक बुद्धिमत्ता के लिए एक वर्ल्ड मॉडल" बताया। इस टैगलाइन को हटा दें तो तकनीकी दावा स्पष्ट है: Atlas एक मल्टीमोडल ऑटोरिग्रेसिव डिफ्यूजन ट्रांसफॉर्मर है, जिसे शुरू से प्रीट्रेन किया गया है। यह टेक्स्ट, इमेज, वीडियो, कैमरा पोज़ और डेप्थ को मूल रूप से इनपुट के तौर पर स्वीकार करता है तथा इमेज, वीडियो, पॉइंट क्लाउड और 3D Gaussian splats को आउटपुट के रूप में तैयार करता है। यह न तो ऐसा वीडियो मॉडल है जिस पर बाद में 3D हेड जोड़ दिया गया हो, न ही ऐसा पुनर्निर्माण मॉडल जिसके आगे जनरेटर लगा हो। यह एक ही नेटवर्क है।

World Labs का कहना है कि Atlas उसके पिछले नवंबर में लॉन्च हुए सीन-जनरेशन प्रोडक्ट Marble के "भविष्य के संस्करणों को शक्ति देगा" और भाषा मॉडलों की तरह अधिक ट्रेनिंग कंप्यूट के साथ बेहतर होता जाता है। चुनिंदा साझेदार अनुरोध करके एक्सेस पा सकते हैं। अभी न कोई कीमत घोषित की गई है, न सार्वजनिक API उपलब्ध है।

तीन काम, एक मॉडल

पहला काम कैमरा-नियंत्रित जनरेशन है। Atlas को एक इमेज और कैमरा पाथ दें, और यह उस पाथ पर 1440p में एक मिनट तक का वीडियो रेंडर करता है। चूंकि कैमरा किसी टेक्स्ट संकेत के बजाय स्पष्ट ज्यामितीय इनपुट है, इसलिए मॉडल रास्ते से भटक नहीं सकता। World Labs ने कैमरा-नियंत्रित जनरेशन पर पांच मौजूदा वीडियो मॉडलों के विरुद्ध मानव वरीयता परीक्षण किए। कंपनी के अनुसार, मूल्यांकनकर्ताओं ने MiniMax H3 के मुकाबले 75%, Gemini Omni Flash के मुकाबले 81%, Happy Horse 1.1 के मुकाबले 86%, FLUX 3 के मुकाबले 93% और Seedance 2.5 के मुकाबले 94% बार Atlas को चुना।

मूल्यांकनकर्ताओं ने Atlas को कितनी बार पसंद कियाकैमरा-नियंत्रित जनरेशन, मानव वरीयता। विक्रेता द्वारा किया गया परीक्षण, World Labs की रिपोर्ट।MiniMax H3 के मुकाबले75%Gemini Omni Flash के मुकाबले81%Happy Horse 1.1 के मुकाबले86%FLUX 3 के मुकाबले93%Seedance 2.5 के मुकाबले94%

दूसरा काम पुनर्निर्माण है, और यही वह हिस्सा है जिसके लिए मैं आज पैसे देने को तैयार होता। Atlas को किसी वास्तविक जगह की एक से लेकर सौ से अधिक तस्वीरें दें और यह कैमरा स्थितियों को पुनर्प्राप्त करते हुए पॉइंट क्लाउड या Gaussian splat सीन तैयार करता है। World Labs का दावा है कि DTU, ETH3D, KITTI और ScanNet जैसे मानक बेंचमार्क में औसत निरपेक्ष सापेक्ष त्रुटि के आधार पर यह खास तौर पर 3D पुनर्निर्माण के लिए बनाए गए Pi3X और VGGT समेत अन्य मॉडलों से बेहतर है। कंपनी यह भी कहती है कि दो या तीन इमेज के साथ यह "विश्वसनीय परिणाम देता है और विशेषीकृत 3D मॉडलों से बेहतर प्रदर्शन करता है।" चूंकि पुनर्निर्माण और जनरेशन एक ही नेटवर्क में मौजूद हैं, इसलिए यह इनपुट से आगे का अनुमान भी लगा सकता है: इसे सड़क के स्तर से ली गई एक तस्वीर दें और यह उस ब्लॉक का ऐसा हवाई दृश्य बना देगा जो किसी भी इनपुट में मौजूद नहीं है।

तीसरा काम सिमुलेशन है। Atlas किसी कैप्चर किए गए वीडियो को तीन से पांच नए कैमरा एंगल से दोबारा फ्रेम कर सकता है, इंटरैक्शन के दौरान कठोर, जोड़दार और विकृत होने वाली वस्तुओं को मॉडल कर सकता है और रोबोट के दृष्टिकोण से RGB तथा डेप्थ रेंडर कर सकता है। World Labs ने Atlas द्वारा बनाए गए परिवेशों में पांच रोबोट प्लेटफॉर्म को बिना मानवीय हस्तक्षेप के एक-एक घंटे तक चलाया। पोस्ट में कहा गया है, "दुनिया और उसे देखने वाला रोबोट का दृश्य, दोनों एक ही मॉडल से आते हैं," और यही वह वाक्य है जो बताता है कि कंपनी ने इतनी बड़ी राशि क्यों जुटाई।

Atlas का रोबोटिक्स डेमो, जिसमें जनरेट किए गए सीन में एक रोबोटिक आर्म दिखाया गया है और मॉडल रोबोट के अपने कैमरे का दृश्य रेंडर कर रहा है

वास्तविक दुनिया से सिमुलेशन बनाने वाले टूल के रूप में Atlas: परिवेश और रोबोट के सेंसर का दृश्य एक ही मॉडल से आते हैं। चित्र: World Labs।

सामान्य सावधानी

ये विक्रेता द्वारा चुने गए परीक्षणों पर विक्रेता के अपने आंकड़े हैं, और World Labs खुद भी यह स्वीकार करते हुए कहती है कि "कोई एक बेंचमार्क Atlas की सारी क्षमताओं को नहीं दर्शाता।" वरीयता परीक्षणों में वीडियो मॉडलों की तुलना ऐसे काम—कैमरा नियंत्रण—पर की गई है जिसके लिए Atlas को डिजाइन किया गया था, जबकि वे मॉडल इसके लिए नहीं बने थे। पुनर्निर्माण की तुलनाएं अधिक सार्थक हैं, क्योंकि वे प्रकाशित मेट्रिक्स वाले सार्वजनिक डेटासेट पर की गई हैं, लेकिन अर्ली-एक्सेस सूची से बाहर किसी ने अभी तक उन्हें स्वतंत्र रूप से नहीं दोहराया है।

घोषणा को समझने के लिए संदर्भ भी मायने रखता है। World Labs ने फरवरी में Autodesk, Andreessen Horowitz, Nvidia और AMD से Series B दौर में $1 बिलियन जुटाए थे, उस समय कंपनी का कथित मूल्यांकन $5 बिलियन था। रोबोटिक्स वाला पहलू SceniX से आया है, जिसे कंपनी ने जुलाई में अधिग्रहित किया था। Atlas उस निवेश और अधिग्रहण का उत्पाद है, और इसे जितना उपयोगकर्ताओं के लिए पेश किया जा रहा है, उतना ही साझेदारों और भावी निवेशकों के लिए भी।

अगर आप गेम बनाते हैं तो इसका क्या मतलब है

हम पूरे साल वर्ल्ड मॉडलों पर नजर रख रहे हैं, क्योंकि वे गेम बनाने के मौजूदा तरीके के सामने सबसे विश्वसनीय चुनौती हैं। जुलाई में MIRA ने बिना किसी इंजन के खेलने योग्य Rocket League मैच चलाया था, और Google की Genie श्रृंखला लगातार लंबी अवधि तक काम करने में सक्षम होती जा रही है। Atlas इस समस्या को दूसरी दिशा से हल करता है। यह खुद गेम लूप बनने की कोशिश नहीं करता। यह उस दुनिया को बनाने की कोशिश करता है जिसमें गेम लूप चलता है।

निकट भविष्य में यह हमारे लिए, और शायद आपके लिए भी, अधिक उपयोगी है। Splats और पॉइंट क्लाउड के साथ collision, navigation या gameplay नहीं जुड़ा होता, इसलिए जब तक कोई इन्हें meshes और colliders में बदलने की समस्या हल नहीं करता, तब तक "3D दुनिया बनाना" असल में "पृष्ठभूमि बनाना" ही रहेगा। लेकिन फोन से ली गई दो या तीन तस्वीरों को ऐसे सीन में बदलना, जिसमें आप कैमरा घुमा सकें, environment art बनाने का वह शॉर्टकट है जो हर छोटी टीम चाहती है। अगर Atlas वास्तव में बेंचमार्क के दावों जितना अच्छा है, तो दिलचस्प इंजीनियरिंग सवाल यह होगा कि splat से gameplay geometry कैसे निकाली जाए—और हम अभी जिस समस्या से जूझ रहे हैं, उसके बजाय इस समस्या को चुनना पसंद करेंगे।

ईमानदार स्थिति यह है: यह अनुरोध फॉर्म के साथ एक मजबूत शोध-पत्र है। जब World Labs से बाहर का कोई व्यक्ति इसे चला लेगा, तब हम इसके बारे में फिर लिखेंगे।

संदर्भ