Skip to content

Kimi K3 ने ओपन वेट्स जारी किए, और प्रमाण के तौर पर एक ब्राउज़र गेम चुना

Moonshot AI ने 16 जुलाई को Kimi K3 लॉन्च किया और ग्यारह दिन बाद, 27 जुलाई को इसके वेट्स जारी कर दिए। Hugging Face पर इसका डाउनलोड 96 शार्ड्स और लगभग 1.56 TB का है। Nathan Lambert ने इसे "अब तक जारी किया गया स्पष्ट रूप से सबसे शक्तिशाली ओपन मॉडल" कहा, और रैंकिंग भी उनकी बात की पुष्टि करती हैं: Frontend Code Arena में पहला स्थान, Vals AI Index में दूसरा, और Artificial Analysis Intelligence Index में Claude Fable 5 तथा GPT-5.6 Sol Max के बाद तीसरा। ओपन-वेट मॉडल्स में इसके आसपास भी कोई नहीं है।

यही वह कहानी है जो सभी ने लिखी। हमारा ध्यान उस हिस्से ने खींचा जिसे Moonshot ने इसकी क्षमता दिखाने के लिए चुना।

डेमो एक Three.js गेम है

लॉन्च के साथ, K3 ने एक प्रक्रियात्मक 3D एक्सप्लोरेशन गेम बनाया जो ब्राउज़र टैब में चलता है: पानी, पेड़ों, केबिनों, बर्फीले पहाड़ों और घुड़सवारों वाली एक खुली दुनिया, जिसे GPU कंप्यूट के साथ WebGPU रेंडरर पर Three.js में बनाया गया है। यह कोई रिसर्च क्लिप या किसी गेम का वीडियो नहीं है। यह एक ऐसा पेज है जिसे आप लोड कर सकते हैं।

दृश्य से ज़्यादा महत्वपूर्ण तरीका है। WebGPU समुदाय के लेख के अनुसार, मॉडल ने विज़न को लूप में रखकर काम किया और अपने जनरेट किए गए कोड तथा चलते हुए परिणाम के लाइव स्क्रीनशॉट्स के बीच बार-बार पुनरावृत्ति की, ताकि वह देख सके कि उसने क्या बनाया है और उसे सुधार सके। Cinevva के Game Creator के भीतर हम भी यही लूप चलाते हैं, और यही वह चीज़ है जो विश्वसनीय दिखने वाला Three.js कोड लिखने वाले मॉडल को वास्तव में रेंडर होने वाला गेम जारी करने वाले मॉडल से अलग करती है। कोई भी सीन ग्राफ जनरेट कर सकता है। कैमरा टेरेन के अंदर है, यह पहचानना कठिन हिस्सा है।

इस सप्ताह की स्थिति यह है कि एक अग्रणी लैब ने अपना सबसे सक्षम मॉडल लॉन्च करते समय प्रभाव छोड़ने वाले प्रदर्शन के लिए ब्राउज़र-आधारित 3D गेम निर्माण को चुना। दो साल पहले प्रमुख डेमो किसी पहेली का उत्तर देता चैटबॉट हुआ करता था। अब मानक ऐसी चीज़ तक पहुँच गया है जिसमें आप खुद घूम सकते हैं।

मॉडल में वास्तव में क्या है

K3 एक Mixture-of-Experts मॉडल है, जिसमें कुल 2.8 ट्रिलियन पैरामीटर, प्रति टोकन 104 बिलियन सक्रिय पैरामीटर, 1,048,576 टोकन की कॉन्टेक्स्ट विंडो और टेक्स्ट, इमेज तथा वीडियो इनपुट हैं। Moonshot ने आर्किटेक्चर में दो बदलाव—Kimi Delta Attention और Attention Residuals—पेश किए हैं और Kimi K2 की तुलना में स्केलिंग दक्षता में लगभग 2.5 गुना सुधार की रिपोर्ट दी है। यह हमेशा रीजनिंग करता है, और जहाँ जुलाई का लॉन्च केवल एक "max" प्रयास स्तर के साथ आया था, वहीं ओपन रिलीज़ में low, high और max उपलब्ध हैं।

Moonshot के अपने आँकड़ों के अनुसार, यह अधिकांश परीक्षणों में max पर Claude Opus 4.8 और high पर GPT-5.5 को पीछे छोड़ता है, जबकि Fable 5 और GPT-5.6 Sol से हारता है। स्वयं रिपोर्ट किए गए बेंचमार्क्स को अंतिम निर्णय के बजाय एक दावे की तरह लें, लेकिन दो परिणाम स्वतंत्र परीक्षण में भी कायम रहे और दोनों उसी तरह के हैं जो सॉफ़्टवेयर बनाने के लिए मायने रखते हैं: एजेंटिक ब्राउज़िंग के लिए BrowseComp पर 91.2 और लंबे समय तक चलने वाली कोडिंग के लिए SWE Marathon पर 42.0। इससे यह सेकंड के बजाय घंटों तक चलने वाले काम में Fable 5 और Sol, दोनों से आगे निकल जाता है।

API की कीमत प्रति दस लाख इनपुट टोकन $3.00 और आउटपुट टोकन $15.00 है, जबकि कैश्ड इनपुट पर यह घटकर $0.30 रह जाती है—यानी Claude Sonnet 5 के समान प्रमुख दर। OpenRouter इसे थोड़ा सस्ता सूचीबद्ध कर रहा है। इस पर कुछ बनाने से पहले एक सावधानी पढ़ना ज़रूरी है: Tencent के Hunyuan Hy3 के विपरीत, जिसे बिना किसी प्रतिबंध के Apache 2.0 के अंतर्गत जारी किया गया था, K3 एक कस्टम Kimi K3 License के अंतर्गत आता है। ओपन वेट्स और ओपन सोर्स एक ही चीज़ नहीं हैं, और यदि आप इसे किसी व्यावसायिक उत्पाद में शामिल करने की योजना बना रहे हैं, तो अनुमान लगाने के बजाय आपको शर्तें पढ़नी चाहिए।

रिलीज़ की रफ़्तार से जितना लगता है, अंतर उससे कहीं तेज़ी से घट रहा है

व्यापक रुझान पर Lambert का आकलन है कि सर्वश्रेष्ठ क्लोज़्ड मॉडल्स और सर्वश्रेष्ठ ओपन मॉडल्स के बीच का अंतर छह से नौ महीने से घटकर लगभग तीन से पाँच महीने रह गया है। Alibaba पहले ही 2.4 ट्रिलियन पैरामीटर वाले Qwen 3.8 की घोषणा कर चुका है, जिसके ओपन वेट्स बाद में आएँगे, इसलिए यह होड़ धीमी नहीं पड़ रही है। हमने जनवरी 2025 में लिखा था कि DeepSeek R1 ने इंटेलिजेंस की लागत को नए सिरे से तय किया। अठारह महीने बाद, पैटर्न यह है कि हर बदलाव को अपना लिया जाता है और फिर वही प्रक्रिया पहले से भी तेज़ी से दोहराई जाती है।

गेम बनाने वाले किसी भी व्यक्ति के लिए व्यावहारिक परिणाम यह है कि इंटेलिजेंस लेयर लगातार सस्ती और अधिक पोर्टेबल होती जा रही है, जबकि एसेट लेयर पहले ही ऐसा कर चुकी है। जो स्टूडियो अपने कोडबेस पर फ़ाइन-ट्यून किया गया मॉडल चाहता था, उसे पहले ऐसे API पर निर्भरता, जिसे वह नियंत्रित नहीं करता, और किसी कमज़ोर लोकल मॉडल के बीच चुनाव करना पड़ता था। हर तिमाही यह समझौता कम होता जा रहा है।

हम इसके बारे में क्या कर रहे हैं

हम एक मल्टी-प्रोवाइडर गेटवे चलाते हैं, इसलिए हमारे लिए यह कोई सैद्धांतिक बात नहीं, बल्कि एक ठोस निर्णय है। K3 की खूबियाँ ठीक वहीं हैं जहाँ हमारा वर्कलोड है: लंबे समय तक चलने वाली एजेंटिक कोडिंग, टूल का उपयोग, और लाइव गेम से मिले स्क्रीनशॉट्स तथा कंसोल लॉग्स के आधार पर पुनरावृत्ति। हम वास्तविक Game Creator सत्रों पर इसकी तुलना अपने मौजूदा मॉडल लाइनअप से कर रहे हैं, न कि किसी की प्रकाशित तालिका पर, क्योंकि हमारे लिए महत्वपूर्ण मेट्रिक Elo स्कोर नहीं है। असली सवाल यह है कि कितनी बार कोई टर्न ऐसे गेम के साथ समाप्त होता है जिसे व्यक्ति वास्तव में खेल सकता है, और कितनी बार मॉडल उपयोगकर्ता के बताने से पहले अपनी गलती खुद पकड़ लेता है।

हम जो पाएँगे उसे प्रकाशित करेंगे, भले ही निष्कर्ष यह हो कि यह हमारे मौजूदा मॉडल्स से बेहतर नहीं है। इस रिलीज़ की दिलचस्प बात यह नहीं है कि एक चीनी लैब ने बहुत अच्छा ओपन मॉडल जारी किया—यह अब आश्चर्यजनक नहीं रहा। दिलचस्प बात यह है कि इसकी क्षमता साबित करने के लिए उन्होंने ब्राउज़र टैब में चलने वाला गेम चुना, और हम भी यही बना रहे हैं।

संदर्भ