Kimi K3 merilis bobot terbuka dan memilih game browser sebagai buktinya
Moonshot AI meluncurkan Kimi K3 pada 16 Juli dan merilis bobotnya sebelas hari kemudian, pada 27 Juli. Unduhannya terdiri dari 96 shard dengan ukuran sekitar 1,56 TB di Hugging Face. Nathan Lambert menyebutnya "jelas merupakan model terbuka terkuat yang pernah dirilis," dan peringkatnya mendukung penilaian tersebut: peringkat pertama di Frontend Code Arena, kedua di Vals AI Index, dan ketiga di Artificial Analysis Intelligence Index, hanya di belakang Claude Fable 5 dan GPT-5.6 Sol Max. Di antara model berbobot terbuka, tidak ada yang mendekatinya.
Itulah kisah yang ditulis semua orang. Bagian yang menarik perhatian kami adalah apa yang dipilih Moonshot untuk memamerkan kemampuannya.
Demonya adalah game Three.js
Bersamaan dengan peluncurannya, K3 menghasilkan game eksplorasi 3D prosedural yang berjalan di tab browser: dunia terbuka dengan air, pepohonan, pondok, pegunungan bersalju, dan penunggang kuda, dibuat dengan Three.js menggunakan perender WebGPU dan komputasi GPU. Bukan cuplikan riset, bukan video sebuah game. Melainkan halaman yang bisa Anda buka.
Metodenya lebih penting daripada adegannya. Menurut ulasan komunitas WebGPU, model tersebut bekerja dengan visi dalam siklus iterasi, bergantian antara kode yang dihasilkannya dan tangkapan layar langsung dari hasil yang sedang berjalan agar dapat melihat apa yang telah dibuat dan memperbaikinya. Itu adalah siklus yang sama dengan yang kami jalankan di dalam Game Creator milik Cinevva, dan inilah yang membedakan model yang sekadar menulis Three.js yang tampak masuk akal dari model yang menghasilkan game yang benar-benar dapat dirender. Siapa pun dapat menghasilkan scene graph. Menyadari bahwa kamera berada di dalam medan adalah bagian yang sulit.
Jadi, situasi pekan ini adalah sebuah laboratorium frontier, saat meluncurkan model tercanggihnya, memilih pembuatan game 3D berbasis browser sebagai demonstrasi yang diharapkan akan menarik perhatian. Dua tahun lalu, demo unggulannya adalah chatbot yang menjawab teka-teki. Kini standarnya telah bergeser menjadi sesuatu yang dapat Anda jelajahi.
Apa yang sebenarnya ada di dalam model ini
K3 adalah Mixture-of-Experts dengan total 2,8 triliun parameter dan 104 miliar parameter aktif per token, jendela konteks 1.048.576 token, serta masukan teks, gambar, dan video. Moonshot memperkenalkan dua perubahan arsitektur, Kimi Delta Attention dan Attention Residuals, serta melaporkan peningkatan efisiensi penskalaan sekitar 2,5 kali dibandingkan Kimi K2. Model ini selalu melakukan penalaran, dan jika peluncuran Juli hanya menyediakan satu tingkat upaya "max", rilis terbukanya menyediakan low, high, dan max.
Berdasarkan angka Moonshot sendiri, pada tingkat max model ini mengungguli Claude Opus 4.8 dan pada tingkat high mengungguli GPT-5.5 di sebagian besar rangkaian pengujian, tetapi kalah dari Fable 5 dan GPT-5.6 Sol. Anggap tolok ukur yang dilaporkan sendiri sebagai klaim, bukan putusan, tetapi dua hasilnya bertahan dalam pengujian independen dan keduanya merupakan jenis hasil yang penting untuk membangun perangkat lunak: BrowseComp dengan skor 91,2 untuk penelusuran agentik dan SWE Marathon dengan skor 42,0 untuk pemrograman jangka panjang. Hasil tersebut menempatkannya di atas Fable 5 dan Sol untuk pekerjaan yang berjalan selama berjam-jam, bukan beberapa detik.
Harga API-nya adalah $3,00 per satu juta token masukan dan $15,00 untuk keluaran, turun menjadi $0,30 untuk masukan yang di-cache, sama dengan tarif utama Claude Sonnet 5. OpenRouter menawarkannya dengan harga sedikit lebih murah. Ada satu catatan penting yang perlu dibaca sebelum Anda membangun sesuatu dengannya: tidak seperti Hunyuan Hy3 milik Tencent, yang dirilis di bawah Apache 2.0 tanpa batasan, K3 dirilis di bawah Kimi K3 License khusus. Bobot terbuka dan sumber terbuka bukanlah hal yang sama, dan jika Anda berencana memasukkannya ke dalam produk komersial, sebaiknya baca persyaratannya alih-alih berasumsi.
Kesenjangannya menyempit lebih cepat daripada yang ditunjukkan siklus rilis
Penilaian Lambert terhadap tren yang lebih luas adalah bahwa jarak antara model tertutup terbaik dan model terbuka terbaik telah menyusut dari enam hingga sembilan bulan menjadi sekitar tiga hingga lima bulan. Alibaba telah mengumumkan Qwen 3.8 dengan 2,4 triliun parameter dan bobot terbuka yang akan menyusul, jadi eskalasinya tidak melambat. Pada Januari 2025, kami menulis bahwa DeepSeek R1 mengubah patokan biaya kecerdasan. Delapan belas bulan kemudian, polanya adalah setiap perubahan besar diserap, lalu diulangi dengan lebih cepat.
Bagi siapa pun yang membuat game, konsekuensi praktisnya adalah lapisan kecerdasan terus menjadi lebih murah dan lebih portabel, sementara lapisan aset telah lebih dahulu mengalaminya. Studio yang menginginkan model yang di-fine-tune pada basis kodenya sendiri sebelumnya harus memilih antara ketergantungan API yang tidak mereka kendalikan dan model lokal yang lebih lemah. Kompromi itu semakin kecil setiap kuartal.
Apa yang kami lakukan untuk menanggapinya
Kami menjalankan gateway multipenyedia, jadi ini adalah keputusan konkret, bukan keputusan abstrak. Kekuatan K3 tepat berada di area beban kerja kami: pemrograman agentik jangka panjang, penggunaan alat, serta iterasi berdasarkan tangkapan layar dan log konsol dari game yang sedang berjalan. Kami menguji tolok ukurnya terhadap jajaran model kami saat ini menggunakan sesi Game Creator nyata, bukan tabel yang diterbitkan pihak mana pun, karena metrik yang kami pedulikan bukanlah skor Elo. Yang penting adalah seberapa sering satu giliran berakhir dengan game yang benar-benar dapat dimainkan pengguna, dan seberapa sering model menangkap kesalahannya sendiri sebelum pengguna harus melakukannya.
Kami akan memublikasikan temuan kami, termasuk jika hasilnya menunjukkan bahwa model ini tidak mengungguli apa yang sudah kami gunakan. Hal menarik dari rilis ini bukanlah bahwa sebuah laboratorium Tiongkok merilis model terbuka yang sangat bagus—hal itu sudah tidak mengejutkan lagi. Yang menarik adalah demo yang mereka pilih sebagai pembuktiannya berupa game di tab browser, persis seperti yang selama ini kami bangun.
Referensi
- Simon Willison: Kimi K3 dan hal yang masih dapat kita pelajari dari tolok ukur pelikan
- Nathan Lambert: Kimi K3 dan eskalasi bobot terbuka
- Komunitas WebGPU: Kimi K3 menggunakan Three.js WebGPU untuk demo game 3D buatan AI
- OpenRouter: moonshotai/kimi-k3
- explainX: Bobot terbuka Kimi K3, 2,8 triliun parameter, hosting hari ke-0