Kimi K3 açık ağırlıklarla yayınlandı ve bunu kanıtlamak için bir tarayıcı oyununu seçti
Moonshot AI, Kimi K3'ü 16 Temmuz'da kullanıma sundu ve on bir gün sonra, 27 Temmuz'da ağırlıklarını yayınladı. Hugging Face'teki indirme paketi 96 parçadan oluşuyor ve yaklaşık 1,56 TB boyutunda. Nathan Lambert modeli "açıkça bugüne kadar yayınlanmış en güçlü açık model" olarak nitelendirdi ve sıralamalar da onu destekliyor: Frontend Code Arena'da birinci, Vals AI Index'te ikinci, Artificial Analysis Intelligence Index'te ise yalnızca Claude Fable 5 ve GPT-5.6 Sol Max'in ardından üçüncü. Açık ağırlıklı modeller arasında yanına yaklaşan yok.
Herkesin yazdığı hikâye buydu. Bizim dikkatimizi çeken kısım ise Moonshot'ın modeli sergilemek için neyi seçtiğiydi.
Demo bir Three.js oyunu
K3, lansmanla birlikte bir tarayıcı sekmesinde çalışan prosedürel bir 3D keşif oyunu üretti: WebGPU renderer ve GPU compute kullanılarak Three.js ile oluşturulmuş; su, ağaçlar, kulübeler, karlı dağlar ve atlıların yer aldığı açık bir dünya. Bir araştırma klibi ya da oyun videosu değil. Yükleyip açtığınız bir sayfa.
Yöntem, sahneden daha önemli. WebGPU topluluğunun yazısına göre model, görsel geri bildirimi döngüye dahil ederek çalıştı; ürettiği kod ile çalışan sonucun canlı ekran görüntüleri arasında yinelemeler yaparak ne oluşturduğunu görebildi ve hatalarını düzeltebildi. Cinevva'nın Game Creator'ında yürüttüğümüz döngü de tam olarak bu ve makul görünen Three.js kodu yazan bir modelle, gerçekten render edilen bir oyun teslim eden modeli birbirinden ayıran şey bu. Herkes bir sahne grafiği üretebilir. Kameranın arazinin içinde kaldığını fark etmek zor olan kısım.
Dolayısıyla bu hafta itibarıyla geldiğimiz noktada, en yetenekli modelini piyasaya süren öncü bir laboratuvar, etkili olacak tanıtım için tarayıcı tabanlı 3D oyun geliştirmeye başvurdu. İki yıl önce amiral gemisi demo, bir bilmeceyi yanıtlayan sohbet botuydu. Çıta, içinde dolaşabileceğiniz bir şeye yükseldi.
Modelin içinde gerçekte ne var?
K3, toplam 2,8 trilyon parametreye ve token başına 104 milyar aktif parametreye sahip bir Mixture-of-Experts modeli. 1.048.576 tokenlık bağlam penceresiyle metin, görüntü ve video girdilerini destekliyor. Moonshot, Kimi Delta Attention ve Attention Residuals adlı iki mimari değişiklik sundu ve Kimi K2'ye kıyasla ölçekleme verimliliğinde yaklaşık 2,5 kat artış bildirdi. Model her zaman akıl yürütüyor; Temmuz lansmanı yalnızca "max" efor düzeyiyle sunulmuşken açık sürüm low, high ve max seçeneklerini kullanıma açıyor.
Moonshot'ın kendi rakamlarına göre model, test paketinin çoğunda max düzeyinde Claude Opus 4.8'i ve high düzeyinde GPT-5.5'i geride bırakırken Fable 5 ve GPT-5.6 Sol'a yeniliyor. Şirketin kendi bildirdiği kıyaslama sonuçlarını kesin hükümden ziyade bir iddia olarak değerlendirmek gerek, ancak iki sonuç bağımsız testlerde de doğrulandı ve her ikisi de yazılım geliştirmek açısından önemli olan türden: ajan tabanlı web taramada 91,2 BrowseComp puanı ve uzun soluklu kodlamada 42,0 SWE Marathon puanı. Bu sonuçlar, saniyeler yerine saatler süren işlerde modeli hem Fable 5'in hem de Sol'un üzerine taşıyor.
API fiyatlandırması, bir milyon girdi tokenı başına 3,00 ABD doları ve çıktı tokenı başına 15,00 ABD doları; önbelleğe alınmış girdilerde ise 0,30 ABD dolarına düşüyor. Bu, Claude Sonnet 5 ile aynı ana fiyat. OpenRouter modeli biraz daha ucuza listeliyor. Üzerinde ürün geliştirmeye başlamadan önce okunması gereken bir uyarı var: hiçbir kısıtlama olmaksızın Apache 2.0 lisansıyla yayınlanan Tencent Hunyuan Hy3'ün aksine K3, özel bir Kimi K3 License kapsamında sunuluyor. Açık ağırlıklar ile açık kaynak aynı şey değil; bunu ticari bir ürüne dahil etmeyi planlıyorsanız varsayımda bulunmak yerine şartları okumalısınız.
Aradaki fark, yayın takviminin düşündürdüğünden daha hızlı kapanıyor
Lambert'ın genel eğilime ilişkin değerlendirmesine göre en iyi kapalı modeller ile en iyi açık modeller arasındaki mesafe altı ila dokuz aydan, üç ila beş ay civarına geriledi. Alibaba, açık ağırlıkları daha sonra yayınlanmak üzere 2,4 trilyon parametreli Qwen 3.8'i şimdiden duyurdu; dolayısıyla yarış yavaşlamıyor. Ocak 2025'te DeepSeek R1'ın zekânın maliyetini yeniden belirlediğini yazmıştık. On sekiz ay sonra gördüğümüz örüntü şu: Her sıfırlanma özümseniyor, ardından daha hızlı biçimde tekrarlanıyor.
Oyun geliştiren herkes için pratik sonuç şu: Varlık katmanında zaten olduğu gibi, zekâ katmanı da aynı anda hem ucuzluyor hem de daha taşınabilir hâle geliyor. Kendi kod tabanına göre ince ayar yapılmış bir model isteyen bir stüdyo, eskiden kontrol etmediği bir API'ye bağımlı olmak ile daha zayıf bir yerel model kullanmak arasında seçim yapmak zorundaydı. Bu ödünleşim her çeyrekte biraz daha önemsizleşiyor.
Bu konuda ne yapıyoruz?
Çok sağlayıcılı bir ağ geçidi kullanıyoruz; dolayısıyla bu, soyut değil somut bir karar. K3'ün güçlü yanları tam olarak bizim iş yükümüzle örtüşüyor: uzun soluklu ajan tabanlı kodlama, araç kullanımı ve çalışan bir oyundan gelen ekran görüntüleriyle konsol günlüklerine göre yinelemeler yapma. Modeli, başkalarının yayınladığı tablolar yerine gerçek Game Creator oturumlarında mevcut model seçeneklerimizle kıyaslıyoruz; çünkü önemsediğimiz ölçüt bir Elo puanı değil. Önemli olan, bir turun ne sıklıkla kişinin gerçekten oynayabileceği bir oyunla sonuçlandığı ve modelin kendi hatasını kullanıcı müdahale etmek zorunda kalmadan ne sıklıkla yakaladığı.
Sonuç, hâlihazırda kullandıklarımızdan daha iyi olmadığı yönünde çıksa bile bulgularımızı yayınlayacağız. Bu sürümle ilgili ilginç olan, Çinli bir laboratuvarın çok iyi bir açık model yayınlaması değil; bu artık şaşırtıcı olmaktan çıktı. İlginç olan, bunu kanıtlamak için seçtikleri demonun bir tarayıcı sekmesinde çalışan oyun olması. Yani bizim geliştirmekte olduğumuz şey.
Kaynaklar
- Simon Willison: Kimi K3 ve pelikan kıyaslamasından hâlâ öğrenebileceklerimiz
- Nathan Lambert: Kimi K3, açık ağırlık yarışının tırmanışı
- WebGPU topluluğu: Kimi K3, yapay zekâ tarafından oluşturulan bir 3D oyun demosu için Three.js WebGPU kullanıyor
- OpenRouter: moonshotai/kimi-k3
- explainX: Kimi K3 açık ağırlıkları, 2,8 trilyon parametre ve ilk günden barındırma desteği