Skip to content

Kimi K3 publie ses poids ouverts et choisit un jeu dans le navigateur pour en faire la démonstration

Moonshot AI a lancé Kimi K3 le 16 juillet et publié ses poids onze jours plus tard, le 27 juillet. Le téléchargement représente 96 fragments et environ 1,56 To sur Hugging Face. Nathan Lambert l'a qualifié de « modèle ouvert clairement le plus performant jamais publié », ce que confirment les classements : première place de la Frontend Code Arena, deuxième de l'indice Vals AI et troisième de l'Artificial Analysis Intelligence Index, derrière seulement Claude Fable 5 et GPT-5.6 Sol Max. Parmi les modèles à poids ouverts, il est loin devant.

C'est l'histoire que tout le monde a racontée. Ce qui a retenu notre attention, c'est ce que Moonshot a choisi pour en faire la démonstration.

La démo est un jeu Three.js

À l'occasion de son lancement, K3 a produit un jeu d'exploration 3D procédural qui s'exécute dans un onglet de navigateur : un monde ouvert comprenant de l'eau, des arbres, des cabanes, des montagnes enneigées et des cavaliers, construit avec Three.js sur le moteur de rendu WebGPU et exploitant le calcul GPU. Ce n'est ni une séquence de recherche ni une vidéo de jeu, mais une page que l'on peut charger.

La méthode importe davantage que la scène. D'après l'article de la communauté WebGPU, le modèle a travaillé avec la vision intégrée à la boucle, alternant entre le code qu'il générait et des captures d'écran en direct du résultat en cours d'exécution, afin de voir ce qu'il avait créé et de le corriger. C'est la même boucle que nous utilisons dans le Game Creator de Cinevva, et c'est ce qui distingue un modèle capable d'écrire du code Three.js plausible d'un modèle capable de livrer un jeu dont le rendu fonctionne vraiment. N'importe qui peut générer un graphe de scène. Se rendre compte que la caméra se trouve à l'intérieur du terrain, voilà la partie difficile.

Cette semaine, nous en sommes donc au point où un laboratoire de pointe, pour lancer son modèle le plus performant, a choisi la création de jeux 3D dans le navigateur comme démonstration marquante. Il y a deux ans, la démo phare était un chatbot répondant à une énigme. Désormais, la référence est devenue quelque chose dans lequel on peut se déplacer.

Ce que contient réellement le modèle

K3 est un modèle Mixture-of-Experts doté de 2 800 milliards de paramètres au total, dont 104 milliards actifs par token, d'une fenêtre de contexte de 1 048 576 tokens et d'entrées texte, image et vidéo. Moonshot a introduit deux modifications architecturales, Kimi Delta Attention et Attention Residuals, et annonce une amélioration d'environ 2,5 fois de l'efficacité du passage à l'échelle par rapport à Kimi K2. Il raisonne systématiquement et, alors que le lancement de juillet ne proposait qu'un seul niveau d'effort, « max », la version ouverte permet de choisir entre low, high et max.

Selon les propres chiffres de Moonshot, il surpasse Claude Opus 4.8 au niveau max et GPT-5.5 au niveau high sur la majeure partie de la suite, mais reste derrière Fable 5 et GPT-5.6 Sol. Il faut considérer les benchmarks autodéclarés comme des affirmations plutôt que comme un verdict, mais deux résultats ont été confirmés par des tests indépendants, et tous deux sont pertinents pour la création de logiciels : un score de 91,2 sur BrowseComp pour la navigation agentique et de 42,0 sur SWE Marathon pour la programmation à long horizon. Cela le place devant Fable 5 et Sol pour des tâches qui s'exécutent pendant des heures plutôt que quelques secondes.

Le tarif de l'API est de 3,00 $ par million de tokens en entrée et de 15,00 $ en sortie, avec une baisse à 0,30 $ pour les entrées mises en cache, soit le même tarif affiché que Claude Sonnet 5. OpenRouter le propose à un prix légèrement inférieur. Une réserve mérite votre attention avant de bâtir dessus : contrairement à Hunyuan Hy3 de Tencent, publié sous licence Apache 2.0 sans restrictions, K3 est distribué sous une licence Kimi K3 personnalisée. Les poids ouverts et l'open source ne désignent pas la même chose et, si vous envisagez d'intégrer ce modèle à un produit commercial, mieux vaut lire les conditions que faire des suppositions.

L'écart se réduit plus vite que le rythme des sorties ne le laisse penser

Selon l'analyse de Lambert sur la tendance générale, l'écart entre les meilleurs modèles fermés et les meilleurs modèles ouverts s'est réduit : de six à neuf mois auparavant, il serait désormais plutôt de trois à cinq mois. Alibaba a déjà annoncé Qwen 3.8, doté de 2 400 milliards de paramètres et dont les poids ouverts doivent suivre, ce qui montre que l'escalade ne ralentit pas. En janvier 2025, nous écrivions que DeepSeek R1 avait redéfini le coût de l'intelligence. Dix-huit mois plus tard, chaque bouleversement semble être absorbé, puis reproduit plus rapidement.

Pour les créateurs de jeux, la conséquence pratique est que la couche d'intelligence devient à la fois moins chère et plus portable, alors que la couche des ressources l'est déjà devenue. Jusqu'à présent, un studio souhaitant disposer d'un modèle affiné sur sa propre base de code devait choisir entre une dépendance à une API qu'il ne contrôlait pas et un modèle local moins performant. Ce compromis s'amenuise chaque trimestre.

Ce que nous allons en faire

Nous utilisons une passerelle multi-fournisseurs : il s'agit donc pour nous d'une décision concrète, et non d'une question abstraite. Les points forts de K3 correspondent exactement à notre charge de travail : programmation agentique à long horizon, utilisation d'outils et itérations à partir de captures d'écran et de journaux de console provenant d'un jeu en cours d'exécution. Nous le comparons à notre sélection actuelle de modèles au cours de véritables sessions du Game Creator, plutôt que de nous fier aux tableaux publiés par d'autres, car la mesure qui nous intéresse n'est pas un score Elo. Nous voulons savoir à quelle fréquence un tour se termine par un jeu auquel la personne peut réellement jouer, et à quelle fréquence le modèle repère sa propre erreur avant que l'utilisateur ait besoin d'intervenir.

Nous publierons nos conclusions, y compris si K3 ne surpasse pas ce que nous utilisons déjà. Ce qui est intéressant dans cette sortie, ce n'est pas qu'un laboratoire chinois ait publié un excellent modèle ouvert — cela a cessé d'être surprenant. C'est que la démo choisie pour en faire la preuve était un jeu dans un onglet de navigateur, précisément ce que nous développons depuis le début.

Références