Skip to content

Kimi K3 publica sus pesos abiertos y elige un juego para navegador como demostración

Moonshot AI lanzó Kimi K3 el 16 de julio y publicó sus pesos once días después, el 27 de julio. La descarga consta de 96 fragmentos y ocupa aproximadamente 1,56 TB en Hugging Face. Nathan Lambert lo calificó como «claramente el modelo abierto más potente jamás publicado», y las clasificaciones lo respaldan: primer puesto en Frontend Code Arena, segundo en Vals AI Index y tercero en Artificial Analysis Intelligence Index, solo por detrás de Claude Fable 5 y GPT-5.6 Sol Max. Entre los modelos de pesos abiertos, no hay competencia.

Esa es la historia que contó todo el mundo. Lo que nos llamó la atención fue lo que Moonshot decidió usar para mostrar sus capacidades.

La demo es un juego en Three.js

Junto con el lanzamiento, K3 creó un juego procedimental de exploración 3D que se ejecuta en una pestaña del navegador: un mundo abierto con agua, árboles, cabañas, montañas nevadas y jinetes a caballo, desarrollado en Three.js sobre el renderizador WebGPU y con computación en la GPU. No es un clip de investigación ni un vídeo de un juego. Es una página que puedes abrir.

El método importa más que la escena. Según el artículo de la comunidad de WebGPU, el modelo trabajó con visión dentro del bucle, alternando entre el código que generaba y capturas de pantalla en vivo del resultado en ejecución para poder ver lo que había creado y corregirlo. Es el mismo bucle que utilizamos dentro del Creador de juegos de Cinevva, y es lo que diferencia a un modelo que escribe Three.js aparentemente correcto de otro que entrega un juego que realmente se renderiza. Cualquiera puede generar un grafo de escena. Lo difícil es darse cuenta de que la cámara está dentro del terreno.

Así que, a fecha de esta semana, un laboratorio de vanguardia lanzó su modelo más capaz y recurrió a la creación de juegos 3D para navegador como la demostración destinada a causar impacto. Hace dos años, la demo estrella era un chatbot que respondía a un acertijo. Ahora el listón está en algo por lo que puedes moverte.

Qué contiene realmente el modelo

K3 es un modelo Mixture-of-Experts con 2,8 billones de parámetros totales y 104.000 millones activos por token, una ventana de contexto de 1.048.576 tokens y entrada de texto, imágenes y vídeo. Moonshot introdujo dos cambios de arquitectura, Kimi Delta Attention y Attention Residuals, y afirma haber logrado una mejora aproximada de 2,5 veces en la eficiencia de escalado respecto a Kimi K2. El modelo siempre razona y, mientras que el lanzamiento de julio incluía un único nivel de esfuerzo «max», la versión abierta ofrece low, high y max.

Según las propias cifras de Moonshot, con el nivel max supera a Claude Opus 4.8 y con high a GPT-5.5 en la mayor parte de las pruebas, aunque queda por detrás de Fable 5 y GPT-5.6 Sol. Los benchmarks proporcionados por la propia empresa deben considerarse una afirmación, no un veredicto, pero dos resultados se mantuvieron en pruebas independientes, y ambos son del tipo que importa al crear software: 91,2 en BrowseComp para navegación agéntica y 42,0 en SWE Marathon para programación de largo alcance, lo que lo sitúa por encima tanto de Fable 5 como de Sol en tareas que se prolongan durante horas en lugar de segundos.

El precio de la API es de 3,00 $ por millón de tokens de entrada y 15,00 $ por los de salida, y baja a 0,30 $ para la entrada almacenada en caché, la misma tarifa principal que Claude Sonnet 5. OpenRouter lo ofrece a un precio ligeramente inferior. Hay una salvedad que conviene revisar antes de desarrollar sobre él: a diferencia de Hunyuan Hy3 de Tencent, publicado bajo Apache 2.0 sin restricciones, K3 se distribuye bajo una licencia personalizada, la Kimi K3 License. Los pesos abiertos y el código abierto no son lo mismo, y si piensas incorporarlo a un producto comercial, deberías leer los términos en lugar de dar nada por sentado.

La brecha se está cerrando más rápido de lo que sugiere el ritmo de lanzamientos

La interpretación de Lambert sobre la tendencia general es que la distancia entre los mejores modelos cerrados y los mejores modelos abiertos se ha reducido de entre seis y nueve meses a algo más parecido a entre tres y cinco. Alibaba ya ha anunciado Qwen 3.8, con 2,4 billones de parámetros y pesos abiertos que se publicarán próximamente, así que la escalada no se está frenando. En enero de 2025 escribimos que DeepSeek R1 redefinió el coste de la inteligencia. Dieciocho meses después, el patrón es que cada cambio se asimila y luego se repite con mayor rapidez.

Para cualquiera que cree juegos, la consecuencia práctica es que la capa de inteligencia sigue abaratándose y haciéndose más portátil al mismo tiempo que la capa de recursos ya lo hizo. Antes, un estudio que quisiera un modelo ajustado con su propio código tenía que elegir entre depender de una API que no controlaba y utilizar un modelo local más débil. Esa disyuntiva se reduce cada trimestre.

Qué estamos haciendo al respecto

Operamos una pasarela multiproveedor, así que para nosotros esta es una decisión concreta y no una cuestión abstracta. Los puntos fuertes de K3 coinciden exactamente con nuestra carga de trabajo: programación agéntica de largo alcance, uso de herramientas e iteración a partir de capturas de pantalla y registros de consola de un juego en ejecución. Lo estamos evaluando frente a nuestra selección actual de modelos en sesiones reales del Creador de juegos, en lugar de basarnos en las tablas publicadas por terceros, porque la métrica que nos importa no es una puntuación Elo. Es la frecuencia con la que un turno termina en un juego al que la persona realmente puede jugar y la frecuencia con la que el modelo detecta su propio error antes de que tenga que hacerlo el usuario.

Publicaremos lo que descubramos, incluso si la conclusión es que no supera lo que ya utilizamos. Lo interesante de este lanzamiento no es que un laboratorio chino haya publicado un modelo abierto muy bueno, algo que ya ha dejado de sorprender. Es que la demo elegida para demostrarlo fuera un juego en una pestaña del navegador, precisamente aquello que llevamos tiempo creando.

Referencias