Skip to content

Mejores modelos generativos de IA de código abierto para juegos (2026)

Última actualización: julio de 2026.

Esto es lo que ocurre con la IA generativa. Durante años, los mejores modelos estuvieron tras claves de API y precios impredecibles. Construías tu flujo de trabajo en torno a una herramienta, te acostumbrabas a ella y, de pronto, recibías un correo diciendo que los precios habían cambiado. O peor aún, que la empresa había cambiado por completo de rumbo.

Eso cambió a finales de 2024. Tencent, Alibaba y DeepSeek empezaron a publicar modelos que realmente puedes descargar. Modelos que rivalizan con las alternativas cerradas. Y, de repente, los creadores tienen opciones que no dependen del modelo de negocio de otra empresa.

¿Y si pudieras generar vídeos, recursos 3D, música y voces con modelos que tú controlas? Ese es el punto en el que estamos. Esta guía repasa qué existe de verdad, qué funciona y qué puedes empezar a usar hoy mismo.

Generación de vídeo

Durante años, generar vídeo significaba usar Runway o Pika: plataformas cerradas, cuotas de suscripción y límites sobre lo que podías hacer con el resultado. ¿Ahora? Puedes ejecutar modelos comparables en tu propio hardware.

Generación de texto a vídeo con HunyuanVideo, salida a 720p del principal modelo de vídeo de código abierto

ModeloOrganizaciónParámetrosEspecificacionesHardwareCoste
HunyuanVideoTencent13B720p, texto+imagen80GB~$0.20
HunyuanVideo-1.5Tencent8.3B480p-1080p, texto+imagen14GB~$0.05
Mochi 1Genmo10B480p@30fps12GB+~$0.10
LTX-VideoLightricks768x512, tiempo real12GB~$0.02
LTX-2Lightricks19B4K, audio sincronizadoGama alta~$0.30
Wan 2.1Alibaba1.3-14B480p-720p8GB+~$0.03
Wan 2.2Alibaba27B MoE (14B activos)720p, MoE8GB+~$0.03
CogVideoX1.5-5BTsinghua5B1360x768@16fps, hasta 10s12GB~$0.04
SkyReels-V3Skywork14-19BGuiado por audio, referencia a vídeo, V2VGama alta~$0.10
Step-Video-T2VStepFun30BMayor T2V abierto, 204 fotogramasGama alta~$0.15
Open-Sora 2.0HPC-AI11BIntegración con FluxGama alta~$0.20

Pesos: HunyuanVideo ↗ · Mochi 1 ↗ · Wan 2.1 ↗ · Open-Sora ↗

Ver muestras: Galería de HunyuanVideo ↗ · Ejemplos de Mochi ↗ · Muestras de CogVideoX ↗

Qué significa esto para los creadores

HunyuanVideo supera a Runway Gen-3 en evaluaciones profesionales y es completamente abierto. ¿El inconveniente? Necesitas hardware potente. Una A100 o H100 con 80GB de VRAM. Para la mayoría de nosotros, eso significa alquilar GPU en la nube cuando las necesitemos.

HunyuanVideo-1.5 cambió por completo los requisitos de hardware. Tencent lo publicó en noviembre de 2025 como un modelo abierto de 8.3B parámetros que funciona en una GPU de consumo con 14GB, con generación de texto a vídeo e imagen a vídeo a 480p/720p y reescalado opcional a 1080p. Un nuevo mecanismo de atención selectiva y por mosaicos deslizantes (Selective and Sliding Tile Attention, SSTA) le proporciona aproximadamente el doble de velocidad de inferencia que el HunyuanVideo original. Si querías la calidad de HunyuanVideo pero no podías justificar una tarjeta de 80GB, esta es la versión que realmente puedes ejecutar en casa.

Mochi 1 es el que de verdad puedes ejecutar. Una GPU de 12GB —el terreno de una RTX 3060— lo maneja sin problemas. El resultado es genuinamente creativo y tiene una cualidad artística distintiva. No alcanza del todo la fidelidad de HunyuanVideo, pero tú controlas el proceso.

LTX-2 es donde la cosa se pone interesante para los juegos. Es el primer modelo abierto que genera audio sincronizado con el vídeo. Imagina cinemáticas en las que el sonido simplemente... encaja. Sin sincronización en posproducción. Lightricks publicó como código abierto los pesos completos y el código de inferencia y entrenamiento en enero de 2026, con salida 4K nativa de hasta 50fps y audio sincronizado de hasta 20 segundos. Una salvedad sobre la licencia: los pesos abiertos de LTX-2 son gratuitos para uso académico y para uso comercial únicamente por parte de empresas con ingresos anuales inferiores a $10M, así que comprueba ese umbral antes de montar un negocio sobre él.

SkyReels-V3 (Skywork, enero de 2026) es la nueva línea abierta más destacada. Es un modelo multimodal unificado que permite generar vídeo guiado por audio, de referencia a vídeo y de vídeo a vídeo en variantes de 14B y 19B, por lo que resulta muy eficaz cuando necesitas que un personaje o una imagen de referencia guíen la toma. Step-Video-T2V (StepFun) es el mayor modelo abierto de texto a vídeo, con 30B, y se distribuye bajo una licencia MIT clara; conviene conocerlo si una licencia permisiva te importa más que poder ejecutarlo en una GPU pequeña.

Wan 2.1 funciona en un portátil gaming. Una GPU de 8GB basta para las variantes más pequeñas. Si alguna vez has querido crear prototipos con generación de vídeo, pero no podías justificar el hardware, esta es tu puerta de entrada.

Wan 2.2 (Alibaba, julio de 2025) es el primer modelo de vídeo de código abierto basado en un diseño de mezcla de expertos: 27B parámetros totales, con solo 14B activos en cada paso. Se distribuye en versiones de texto a vídeo (T2V-A14B), imagen a vídeo (I2V-A14B) y una variante híbrida de 5B que funciona en GPU de consumo, todas bajo Apache 2.0 para uso comercial.

Hay una salvedad que conviene conocer: Wan 2.2 sigue siendo la última versión abierta de Wan. Las versiones más recientes, Wan 2.5 (septiembre de 2025), 2.6 (diciembre de 2025) y 2.7 (abril de 2026), añadieron audio sincronizado, 1080p y un control más preciso de los fotogramas, pero solo están disponibles mediante API y no tienen pesos públicos. Si el autoalojamiento es importante para ti, 2.2 es el límite. LTX-2 es el modelo abierto al que recurrir cuando necesitas 4K y audio sincronizado.

El flujo de trabajo más lógico: Mochi 1 o Wan 2.1 para crear prototipos localmente. HunyuanVideo-1.5 o LTX-2 en GPU en la nube cuando necesites la calidad final.

Generación de imágenes

Aquí es donde el código abierto ya ha ganado. Los modelos que puedes descargar hoy compiten de verdad con Midjourney. No son «casi igual de buenos», son realmente competitivos.

Muestras de generación de FLUX.1Muestras de FLUX.1, calidad fotorrealista de un modelo con licencia Apache 2.0

ModeloOrganizaciónPublicaciónParámetrosCaracterística claveLicenciaCoste/imagen
FLUX.1 [schnell]Black Forest LabsAgo. 202412BGeneración en 4 pasos, rápidoApache 2.0~$0.001
FLUX.1 [dev]Black Forest LabsAgo. 202412BCalidad cercana a ProNo comercial~$0.002
SD 3.5 LargeStability AIOct. 20248BRenderizado de texto, estilos diversosLicencia de Stability~$0.002
SD 3.5 Large TurboStability AIOct. 20248B4 pasos, rápidoLicencia de Stability~$0.001
HiDream-I1HiDream.aiAbr. 202517BAlta calidad, variantes Full/Dev/FastMIT~$0.002
CogView4Tsinghua / ZhipuMar. 20256BTexto nativo en chino, hasta 2048pxApache 2.0~$0.002
Qwen-ImageAlibabaAgo. 202520BRenderizado y edición de texto de primera categoríaApache 2.0~$0.002
FLUX.2Black Forest LabsNov. 202532BTexto+edición, 4MP, múltiples referenciasdev: No comercial / klein 4B: Apache 2.0~$0.003
Ideogram 4.0IdeogramJun. 20269.3BDiseño, renderizado de texto, control de composición mediante JSONNo comercial~$0.002

Pruébalos directamente: Demo de FLUX.1 schnell ↗ · Demo de SD 3.5 Large ↗ · GitHub (FLUX) ↗

Ver muestras: Galería de FLUX ↗ · Galería de LoRA para FLUX ↗ · Ejemplos de Replicate ↗

Para crear recursos de juegos

FLUX.1 [schnell] es el que debes conocer. Tiene licencia Apache 2.0, lo que significa que puedes publicar juegos comerciales sin preocuparte por problemas de licencias. Genera en solo 4 pasos, por lo que puedes iterar rápidamente. Describe lo que quieres, mira el resultado, ajusta y repite.

SD 3.5 Large por fin renderiza texto correctamente. Las versiones anteriores destrozaban cualquier texto que intentaras incluir. Esto es importante para prototipos de interfaces, carteles dentro del juego, pantallas de título y cualquier lugar donde necesites palabras legibles en tus imágenes.

FLUX.2 (Black Forest Labs, noviembre de 2025) es el sucesor de mayor tamaño: un modelo de 32B que permite generar imágenes a partir de texto y editar imágenes con un único checkpoint, con una gran consistencia de personajes y estilos a partir de múltiples referencias, además de un renderizado de texto fiable de hasta 4 megapíxeles. FLUX.2 [dev], con pesos abiertos, utiliza una licencia no comercial, pero FLUX.2 [klein], una versión destilada de menor tamaño (enero de 2026), distribuye su variante de 4B bajo Apache 2.0, genera en menos de un segundo y funciona con unos 8GB de VRAM, así que sigue habiendo una opción apta para uso comercial con la que publicar arte para juegos. Descarga específicamente klein 4B: la versión klein 9B, de mayor tamaño, mantiene la licencia no comercial de FLUX. Las canalizaciones cuantizadas permiten ejecutar [dev] en GPU de 18-24GB.

Hay otras dos opciones abiertas que conviene conocer. Chroma1-HD (8.9B, Apache 2.0) es un derivado totalmente abierto de FLUX.1-schnell, por lo que es la forma segura para uso comercial de obtener la calidad de la familia FLUX sin la licencia de [dev]. OmniGen2 (Apache 2.0) es un modelo unificado que reúne la generación de texto a imagen y la edición basada en instrucciones, lo que lo convierte en la vía más rápida cuando estás iterando sobre un recurso existente («haz que la espada brille en azul») en lugar de generarlo desde cero.

Qwen-Image (Alibaba, agosto de 2025) es el modelo abierto al que recurrir cuando tu arte necesita texto legible, como carteles, interfaces, pósteres o etiquetas de objetos. Es un modelo de 20B con licencia Apache 2.0, renderizado de texto de primera categoría y una potente variante de edición basada en instrucciones, así que es apto para uso comercial y excepcionalmente bueno en algo con lo que la mayoría de los modelos de imagen aún tropiezan. La actualización de diciembre de 2025, Qwen-Image-2512, mejoró el realismo de las personas y la composición del texto, y mantuvo la licencia Apache 2.0, así que descarga ese checkpoint si vas a alojarlo tú mismo. El Qwen-Image-2.0 más reciente (febrero de 2026) solo está disponible mediante API.

Ideogram 4.0 (junio de 2026) es la primera versión de Ideogram con pesos abiertos: un transformer de difusión de 9.3B creado para trabajos de diseño, con un excelente renderizado de texto multilingüe y control explícito de la composición y el color mediante prompts JSON estructurados. Hay un inconveniente que debes conocer antes de basarte en él: el código de inferencia es Apache 2.0, pero los pesos tienen una licencia no comercial, por lo que es una herramienta de investigación y creación de prototipos a menos que compres la licencia comercial.

El ecosistema de Stable Diffusion sigue sin tener rival. ControlNet para lograr composiciones precisas. Inpainting para hacer correcciones. Ajuste fino con LoRA para estilos personalizados. FLUX está recortando distancias, pero si hoy necesitas una personalización profunda, la madurez de las herramientas de SD te ofrece más posibilidades.

Yo lo plantearía así: para texturas y sprites, cualquiera de los dos sirve. Para arte conceptual con requisitos de estilo específicos, SD 3.5 con LoRA. Para obtener la máxima calidad en un lanzamiento comercial, FLUX schnell.

Generación 3D

Si alguna vez has dedicado ocho horas a modelar un objeto que aparece en tu juego durante tres segundos, esta sección es para ti. Hace tiempo que la generación 3D dejó de ser una «investigación interesante» para convertirse en una verdadera herramienta de producción y, en 2026, los modelos abiertos son realmente buenos. Puedes pasar de un boceto a una malla texturizada en menos de un minuto.

Muestras de generación 3D de TRELLISTRELLIS genera a partir de imágenes individuales mallas 3D texturizadas con materiales PBR

ModeloOrganizaciónPublicaciónCaracterística claveResultadoCoste/malla
TRELLIS.2-4BMicrosoftDic. 20254B parámetros, PBR nativo, hasta 1536³Malla texturizada con normales~$0.03
Hunyuan3D 2.1TencentJun. 2025PBR para producción, pesos completos + código de entrenamientoMalla texturizada de alta fidelidad~$0.05
SAM 3DMetaNov. 2025De una sola imagen a 3D (objetos + cuerpo humano)Malla a partir de una foto~$0.02
Stable Fast 3DStability AIAgo. 2024Imagen individual → malla en ~0.5sMalla texturizada rápida~$0.001
TripoSGVAST-AIMar. 2025Generación de formas mediante flujo rectificado de 1.5BMalla de alta calidad~$0.01
TripoSRStability / Tripo2024Reconstrucción rápida a partir de una sola imagenMalla (sin textura)~$0.001
UniRigTsinghua / Tripo2025Rigging automático: esqueleto + pesos de skinningMalla con rig y animable~$0.01
Pruébalos directamente: demo de TRELLIS.2 ↗ · demo de Hunyuan3D ↗ · demo de InstantMesh ↗

Ver ejemplos: página del proyecto TRELLIS.2 ↗ · galería de 3D AI Studio ↗

Un flujo de trabajo que realmente funciona

El enfoque que ahora mismo está funcionando entre los creadores encadena varios modelos. Empieza con una imagen, generada o fotografiada, da igual. Pásala por Stable Zero123 o Wonder3D para obtener varias vistas. Introduce esas vistas en InstantMesh o TripoSR para crear la malla. Después, usa TRELLIS.2 o Hunyuan3D para obtener materiales adecuados.

TRELLIS.2, de Microsoft, es el nuevo líder para crear recursos listos para producción. Maneja la geometría que hace fallar a otros modelos: superficies finas, agujeros y topologías complejas. La versión de 4B parámetros produce mallas con texturas PBR reales, no simples colores de vértices que se hacen pasar por materiales.

Stable Fast 3D se centra en la velocidad. Tarda aproximadamente medio segundo en pasar de una imagen a una malla. La malla necesita retoques y texturizado, pero ¿para crear prototipos? ¿Para averiguar si una idea funciona antes de invertir horas? No tiene rival. TripoSG es el siguiente paso cuando quieres obtener una geometría más limpia a partir de una sola imagen.

Hunyuan3D 2.1 es el modelo abierto de Tencent que debes usar: incluye todos los pesos y el código de entrenamiento, además de texturizado PBR apto para producción. Presta atención a los nombres, porque suelen causar confusión. Hunyuan3D 2.5, 3.0 y 3.1 existen, pero solo están disponibles mediante API y no tienen pesos públicos, así que, para alojarlo por tu cuenta, el generador base sigue limitado a la versión 2.1. Tencent sí publicó dos extensiones útiles basadas en 2.1: Hunyuan3D-Omni añade control mediante múltiples condiciones (nube de puntos, vóxel, esqueleto y caja delimitadora), mientras que Hunyuan3D-Part descompone una malla en partes editables. Su licencia también excluye la UE, el Reino Unido y Corea del Sur, así que revisa las condiciones antes de publicar en esas regiones.

SAM 3D (Meta, noviembre de 2025) es la vía de entrada más reciente: convierte una sola foto en una malla 3D mediante modelos distintos para objetos y cuerpos humanos. Combinado con el trabajo de Meta sobre segmentación, permite aislar un objeto de una imagen y reconstruir únicamente ese objeto.

UniRig (Tsinghua y Tripo, MIT) cubre la carencia con la que todo el mundo se encuentra justo después de obtener una malla: el rigging. Genera automáticamente un esqueleto válido y los pesos de skinning de una malla de entrada, de modo que un personaje generado pueda animarse de verdad en lugar de quedarse como un elemento estático. Si lo combinas con el trabajo de animación automática de SOMA-X, de NVIDIA, un personaje completamente generado y equipado con rig deja de ser una simple demostración de investigación.

Esta es una expectativa realista para los creadores independientes: genera arte conceptual con FLUX, pásalo por InstantMesh para obtener la geometría y después texturízalo en Blender o utiliza TRELLIS para automatizar el PBR. Estaríamos hablando de entre 30 y 60 minutos por recurso en lugar de entre 4 y 8 horas. No es instantáneo, pero sí supone una diferencia real.

Audio y música

La generación de audio todavía no ha alcanzado el nivel de las imágenes y el vídeo. Pero ya hay suficiente para cambiar tu forma de trabajar, especialmente al crear prototipos y efectos de sonido.

Muestra de música generada por IA. Describe el ambiente que buscas y obtén música que encaje

ModeloOrganizaciónLanzamientoQué haceLicenciaCoste/30 s
ACE-Step 1.5StepFun/ACE Studioene. 2026Genera rápidamente ~4 min de música, 19 idiomas y clonación de vozMIT~$0.02
Stable Audio 3.0Stability AImay. 2026Canciones de hasta ~6 min; modelos abiertos Small, Small-SFX y MediumStability Community~$0.02
YuEMAPene. 2025Canciones completas a partir de letras, voces + acompañamientoApache 2.0~$0.05
MusicGenMeta2023Música a partir de texto, controlablecódigo MIT / pesos CC-BY-NC~$0.01
DiffRhythm 2ASLP-labfeb. 2026Generación rápida de canciones completasApache 2.0~$0.02
Magenta RealTimeGooglejun. 2025Música en tiempo real controlable mediante indicacionescódigo Apache / pesos CC-BY~$0.02

Pruébalos directamente: demo de MusicGen ↗ · entorno de pruebas de AudioCraft ↗

Ver ejemplos: ejemplos de MusicGen ↗ · muestras de AudioGen ↗

Lo que realmente puedes publicar

MusicGen, de Meta, sigue siendo una opción práctica para crear prototipos de audio para juegos. Describe el ambiente que buscas, obtén música que encaje y ejecútalo sin problemas en una GPU con 12 GB. Hay un detalle importante sobre la licencia: el código de MusicGen es MIT, pero los pesos del modelo son CC-BY-NC (uso no comercial), así que úsalo para crear prototipos y cambia a un modelo con licencia comercial, como ACE-Step o Stable Audio, para cualquier cosa que vayas a publicar.

El modelo abierto de efectos de sonido de Stable Audio (Small-SFX) se ocupa de pasos, crujidos de puertas, viento ambiental y sonidos mecánicos, se ejecuta localmente y se distribuye bajo la licencia comunitaria de Stability. Por tanto, es la opción abierta para efectos de sonido cuando necesitas sonidos que puedas utilizar comercialmente. Es la mejor elección porque los demás modelos abiertos de efectos de sonido imponen condiciones: AudioGen, de Meta, tiene licencia CC-BY-NC y TangoFlux utiliza la licencia comunitaria no comercial de Stability, así que ambos solo sirven para crear prototipos de un juego que vayas a publicar.

Magenta RealTime (Google) destaca de la mejor manera posible: es el único modelo con pesos abiertos diseñado para generar música en tiempo real que puede controlarse continuamente mediante indicaciones. En lugar de renderizar una pista terminada, genera música en directo que puedes dirigir mientras suena, justo el formato que necesita una banda sonora adaptativa para juegos que cambie según lo que haga el jugador. El código utiliza Apache 2.0 y los pesos, CC-BY; ambos permiten el uso comercial.

YuE es realmente emocionante. Es el primer modelo abierto que genera canciones completas con voces. Temas musicales. Música de fondo con voces reales. La calidad varía, pero está a años luz de cualquier otra cosa que puedas descargar y ejecutar por tu cuenta.

ACE-Step es el modelo musical abierto que debes conocer ahora, y ha evolucionado rápidamente: la línea 1.5 (enero de 2026, con una variante XL de 5B más grande) sustituye al lanzamiento original de mayo de 2025 y ahora utiliza una licencia MIT. Genera rápidamente varios minutos de música, admite 19 idiomas y ofrece clonación de voz, remezclas y edición de letras. Para crear prototipos de juegos, cubre gran parte de las carencias que dejaron YuE y MusicGen.

Stable Audio 3.0 (mayo de 2026) es la actualización más importante para el sonido. Puede generar canciones de hasta unos seis minutos, y Stability publicó los pesos de tres de sus cuatro variantes: Small y el modelo específico para efectos de sonido Small-SFX se ejecutan en el dispositivo, mientras que Medium ofrece una mejor estructura musical y la duración completa de las pistas. Solo el modelo Large quedó limitado a la API. Small-SFX es ahora la opción abierta más potente específicamente para efectos de sonido de juegos. Toda la familia se entrenó con datos bajo licencia, así que su base jurídica es más sólida que la de los generadores musicales con litigios todavía sin resolver.

Esta es la valoración sincera: la diferencia entre los modelos abiertos y los cerrados (Suno, Udio) se está reduciendo, pero sigue siendo real en el caso de las canciones completas con voces; además, esas herramientas cerradas también afrontan litigios sin resolver por sus datos de entrenamiento. Para los efectos de sonido, los modelos abiertos —especialmente el modelo SFX de Stable Audio— son realmente competitivos. Si quieres publicar canciones, prepárate para iterar mucho o contrata a un músico para la producción final y utiliza estas herramientas para todo lo demás.

Habla y voz

La generación de voz ya ha superado con creces el nivel de «suficientemente buena para juegos», y eso cambia lo que pueden hacer los equipos pequeños.

Narración para juegos generada por IA, con habla natural, ritmo adecuado y emoción

ModeloOrganizaciónLanzamientoCaracterística principalLicenciaCoste/min
Qwen3-TTSAlibabaene. 2026Clonación de voz con 3 s, diseño de voces, 10 idiomasApache 2.0~$0.002
ChatterboxResemble AI2025Control emocional, clonación con ~5 s, 23 idiomasMIT~$0.003
CSMSesame AImar. 2025Fluidez conversacional, pausas naturalesApache 2.0~$0.005
Fish Speech 1.5Fish Audio2024Clonación sin entrenamiento previo a partir de 10-30 scódigo Apache / pesos CC-BY-NC-SA~$0.002
OpenVoice V2MyShell/MITabr. 2024Control de emociones y acentosMIT~$0.003
XTTS-v2Coqui (comunidad)202417 idiomas, clonación de vozCPML (uso no comercial)~$0.005

Escuchar muestras: voces de Fish Audio ↗ · demo de OpenVoice ↗

Cómo hacer que los PNJ suenen como personas

CSM (Conversational Speech Model), de Sesame, se diseñó específicamente para los diálogos. Produce pausas naturales. Cambios de entonación. El ritmo de una conversación real. La mayoría de los sistemas TTS suenan como alguien que lee un guion, y se nota al instante. CSM suena como alguien hablando. Esa diferencia importa más de lo que crees.

Qwen3-TTS (Alibaba, enero de 2026) es la opción que debes elegir para proyectos comerciales. Toda la familia utiliza Apache 2.0, clona una voz a partir de unos 3 segundos de audio de referencia, habla 10 idiomas y permite diseñar voces mediante descripciones, por lo que puedes especificar la voz de un PNJ con texto sencillo en lugar de buscar grabaciones de referencia. Los modelos 0.6B y 1.7B funcionan en hardware modesto.

Chatterbox (Resemble AI) es la opción ideal para voces expresivas y utiliza una licencia MIT, por lo que puedes incluirlo en un producto publicado. Clona una voz a partir de unos 5 segundos, funciona con una latencia inferior a 200 ms, abarca 23 idiomas y es el primer modelo abierto con un control para exagerar las emociones, de modo que un PNJ puede sonar realmente enfadado o asustado en lugar de inexpresivo. Otras dos opciones con Apache 2.0 cubren necesidades específicas: Orpheus (Canopy) admite etiquetas emocionales en línea como <laugh> y <sigh>, que se adaptan perfectamente a las frases breves de los PNJ, y ofrece una variante de 150M para hardware de gama baja; Dia (Nari Labs), por su parte, está diseñado para diálogos con varios hablantes e incluye elementos no verbales como toses y risas en una sola pasada.

Fish Speech y OpenVoice se ocupan de la clonación de voz. Graba entre 10 y 30 segundos de un actor de voz y genera después una cantidad ilimitada de diálogos con esa voz. Piensa en lo que esto implica: puedes contratar a profesionales de voz para las frases clave y después ampliar su interpretación para abarcar cientos de variaciones y diálogos ambientales. Una observación sobre la licencia de Fish Speech: el código es abierto, pero los pesos de la versión 1.5 utilizan CC-BY-NC-SA, así que es una herramienta para crear prototipos. Para juegos publicados, utiliza en su lugar OpenVoice (MIT) o Qwen3-TTS (Apache 2.0).

NVIDIA ACE (no es completamente abierto, pero conviene conocerlo) ahora admite Qwen3-8B para desplegar PNJ directamente en el dispositivo. LLM local + TTS local + sincronización labial, todo ejecutándose en GPU de consumo. Este es el conjunto de herramientas para mantener conversaciones en tiempo real con PNJ sin necesidad de hacer llamadas a la nube.

El enfoque más sensato para los creadores independientes consiste en contratar actores de voz para los personajes principales y las frases más importantes. Utiliza Qwen3-TTS u OpenVoice para ampliar la cobertura de los diálogos ambientales, las variaciones y todas las frases incidentales que, de otro modo, quedarían sin voz o resultarían prohibitivamente caras.

Modelos de mundos y simulación de juegos

Aquí es donde las cosas se vuelven realmente extrañas y realmente emocionantes. Estos modelos no generan recursos estáticos. Generan experiencias que parecen juegos.

🎮 Juega a Oasis: Minecraft generado por IA
Generación de mundos en tiempo real sin motor de juego, solo predicción mediante IA
ModeloOrganizaciónLanzamientoQué haceEstadoCoste/fotograma
DIAMONDInvestigación2024Modelo de mundo por difusión, simulación de AtariPesos abiertos~$0.001
OasisDecart/Etchedoct. 2024Generación de Minecraft en tiempo realPesos del modelo 500M abiertos~$0.002
MineWorldMicrosoftabr. 2025Minecraft en tiempo real, alternativa abierta a OasisMIT~$0.002
Hunyuan-GameCraftTencentago. 2025Vídeo de juegos interactivo, control mediante teclado y ratónTencent Community~$0.005
GameGen-XInvestigación2024Generación de vídeo de mundos abiertosCódigo + conjunto de datos abiertos~$0.005
NVIDIA CosmosNVIDIAoct. 2025Simulación de IA física (Predict2.5)NVIDIA Open Model License~$0.01
Matrix-Game 3.0Skyworkmar. 2026Mundos interactivos a 720p en tiempo real, memoria a largo plazoPesos abiertos~$0.005
Genie 2DeepMinddic. 2024Entornos 3D interactivos a partir de imágenesNo publicadoN/D
Genie 3DeepMindago. 2025Mundos a 720p en tiempo real, eventos controlables mediante indicacionesCerrado (Project Genie)N/D

Consulta la investigación: página del proyecto DIAMOND ↗ · blog de Cosmos ↗Pruébalo: Demostración en vivo de Oasis ↗ · Ejemplos de Genie 2 ↗

Por qué debería importarte

DIAMOND demostró algo que cambia la forma de pensar sobre la IA para videojuegos. Puedes entrenar un agente íntegramente dentro de un mundo generado. No hace falta un motor de juego real para el entrenamiento. La IA juega en la imaginación de un modelo de difusión y luego transfiere lo aprendido al juego real. Las implicaciones son importantes.

Oasis ejecuta en tiempo real un mundo similar a Minecraft. Fotograma a fotograma. Sin motor de juego, texturas ni recursos preconstruidos. Solo un transformer que predice qué viene después. Es una prueba de concepto, pero imagina hasta dónde puede llegar. La versión de 500 millones de parámetros ya es abierta.

GameGen-X publicó el mayor conjunto de datos de vídeo de juegos de mundo abierto. Si quieres entrenar tus propios modelos o ajustar modelos existentes para generar contenido similar al de un videojuego, este es tu punto de partida.

NVIDIA Cosmos se creó para robótica y vehículos autónomos, pero sus modelos fundacionales del mundo también sirven para videojuegos. Entienden la física, la permanencia de los objetos y las relaciones espaciales. La línea abierta actual es Cosmos-Predict2.5, publicada en octubre de 2025 bajo la NVIDIA Open Model License, que permite el uso comercial y las obras derivadas.

Hunyuan-GameCraft (Tencent, agosto de 2025) es el modelo abierto de mundo más directamente orientado a videojuegos. Se entrenó con más de un millón de grabaciones procedentes de más de 100 juegos AAA y unifica las entradas de teclado y ratón en un espacio de control compartido, por lo que genera vídeo interactivo de videojuegos que realmente controlas, en lugar de limitarte a verlo. Usa la misma Tencent Community License que Hunyuan3D, con la misma exclusión de la UE, el Reino Unido y Corea del Sur, así que revisa las condiciones antes de distribuirlo allí. MineWorld (Microsoft, MIT) es la alternativa completamente permisiva a Oasis: un modelo de mundo de Minecraft en tiempo real que puedes descargar y ejecutar sin motor de juego.

Genie 3 (DeepMind, anunciado en agosto de 2025) es el salto que merece atención: el primer modelo de mundo con interacción en tiempo real, capaz de generar mundos navegables a 720p y 24 fps que mantienen la coherencia durante unos minutos, además de «eventos de mundo controlables mediante prompts» que cambian el clima o añaden objetos cuando se lo pides. Se abrió al público como Project Genie en enero de 2026 para los suscriptores de Google AI Ultra en Estados Unidos. Sus pesos siguen siendo cerrados, pero muestra hacia dónde se dirigen los mundos generados y jugables.

Matrix-Game 3.0 (Skywork, marzo de 2026) es la respuesta abierta a Genie. Es un modelo interactivo de mundo con memoria aumentada que transmite a 720p y 40 fps en tiempo real y mantiene la coherencia de las escenas durante secuencias de un minuto. Una versión destilada de 5B permite inferencia en tiempo real, una versión MoE mayor de 2x14B mejora la calidad y los pesos están en Hugging Face bajo Apache 2.0. Si quieres experimentar hoy con mundos generados jugables en lugar de esperar a DeepMind, este es el que realmente puedes descargar.

Para el desarrollo práctico de videojuegos actual, siguen siendo herramientas de investigación. Pero si trabajas con contenido impulsado por IA, generación procedimental o simplemente estás pensando hacia dónde se dirige todo esto, esta es la frontera.

Modelos de lenguaje grandes

Los LLM impulsan el diálogo, la generación de misiones y la lógica de los juegos. Y las opciones abiertas ya compiten de verdad con GPT-4. Esto no era así hace dos años.

ModeloOrganizaciónPublicaciónTamañoIdeal paraLicenciaCoste/1K tokens
DeepSeek-V3DeepSeekDic. 2024MoE de 671B (37B activos)Razonamiento, uso generalPermisiva~$0.02
DeepSeek-R1DeepSeekEne. 2025Basado en V3Cadena de pensamientoPermisiva~$0.03
DeepSeek-V3.2DeepSeekDic. 2025Atención dispersa (DSA)Razonamiento + uso de herramientasMIT~$0.02
DeepSeek-V4DeepSeekAbr. 2026MoE de 1.6T (49B activos)Razonamiento de vanguardia, contexto de 1MMIT~$0.02
GLM-5Zhipu / Z.aiFeb. 2026MoE de 744B (40B activos)Programación, agentes, uso de herramientasMIT~$0.02
GPT-OSSOpenAIAgo. 2025MoE de 120B / 20BRazonamiento, uso de herramientas, ejecución en el dispositivoApache 2.0~$0.01
Kimi K2Moonshot2025MoE de 1T (32B activos)Agentes, programaciónMIT modificada~$0.02
Kimi K3MoonshotJul. 2026MoE de 2.8T (~50B activos)Agentes de vanguardia, programación, contexto de 1M, visiónPesos abiertos (27 de julio)~$0.03
Gemma 3Google20251B-27BEjecución en el dispositivo, 140 idiomas, visiónGemma~$0.01
Qwen3Alibaba2025MoE de 235B (22B activos)Multilingüe, códigoApache 2.0~$0.01
Qwen3-CoderAlibaba2025MoE de 480B (35B activos)Programación con agentes, contexto de 256KApache 2.0~$0.02
Llama 4Meta2025VariosAgentes, contexto de hasta 10MLlama Community~$0.01
Qwen3-VLAlibaba20252B-235BVisión + lenguajeApache 2.0~$0.02
InternVL3Shanghai AI Lab20251B-78BVisión, OCR, localización de elementos de interfazMIT~$0.02

Primeros pasos: Qwen3-8B en HuggingFace ↗ · DeepSeek-V3 en HuggingFace ↗ · GLM-5 en HuggingFace ↗

Para crear videojuegos

Qwen3 es la opción práctica para la mayoría de usos en videojuegos. Su licencia Apache 2.0 significa que tu integración te pertenece. Ofrece un sólido soporte multilingüe, algo importante si estás pensando en la localización. Sigue bien las instrucciones estructuradas. Las variantes 7B y 14B se ejecutan localmente en GPU de consumo.

DeepSeek-V3 iguala o supera a GPT-4 en la mayoría de las pruebas comparativas. Su arquitectura es ingeniosa: solo se activan 37B parámetros por token, a pesar de tener 671B en total. Necesitas hardware potente —varias GPU—, pero obtienes calidad de vanguardia sin depender de una API.

DeepSeek-V3.2 (diciembre de 2025) combina el razonamiento y el uso de herramientas en un solo modelo e introduce DeepSeek Sparse Attention (DSA) para reducir el coste de la inferencia con contextos largos, con una variante Speciale de alto cómputo orientada a las pruebas comparativas de razonamiento más exigentes. Para la lógica y los diálogos de un videojuego, sustituye directamente a V3 con mejores capacidades y mayor aptitud para funcionar como agente.

DeepSeek-V4 (abril de 2026) volvió a ampliar la frontera abierta. V4-Pro es un MoE de 1.6T parámetros con solo 49B activos por token, una ventana de contexto de un millón de tokens y modos de razonamiento seleccionables, todo bajo licencia MIT. La variante V4-Flash (284B en total, 13B activos) conserva el contexto de 1M en un paquete que no exige un clúster completo de GPU. Si hoy eliges un modelo abierto para una lógica de misiones compleja o un contexto extenso del estado del juego, este es el techo actual.

GLM-5 (Zhipu AI, febrero de 2026) es el modelo abierto de referencia para programación y tareas con agentes, y la actualización GLM-5.2 elevó sus resultados en uso de herramientas y planificación a largo plazo hasta acercarlos a los modelos cerrados de vanguardia. Es un MoE de 744B parámetros con 40B activos por token, un contexto de 200K tokens y licencia MIT. Z.ai es la primera empresa de modelos fundacionales que cotiza en bolsa y ofrece su API alojada a precios muy competitivos —unos 1,40 dólares por millón de tokens de entrada—, pero los pesos están disponibles en Hugging Face si prefieres alojarlo tú mismo. Si tu juego depende de un LLM para crear scripts de misiones, usar agentes que llamen a herramientas o implementar sistemas basados en código, GLM-5 es una sólida alternativa a OpenAI que puedes controlar por completo.

GPT-OSS (OpenAI, agosto de 2025) es el primer lanzamiento con pesos abiertos de OpenAI y encaja plenamente con el tema de esta guía. El modelo gpt-oss-120b razona y llama a herramientas aproximadamente al nivel de o4-mini en una sola GPU de 80 GB, mientras que gpt-oss-20b funciona en una tarjeta de consumo de 16 GB; ambos usan Apache 2.0. Si quieres un modelo de un laboratorio occidental que puedas alojar tú mismo para la lógica de PNJ o agentes que utilicen herramientas, esta es la opción.

Kimi K2 (Moonshot) es el otro gran modelo abierto para agentes, junto con GLM-5 y DeepSeek. Es un MoE de un billón de parámetros con 32B activos, fuertemente optimizado para programación y uso de herramientas. Su licencia MIT modificada solo añade restricciones por encima de los 100 millones de usuarios mensuales, así que para los estudios independientes equivale, en la práctica, a MIT. Elígelo cuando un agente tenga que planificar a lo largo de muchos pasos.

Kimi K3 (Moonshot, julio de 2026) es el mayor modelo con pesos abiertos jamás anunciado y se acerca más a la frontera cerrada que cualquier modelo abierto anterior. Es un MoE de 2,8 billones de parámetros con solo unos 50B activos por token —16 de 896 expertos—, un contexto de 1M tokens y visión nativa, construido sobre dos nuevos diseños de atención llamados Kimi Delta Attention y Attention Residuals. Según las cifras de Moonshot, supera a Claude Opus 4.8 y GPT-5.5 en pruebas comparativas de programación y agentes, y solo queda por detrás de los mejores modelos propietarios. La dificultad es la escala: los pesos se publicarán el 27 de julio de 2026 y ocuparán alrededor de 1,4 TB en MXFP4, por lo que el autoalojamiento requiere un clúster de GPU con varios nodos, y la mayoría de los equipos accederán a él mediante la API, a 3 dólares por millón de tokens de entrada y 15 dólares por millón de salida. Para agentes que realmente puedas ejecutar tú mismo, K2 sigue siendo la opción práctica de Moonshot, pero K3 redefine lo que puede significar «abierto» en el nivel más alto.

Gemma 3 (Google) es la mejor opción cuando necesitas ejecutarlo en el hardware del jugador o localizar el juego a muchos idiomas. Está disponible en tamaños de 1B, 4B, 12B y 27B, por lo que puede funcionar desde una tarjeta de 8 GB en adelante, admite 140 idiomas y llamadas a funciones, y las variantes de 4B o más también procesan imágenes, por lo que sirven además como pequeños modelos de visión. La licencia de Gemma permite el uso comercial.

Qwen3-Coder (Alibaba) es el modelo abierto especializado en programación y sustituye a la antigua línea DeepSeek-Coder para la mayoría de los usos. Es un MoE de 480B con 35B activos, un contexto nativo de 256K —ampliable a 1M—, licencia Apache 2.0 y resultados comparables a Claude Sonnet en pruebas de programación con agentes. Si tu juego genera o ejecuta código, este es el techo abierto. La familia europea Mistral —Devstral para programación y Mistral Small 3.x para ejecución en el dispositivo, ambos bajo Apache 2.0— es una sólida alternativa autoalojable.

Qwen3-VL añade comprensión visual, con modelos densos y MoE de entre 2B y 235B bajo Apache 2.0. Resulta útil para juegos que necesiten analizar capturas de pantalla, entender contenido dibujado por el jugador o procesar la entrada de una cámara. La variante 8B funciona en una sola GPU. InternVL3 (Shanghai AI Lab, MIT) es la otra gran opción abierta de visión y lenguaje, especialmente buena en OCR y localización de elementos de interfaz, algo importante si tus herramientas necesitan leer interfaces de juegos; Pixtral 12B de Mistral (Apache 2.0) es una opción más ligera y segura para uso comercial.

Para PNJ que se ejecuten en el dispositivo y personajes que respondan en tiempo real sin llamadas a la nube, Qwen3-8B mediante NVIDIA ACE es ahora mismo la vía más práctica. Se ejecuta junto al juego en el hardware del jugador.

Modelos auxiliares

No generan contenido directamente, pero hacen que tus flujos de trabajo funcionen.

Segmentación con SAM 2SAM 2 segmenta cualquier objeto en imágenes y vídeos. Haz clic una vez y obtén una máscara perfecta

ModeloOrganizaciónPublicaciónQué hace
SAM 2MetaAgo. 2024Segmenta cualquier elemento en imágenes y vídeos
Depth ProAppleOct. 2024Obtiene profundidad métrica a partir de una sola imagen
gsplatNerfstudio2024+Splatting gaussiano acelerado con CUDA

SAM 2 segmenta objetos en vídeo en tiempo real. Haz clic en algo y obtendrás una máscara perfecta. Resulta útil para rotoscopia, composición o extracción de objetos de grabaciones para usarlos como recursos del juego. Prueba SAM 2 ↗

Depth Pro de Apple produce mapas de profundidad métrica a partir de imágenes individuales en menos de un segundo. Esto abre muchas posibilidades: convertir arte 2D en 2.5D con efectos de paralaje, generar datos de profundidad para reconstrucción 3D y crear mapas de normales a partir de imágenes planas. Depth Pro en HuggingFace ↗

gsplat es una implementación rápida del splatting gaussiano. Si capturas entornos reales para videojuegos, ya sea mediante fotogrametría o escaneos del entorno, esta es la biblioteca que lo hace viable.

Lo que yo usaría de verdad

Si hoy vas a empezar un proyecto de videojuego, esta es la combinación de herramientas más sensata:

Texturas y sprites: FLUX.1 [schnell], Apache 2.0, iteración rápida y calidad apta para publicar

Arte conceptual: SD 3.5 Large con LoRA para controlar el estilo

Recursos 3D: Hunyuan3D 2.1 o TRELLIS.2 para mallas texturizadas, SAM 3D si partes de una fotografía y después Blender para el retoque

Rigging automático: UniRig o NVIDIA SOMA-X para crear el esqueleto y el skinning de las mallas generadas —ambos son abiertos— en lugar de depender de Mixamo

Efectos de sonido: el modelo abierto Small-SFX de Stable Audio, se ejecuta localmente y tiene licencia comercial

Música: ACE-Step para prototipos y después un compositor para la producción final

Voz: Qwen3-TTS para clonación y diálogos ambientales (Apache 2.0), Chatterbox (MIT) cuando una frase necesite emoción real y actores de voz para las líneas importantes

Diálogos de PNJ: Qwen3-8B en local o un LLM en la nube que puedas alojar tú mismo —GLM-5 o DeepSeek-V4— para razonamiento complejo y uso de herramientas

Vídeo (cinemáticas): Mochi 1 en local y HunyuanVideo en la nube cuando necesites calidad final

La clave de todo esto es que el error habitual consiste en intentar usar IA para todo. Son herramientas, no sustitutos. Acortan las partes tediosas, como la iteración, la creación de variaciones y los recursos provisionales, para que puedas dedicar tu tiempo a las decisiones creativas que realmente importan. Las partes que hacen que tu juego sea tuyo.

Comprobación realista del hardware

Seamos sinceros sobre lo que realmente necesitas para ejecutar todo esto:

8 GB de VRAM (RTX 3060, 4060): SD 1.5/SDXL, Wan 2.1 pequeño, AudioGen, Fish Speech y LLM pequeños (7B cuantizados). Este es el terreno de los portátiles para gaming y basta para empezar. 12 GB de VRAM (RTX 3080, 4070): SD 3.5, FLUX schnell, Mochi 1, MusicGen, TripoSR y Qwen 14B cuantizado. A partir de aquí, todo resulta más cómodo. La mayoría de los modelos útiles funcionan con esta capacidad.

24 GB de VRAM (RTX 3090, 4090): la mayoría de los modelos a precisión completa, InstantMesh y LLM más grandes. Si te tomas en serio este flujo de trabajo, este es el punto ideal.

48-80 GB de VRAM (A100, H100): HunyuanVideo, LTX-2, DeepSeek-V3 y generación a escala de producción. Hardware empresarial. No vas a comprarlo, sino a alquilarlo.

Las instancias en la nube de RunPod, Lambda Labs o Modal cuestan entre 2 y 4 dólares por hora para las A100. Para un uso ocasional, sale más barato que comprar el hardware. Inicia una instancia cuando necesites la calidad final y apágala cuando termines.

Sobre las estimaciones de costes de esta guía: los costes por generación presuponen una inferencia autoalojada en GPU en la nube a unos 2-3 dólares por hora (A100) o unos 0,40 dólares por hora (RTX 4090). Los costes reales varían según el hardware, la optimización y el tamaño de los lotes. Son cifras aproximadas para facilitar la planificación, por lo que tus resultados pueden variar.

Novedades de 2026

Lanzamientos recientes: LTX-2 y LTX-2.3 ofrecieron audio y vídeo sincronizados y abiertos con 4K nativo. TRELLIS.2 de Microsoft (diciembre de 2025) se convirtió en el líder abierto de conversión de imágenes a 3D, y SAM 3D de Meta (noviembre de 2025) hizo viable la reconstrucción 3D a partir de una sola foto. FLUX.2 sustituyó a FLUX.1 para la generación de imágenes, y SOMA-X de NVIDIA ofreció rigging automático y retargeting abiertos. La primera mitad de 2026 mantuvo el ritmo: Qwen3-TTS (enero) dio a la clonación de voz un verdadero hogar bajo Apache 2.0; GLM-5 de Zhipu (febrero) lanzó bajo MIT un modelo abierto de 744B para programación y tareas agénticas; Matrix-Game 3.0 de Skywork (marzo) publicó con pesos abiertos un modelo de mundo interactivo en tiempo real; DeepSeek-V4 (abril) llevó los LLM abiertos hasta un contexto de un millón de tokens bajo MIT; Stable Audio 3.0 (mayo) lanzó tres modelos de audio abiertos entrenados con datos bajo licencia; e Ideogram publicó su primer modelo de imágenes con pesos abiertos (junio). Después, en julio, Moonshot anunció Kimi K3, un modelo con pesos abiertos y 2,8 billones de parámetros que supera a Claude Opus 4.8 y GPT-5.5 en pruebas de referencia agénticas, cuyos pesos estarán disponibles el 27 de julio.

La tendencia que conviene observar: los principales laboratorios reservan cada vez más sus modelos más recientes exclusivamente para sus API, aunque las versiones anteriores fueran abiertas. Wan se cerró en la versión 2.5 y ha seguido así hasta la 2.7; Qwen-Image se cerró en la 2.0 y Hunyuan3D, en la 2.5. El ecosistema abierto continúa siendo dinámico y avanza con rapidez, pero ya no es seguro asumir que «la última versión es abierta». Comprueba la disponibilidad de los pesos antes de crear un flujo de trabajo alrededor de un modelo.

La trayectoria está clara: todas las capacidades que aparecen en modelos cerrados llegan a los modelos abiertos entre 6 y 12 meses después. La cuestión no es si los modelos abiertos llegarán a ser lo bastante buenos. Ya lo son para la mayoría de los usos. La cuestión es cuánto tardarán en convertirse en la opción predeterminada.

Y esto es lo que significa para los creadores: las herramientas que antes exigían presupuestos empresariales o suscripciones mensuales se están convirtiendo en algo que simplemente puedes... ejecutar. En tu propio hardware. Sin pedir permiso a nadie.

Ese es el cambio. Hacia eso estamos construyendo.


Preguntas frecuentes

¿Cuál es el mejor modelo de IA de código abierto para generar recursos de videojuegos?

Depende del recurso. Para modelos 3D, Hunyuan3D es la opción abierta más potente en 2026. Para arte 2D y texturas, FLUX lidera en calidad. Para efectos de sonido y música, los modelos de audio abiertos han avanzado con rapidez. No existe un único modelo «mejor» porque los juegos necesitan muchos tipos de recursos, así que la mayoría de los creadores encadenan varios modelos en lugar de depender de uno solo.

¿Los modelos de IA de código abierto son lo bastante buenos como para sustituir a las API cerradas?

Para la mayoría de los trabajos con recursos de videojuegos en 2026, sí. Los modelos abiertos ya igualan a las API cerradas en la generación de imágenes, 3D y audio, y puedes ejecutarlos en tu propio hardware sin pagar por cada solicitud ni sufrir cambios de precio inesperados. Los modelos cerrados aún van por delante en algunas tareas punteras, como los vídeos de larga duración, pero la brecha suele cerrarse en un plazo de 6 a 12 meses.

¿Puedo ejecutar estos modelos de IA generativa en mi propia GPU?

Muchos de ellos, sí. Los modelos de imágenes y audio funcionan cómodamente en una sola GPU de consumo como la RTX 4090. Los modelos más grandes de vídeo y 3D necesitan más VRAM y, a menudo, una GPU en la nube de la categoría de una A100. La sección sobre hardware anterior indica qué necesita cada modelo para que puedas planificarlo antes de comprometerte.

En general, sí, en el caso de los modelos de código abierto que ejecutas tú mismo, pero depende de la licencia del modelo y de las suposiciones sobre sus datos de entrenamiento. Comprueba siempre la licencia específica del modelo e informa del contenido generado por IA cuando la plataforma lo exija. Consulta nuestra política sobre contenido generado por IA para saber cómo lo gestionamos.


Más lecturas

Pruébalo ahora mismoMira cómo estos modelos crean un juego, no solo recursos

Los modelos generativos son más divertidos cuando el resultado es jugable.

Créalo gratis →Es gratis, funciona en tu navegador, nada que instalar.