Qwen-Image-2.1 genera sprites con un canal alfa real, bajo una licencia que especifica un uso no comercial
El equipo de Qwen de Alibaba publicó Qwen-Image-2.1 en Hugging Face y ModelScope el 20 de septiembre, sin presentación y apenas con una entrada de blog. Es un único modelo para generar imágenes a partir de texto y editarlas, con 7.000 millones de parámetros en su componente de generación visual. La característica que lo hace interesante para los videojuegos es que genera imágenes con un canal alfa real. Pídele un sticker, un objeto o el recorte de un personaje y obtendrás una imagen RGBA, no un sujeto sobre un fondo blanco que después tendrás que recortar. Ficha del modelo, GitHub.

Dos resultados RGBA de los ejemplos del lanzamiento, colocados sobre un patrón de cuadros. Imágenes: equipo de Qwen, Alibaba.
Qué hace
El modelo realiza tres tareas que antes requerían tres herramientas. Genera imágenes normales o transparentes a partir de texto. Permite editarlas utilizando hasta diez imágenes de referencia para mantener la coherencia de un personaje o producto entre distintas escenas, así como realizar ediciones locales que puedes indicar rodeando una región, pintando sobre ella o proporcionando una máscara. También extrae elementos: dale una foto y pídele el sujeto como una capa transparente, y devolverá el recorte con el canal alfa ya incluido.
La salida tiene una resolución nativa de 2K. El formato cuadrado predeterminado es de 2048 por 2048, mientras que el ajuste 16:9 es de 2752 por 1536; las imágenes se generan directamente a ese tamaño en lugar de ampliarse. El equipo de Qwen atribuye el bajo coste de inferencia a esa resolución a un sistema de atención con granularidad mixta y a la reutilización de la caché KV del prefijo. ComfyUI incorporó compatibilidad desde el primer día y afirma que el modelo cabe holgadamente en tarjetas de consumo, mientras que The Decoder informa de que funciona en una RTX 3090. Para obtener una salida transparente, la indicación recomendada es directa: dile al modelo en lenguaje natural que se trata de una imagen RGBA con canal alfa y fondo transparente, y lo hará. Blog de ComfyUI, The Decoder.
El benchmark y sus reservas
El único gráfico del README clasifica 30 modelos de imagen según la puntuación global creada por el propio equipo de Qwen. Qwen-Image-2.1 ocupa el séptimo puesto con 60,28 puntos, por detrás de GPT Image 2.5, GPT Image 2, Grok Imagine 2.0, el modelo cerrado Image 3 Pro de Qwen, Muse Image de Meta y MAI Image 2.5 Pro de Microsoft, y por delante de Nano Banana 2.0 y de todos los modelos Seedream. El verdadero argumento del gráfico está en la segunda fila: los modelos cerrados que lo superan no publican su número de parámetros y los modelos abiertos que quedan por debajo son mucho más grandes. FLUX 2 Max y Pro tienen 32.000 millones, Qwen-Image-2512 tiene 20.000 millones y Hunyuan Image 3.0 tiene 80.000 millones. La afirmación es que un modelo de 7.000 millones consigue una puntuación superior a todos ellos.
Es un benchmark del proveedor, evaluado por el propio proveedor y con una escala diseñada por este, por lo que hay que interpretarlo con las reservas habituales. Lo que sí podemos afirmar a partir de los ejemplos es que la representación de texto y la composición con múltiples referencias parecen tan buenas como sugiere el gráfico, y que la transparencia es real: los bordes alfa de las muestras del lanzamiento son limpios, en lugar de presentar un halo de píxeles casi blancos.

El gráfico del README: arriba, la puntuación; debajo, el número de parámetros; los candados indican los modelos que no lo revelan. Imagen: equipo de Qwen, Alibaba.
Lee la licencia antes de basar tu proyecto en él
El primer Qwen-Image, lanzado en agosto de 2025, se publicó bajo Apache 2.0. Este se distribuye bajo el Acuerdo de licencia de investigación de Qwen, fechado el mismo día del lanzamiento, que solo autoriza el uso con fines no comerciales y remite a los usuarios comerciales a una licencia independiente que debe negociarse. ¿Pesos abiertos? Sí. ¿Abierto para el flujo de creación de recursos de tu juego? No, salvo que tu juego sea un proyecto personal o que consigas la otra licencia.
Esto importa más en este modelo que en la mayoría, porque su mejor característica está pensada para producción. Los sprites transparentes, iconos y recortes son elementos que se publican, no simples experimentos. Un estudio que lo integre en su flujo de trabajo confiando en la descarga de Hugging Face y descubra las condiciones de la licencia durante el lanzamiento tendrá un problema.
Por qué nos afecta
Los sprites y el arte de interfaz son las imágenes que más solicitan nuestros creadores, y el canal alfa es el punto en el que todos los modelos de imagen de propósito general les han fallado. Nuestra herramienta de imágenes utiliza Flux, que genera un sujeto sobre un fondo, y la posterior eliminación del fondo es el paso que produce bordes irregulares y pérdida de detalle en el pelo, el fuego y el cristal. Un modelo que genere el canal alfa desde el principio elimina ese paso, y las muestras del lanzamiento indican que lo hace bien.
No podemos alojar este modelo para ti. La licencia impide ofrecerlo como servicio de pago, y una licencia de investigación que prohíbe el uso comercial también impide utilizar los resultados en un juego que vendas. Por tanto, nuestro consejo honesto es el mismo que damos con cada lanzamiento de un modelo del que hablamos: la técnica se extenderá, y es muy probable que el próximo modelo de imagen abierto con una licencia permisiva también genere RGBA de forma nativa, porque Qwen acaba de demostrar que funciona con 7.000 millones de parámetros. Hasta entonces, nuestra guía de sprites y tilesets recoge fuentes que puedes utilizar hoy mismo en tus proyectos publicados, y la guía de licencias de recursos para juegos explica por qué «pesos abiertos» y «uso gratuito» no significan lo mismo.
Referencias
- Hugging Face: ficha del modelo Qwen/Qwen-Image-2.1
- GitHub: QwenLM/Qwen-Image-2.1
- Blog de Qwen: Qwen-Image-2.1
- ComfyUI: Qwen-Image-2.1 en ComfyUI, generación y edición con pesos abiertos y transparencia
- The Decoder: Qwen-Image-2.1 de Alibaba, con pesos abiertos, afirma superar a modelos cerrados con 7.000 millones de parámetros