Qwen-Image-2.1 génère des sprites avec un véritable canal alpha, sous une licence qui interdit l'usage commercial
L'équipe Qwen d'Alibaba a publié Qwen-Image-2.1 sur Hugging Face et ModelScope le 20 septembre, sans conférence de lancement et avec à peine un article de blog. Il s'agit d'un modèle unique de génération d'images à partir de texte et de retouche d'images, dont le composant de génération visuelle compte 7 milliards de paramètres. Ce qui le rend intéressant pour les jeux, c'est qu'il génère des images avec un véritable canal alpha. Demandez un autocollant, un accessoire ou un personnage détouré, et vous obtenez une image RGBA, pas un sujet sur fond blanc qu'il faut ensuite détourer. Fiche du modèle, GitHub.

Deux sorties RGBA tirées des exemples de la version, placées sur un damier. Images : équipe Qwen, Alibaba.
Ce qu'il fait
Le modèle accomplit trois tâches qui nécessitaient auparavant trois outils. Il génère des images classiques ou transparentes à partir de texte. Il effectue des retouches, avec jusqu'à dix images de référence pour conserver la cohérence d'un personnage ou d'un produit d'une scène à l'autre, ainsi que des modifications locales que vous indiquez en entourant une zone, en peignant dessus ou en fournissant un masque. Enfin, il effectue des extractions : donnez-lui une photo et demandez-lui le sujet sous forme de calque transparent, et il renvoie le détourage avec le canal alpha déjà intégré.
La sortie est nativement en 2K. Le format carré par défaut mesure 2048 × 2048, tandis que le préréglage 16:9 produit une image de 2752 × 1536, générée directement à cette taille plutôt que mise à l'échelle. L'équipe Qwen attribue le faible coût d'inférence à cette résolution à un mécanisme d'attention à granularité mixte et à la réutilisation du cache KV des préfixes. ComfyUI a pris en charge le modèle dès le premier jour et indique qu'il tient confortablement sur des cartes grand public, tandis que The Decoder rapporte qu'il fonctionne sur une RTX 3090. Pour obtenir une sortie transparente, la consigne recommandée est directe : indiquez simplement au modèle qu'il s'agit d'une image RGBA avec un canal alpha et un arrière-plan transparent, et il s'exécute. Blog de ComfyUI, The Decoder.
Le benchmark et la décote à appliquer
L'unique graphique du README classe 30 modèles d'image selon le score global établi par l'équipe Qwen. Qwen-Image-2.1 se place en septième position avec 60,28 points, derrière GPT Image 2.5, GPT Image 2, Grok Imagine 2.0, Image 3 Pro, le modèle fermé de Qwen, Muse Image de Meta et MAI Image 2.5 Pro de Microsoft, mais devant Nano Banana 2.0 et tous les modèles Seedream. Le véritable message du graphique se trouve dans la deuxième ligne : les modèles fermés qui le devancent ne publient pas leur nombre de paramètres, tandis que les modèles ouverts derrière lui sont beaucoup plus grands. FLUX 2 Max et Pro comptent 32 milliards de paramètres, Qwen-Image-2512 en compte 20 milliards et Hunyuan Image 3.0, 80 milliards. L'affirmation centrale est donc qu'un modèle de 7 milliards de paramètres obtient un meilleur score que tous ces modèles.
Il s'agit d'un benchmark réalisé et noté par le fournisseur, selon une échelle qu'il a lui-même conçue : il faut donc lui appliquer la décote habituelle. Ce que les exemples permettent d'affirmer, c'est que le rendu du texte et la composition à partir de plusieurs références semblent aussi bons que le suggère le graphique, et que la transparence est réelle : les contours alpha des exemples publiés sont nets, sans halo de pixels presque blancs.

Le graphique du README : score en haut, nombre de paramètres en dessous et cadenas pour les modèles qui ne le divulguent pas. Image : équipe Qwen, Alibaba.
Lisez la licence avant de l'intégrer à votre production
Le premier Qwen-Image, publié en août 2025, était distribué sous licence Apache 2.0. Celui-ci est distribué sous le Qwen Research License Agreement, daté du jour même de la sortie, qui autorise uniquement les usages non commerciaux et renvoie les utilisateurs commerciaux vers une licence distincte à négocier. Les poids sont ouverts, oui. Mais le modèle n'est pas librement utilisable dans la chaîne de production graphique de votre jeu, sauf s'il s'agit d'un projet amateur ou si vous obtenez l'autre licence.
C'est particulièrement important pour ce modèle, car sa meilleure fonctionnalité est destinée à la production. Les sprites transparents, les icônes et les détourages sont des éléments que l'on intègre à un jeu commercialisé, pas seulement des sujets d'expérimentation. Un studio qui l'intègre à sa chaîne de production après l'avoir téléchargé sur Hugging Face, puis découvre les conditions de la licence au moment du lancement, a un problème.
Pourquoi cela nous concerne
Les sprites et les éléments d'interface sont les images que nos créateurs demandent le plus, et le canal alpha est précisément le point sur lequel tous les modèles d'image généralistes les ont déçus. Notre outil d'image repose sur Flux, qui génère un sujet sur un arrière-plan. La suppression de cet arrière-plan est ensuite l'étape qui produit des contours frangés et fait perdre des détails dans les cheveux, le feu et le verre. Un modèle qui génère directement le canal alpha supprime cette étape, et les exemples publiés suggèrent qu'il le fait bien.
Nous ne pouvons pas héberger ce modèle pour vous. Sa licence interdit de l'exploiter comme service payant, et une licence de recherche qui proscrit l'usage commercial interdit également d'utiliser ses sorties dans un jeu que vous vendez. Notre conseil reste donc le même que pour chaque sortie de modèle que nous couvrons : la technique va se répandre, et il est très probable que le prochain modèle d'image ouvert sous licence permissive prenne lui aussi en charge le RGBA natif, car Qwen vient de démontrer que cela fonctionne avec 7 milliards de paramètres. En attendant, notre guide des sprites et tilesets 2D gratuits présente les ressources que vous pouvez intégrer dès aujourd'hui, et notre guide des licences d'assets de jeu explique pourquoi « poids ouverts » et « libre d'utilisation » ne veulent pas dire la même chose.
Références
- Hugging Face : fiche du modèle Qwen/Qwen-Image-2.1
- GitHub : QwenLM/Qwen-Image-2.1
- Blog de Qwen : Qwen-Image-2.1
- ComfyUI : Qwen-Image-2.1 dans ComfyUI, génération et retouche à poids ouverts avec transparence
- The Decoder : le modèle à poids ouverts Qwen-Image-2.1 d'Alibaba affirme battre les modèles fermés avec 7 milliards de paramètres