Qwen-Image-2.1 menghasilkan sprite dengan kanal alfa sungguhan, di bawah lisensi yang menyatakan nonkomersial
Tim Qwen dari Alibaba mengunggah Qwen-Image-2.1 ke Hugging Face dan ModelScope pada 20 September tanpa presentasi utama dan nyaris tanpa postingan blog. Ini adalah satu model untuk pembuatan gambar dari teks dan penyuntingan gambar, dengan 7 miliar parameter dalam komponen pembuatan visualnya. Fitur yang membuatnya menarik untuk game adalah kemampuannya menghasilkan gambar dengan kanal alfa sungguhan. Minta stiker, properti, atau potongan karakter, dan Anda akan mendapatkan RGBA, bukan subjek berlatar putih yang kemudian harus dipisahkan dengan proses matting. Kartu model, GitHub.

Dua keluaran RGBA dari contoh rilis, ditempatkan di atas pola papan catur. Gambar: tim Qwen, Alibaba.
Apa yang dapat dilakukannya
Model ini menangani tiga pekerjaan yang sebelumnya memerlukan tiga alat. Model ini menghasilkan gambar biasa atau transparan dari teks. Model ini juga menyunting gambar, dengan dukungan hingga sepuluh gambar referensi agar karakter atau produk tetap konsisten di berbagai adegan, serta penyuntingan lokal yang Anda tentukan dengan melingkari suatu area, melukis di atasnya, atau menyediakan mask. Model ini juga dapat mengekstrak: berikan sebuah foto dan minta subjeknya sebagai lapisan transparan, lalu model akan mengembalikan potongan tersebut dengan alfa yang sudah tersedia.
Keluarannya memiliki resolusi native 2K. Ukuran persegi default adalah 2048 × 2048, sedangkan preset 16:9 berukuran 2752 × 1536 dan dihasilkan langsung pada ukuran tersebut, bukan melalui upscaling. Tim Qwen menyebut skema attention dengan granularitas campuran dan penggunaan ulang prefix KV cache sebagai alasan biaya inferensi tetap rendah pada resolusi tersebut. ComfyUI menyediakan dukungan sejak hari pertama dan menyatakan bahwa model ini dapat dijalankan dengan nyaman pada kartu grafis konsumen, sementara The Decoder melaporkan bahwa model tersebut berjalan pada RTX 3090. Untuk keluaran transparan, prompt yang disarankan sangat lugas: beri tahu model dengan teks biasa bahwa gambar ini adalah gambar RGBA dengan kanal alfa dan latar belakang transparan, lalu model akan mengikutinya. Blog ComfyUI, The Decoder.
Tolok ukur dan potongan nilainya
Satu-satunya grafik dalam README memberi peringkat kepada 30 model gambar berdasarkan skor keseluruhan buatan tim Qwen sendiri. Qwen-Image-2.1 berada di peringkat ketujuh dengan skor 60,28, di belakang GPT Image 2.5, GPT Image 2, Grok Imagine 2.0, Image 3 Pro tertutup milik Qwen, Muse Image dari Meta, dan MAI Image 2.5 Pro dari Microsoft, serta di depan Nano Banana 2.0 dan semua versi Seedream. Pesan utama grafik tersebut sebenarnya ada di baris kedua: model-model tertutup di atasnya tidak memublikasikan jumlah parameter, sedangkan model-model terbuka di bawahnya jauh lebih besar. FLUX 2 Max dan Pro memiliki 32 miliar parameter, Qwen-Image-2512 memiliki 20 miliar, dan Hunyuan Image 3.0 memiliki 80 miliar. Klaimnya adalah bahwa model 7 miliar parameter ini meraih skor lebih tinggi daripada semuanya.
Ini adalah tolok ukur vendor, dinilai oleh vendor, dengan skala yang dirancang oleh vendor, jadi hasilnya perlu disikapi dengan kehati-hatian seperti biasa. Dari contoh-contohnya, kita dapat mengatakan bahwa rendering teks dan komposisi multireferensi terlihat sebagus yang ditunjukkan grafik, serta bahwa transparansinya benar-benar nyata: tepi alfa pada sampel rilis tampak bersih, bukan berupa lingkaran piksel nyaris putih.

Grafik README: skor di atas, jumlah parameter di bawah, dan ikon gembok untuk model yang tidak mengungkapkannya. Gambar: tim Qwen, Alibaba.
Baca lisensinya sebelum Anda mengandalkannya
Qwen-Image pertama, yang dirilis pada Agustus 2025, menggunakan lisensi Apache 2.0. Versi ini dirilis di bawah Perjanjian Lisensi Riset Qwen, bertanggal sama dengan hari peluncurannya, yang hanya memberikan izin penggunaan untuk tujuan nonkomersial dan mengarahkan pengguna komersial ke lisensi terpisah yang harus dinegosiasikan. Bobot terbuka, ya. Terbuka untuk pipeline aset game Anda, tidak, kecuali game Anda merupakan proyek hobi atau Anda mendapatkan lisensi lainnya.
Hal ini lebih penting bagi model ini dibandingkan kebanyakan model lain karena fitur terbaiknya adalah fitur produksi. Sprite transparan, ikon, dan gambar potongan adalah aset yang Anda distribusikan, bukan sekadar bahan eksperimen. Studio yang mengintegrasikan model ini ke dalam pipeline hanya berdasarkan ketersediaan unduhan di Hugging Face, lalu baru mengetahui soal lisensinya saat peluncuran, akan menghadapi masalah.
Mengapa ini relevan bagi kami
Sprite dan ilustrasi UI adalah gambar yang paling sering diminta oleh kreator kami, dan kanal alfa adalah bagian yang selalu gagal ditangani oleh setiap model gambar serbaguna. Alat gambar kami menggunakan Flux, yang menghasilkan subjek di atas suatu latar belakang. Proses penghapusan latar belakang setelahnya merupakan tahap yang menimbulkan pinggiran kasar dan menghilangkan detail pada rambut, api, dan kaca. Model yang menghasilkan alfa sejak awal menghapus tahap tersebut, dan sampel rilisnya menunjukkan bahwa model ini melakukannya dengan baik.
Kami tidak dapat menyediakan model ini untuk Anda. Lisensinya melarang kami menjalankannya sebagai layanan berbayar, dan lisensi riset yang melarang penggunaan komersial juga melarang keluarannya digunakan dalam game yang Anda jual. Jadi, saran jujurnya sama seperti untuk setiap rilis model yang kami ulas: teknik ini akan menyebar, dan model gambar terbuka berikutnya yang menggunakan lisensi permisif kemungkinan besar juga akan memiliki RGBA native, karena Qwen baru saja membuktikan bahwa fitur tersebut dapat bekerja pada model 7 miliar parameter. Untuk saat ini, panduan sprite dan tileset kami membahas sumber yang dapat Anda gunakan dalam rilisan hari ini, sedangkan panduan lisensi aset game menjelaskan mengapa "bobot terbuka" dan "bebas digunakan" bukanlah hal yang sama.
Referensi
- Hugging Face: kartu model Qwen/Qwen-Image-2.1
- GitHub: QwenLM/Qwen-Image-2.1
- Blog Qwen: Qwen-Image-2.1
- ComfyUI: Qwen-Image-2.1 di ComfyUI, pembuatan dan penyuntingan berbobot terbuka dengan transparansi
- The Decoder: Qwen-Image-2.1 berbobot terbuka dari Alibaba mengklaim dapat mengalahkan model tertutup dengan 7 miliar parameter