Qwen-Image-2.1, 실제 알파 채널이 있는 스프라이트 생성… 라이선스는 비상업적 이용만 허용
알리바바의 Qwen 팀은 기조연설도 없고 블로그 게시물도 거의 없이 9월 20일 Qwen-Image-2.1을 Hugging Face와 ModelScope에 공개했다. 이미지 생성 구성 요소에 70억 개의 매개변수를 사용하며 텍스트 이미지 생성과 이미지 편집을 모두 수행하는 단일 모델이다. 게임 제작 측면에서 흥미로운 기능은 실제 알파 채널이 있는 이미지를 생성한다는 점이다. 스티커나 소품, 캐릭터 컷아웃을 요청하면 나중에 흰 배경을 매트 처리해야 하는 이미지가 아니라 RGBA 이미지가 나온다. 모델 카드, GitHub.

공개 예시의 RGBA 출력물 두 장을 체크무늬 배경 위에 배치했다. 이미지: 알리바바 Qwen 팀.
무엇을 할 수 있나
이 모델은 이전까지 세 가지 도구가 필요했던 작업을 하나로 처리한다. 텍스트로 일반 이미지 또는 투명 이미지를 생성한다. 최대 10장의 참조 이미지를 이용해 장면이 바뀌어도 캐릭터나 제품의 일관성을 유지할 수 있으며, 영역을 원으로 표시하거나 덧칠하거나 마스크를 제공해 지정한 부분을 편집할 수도 있다. 추출 기능도 있다. 사진을 제공하고 피사체를 투명 레이어로 만들어 달라고 요청하면 알파 채널이 이미 포함된 컷아웃을 반환한다.
출력은 네이티브 2K다. 기본 정사각형 크기는 2048×2048이고 16:9 프리셋은 2752×1536이며, 업스케일링하는 것이 아니라 해당 크기로 직접 생성한다. Qwen 팀은 이 해상도에서도 추론 비용을 낮게 유지할 수 있는 이유로 혼합 세분화 어텐션 방식과 프리픽스 KV 캐시 재사용을 꼽았다. ComfyUI는 출시 당일부터 지원을 제공했으며 이 모델이 소비자용 그래픽 카드에서도 여유롭게 구동된다고 설명했다. The Decoder는 RTX 3090에서 실행된다고 보도했다. 투명 출력에 권장되는 프롬프트는 직설적이다. 알파 채널과 투명 배경을 갖춘 RGBA 이미지라고 평문으로 모델에 지시하면 그대로 따른다. ComfyUI 블로그, The Decoder.
벤치마크와 감안해야 할 점
README에 실린 유일한 차트는 Qwen 팀이 자체적으로 산정한 종합 점수를 기준으로 30개의 이미지 모델을 평가한다. Qwen-Image-2.1은 60.28점으로 7위다. GPT Image 2.5, GPT Image 2, Grok Imagine 2.0, Qwen의 비공개 모델 Image 3 Pro, Meta의 Muse Image, Microsoft의 MAI Image 2.5 Pro보다 낮고, Nano Banana 2.0과 모든 Seedream 모델보다 높다. 이 차트가 실제로 강조하는 부분은 두 번째 행이다. 상위 비공개 모델들은 매개변수 수를 공개하지 않으며, 그 아래에 있는 공개 모델들은 훨씬 크다. FLUX 2 Max와 Pro는 320억, Qwen-Image-2512는 200억, Hunyuan Image 3.0은 800억 개의 매개변수를 사용한다. 70억 규모의 모델이 이들 모두보다 높은 점수를 기록했다는 것이 Qwen 측의 주장이다.
공급업체가 직접 설계한 평가 척도로 자사 모델을 채점한 벤치마크이므로 평소처럼 어느 정도 걸러서 봐야 한다. 예시를 통해 확인할 수 있는 것은 텍스트 렌더링과 다중 참조 이미지 합성 품질이 차트에서 암시하는 만큼 좋아 보이며, 투명도가 실제라는 점이다. 공개 샘플의 알파 가장자리는 흰색에 가까운 픽셀로 된 테두리가 아니라 깔끔하게 처리돼 있다.

README의 차트: 위에는 점수, 아래에는 매개변수 수가 표시되며 이를 공개하지 않은 모델에는 자물쇠가 붙어 있다. 이미지: 알리바바 Qwen 팀.
도입하기 전에 라이선스부터 읽어야 한다
2025년 8월 공개된 첫 번째 Qwen-Image는 Apache 2.0 라이선스로 배포됐다. 이번 모델은 출시일과 같은 날짜로 작성된 Qwen 연구 라이선스 계약에 따라 배포된다. 이 라이선스는 비상업적 목적으로만 이용할 수 있도록 허용하며, 상업적 이용자에게는 별도로 협의하는 라이선스를 안내한다. 가중치가 공개된 것은 맞다. 하지만 취미 프로젝트로 만드는 게임이 아니거나 별도의 라이선스를 취득하지 않는 한, 게임 에셋 파이프라인에 자유롭게 사용할 수 있는 것은 아니다.
이 모델은 가장 뛰어난 기능이 실제 제작에 쓰이는 기능이기 때문에 라이선스가 다른 모델보다 더욱 중요하다. 투명 스프라이트와 아이콘, 컷아웃은 실험으로 끝나는 것이 아니라 게임에 넣어 출시하는 에셋이다. Hugging Face에서 다운로드할 수 있다는 이유만으로 스튜디오가 이 모델을 파이프라인에 연결했다가 출시 시점에 라이선스를 알게 된다면 문제가 생긴다.
Cinevva와 어떤 관련이 있나
스프라이트와 UI 아트는 Cinevva 크리에이터들이 가장 많이 요청하는 이미지이며, 알파 채널은 지금까지 모든 범용 이미지 모델이 기대에 미치지 못했던 부분이다. Cinevva의 이미지 도구는 Flux를 사용한다. Flux는 배경 위에 피사체를 생성하며, 이후 진행하는 배경 제거 단계에서 머리카락과 불, 유리의 가장자리에 테두리가 생기고 디테일이 사라진다. 처음부터 알파를 생성하는 모델이라면 이 단계를 없앨 수 있으며, 공개 샘플을 보면 결과도 훌륭해 보인다.
Cinevva에서는 이 모델을 호스팅해 제공할 수 없다. 라이선스상 유료 서비스로 운영할 수 없으며, 상업적 이용을 금지하는 연구 라이선스이므로 출력물을 판매용 게임에 넣는 것도 허용되지 않는다. 따라서 Cinevva가 다루는 모든 모델 출시에 대한 솔직한 조언은 이번에도 같다. Qwen이 70억 규모에서도 이 기술이 작동한다는 사실을 보여준 만큼 이 방식은 널리 확산될 것이며, 허용 범위가 넓은 라이선스로 공개될 다음 이미지 모델도 네이티브 RGBA를 지원할 가능성이 매우 높다. 그때까지는 현재 출시 가능한 에셋 출처를 소개하는 스프라이트 및 타일셋 가이드를 참고할 수 있다. 또한 게임 에셋 라이선스 가이드에서는 ‘가중치 공개’와 ‘무료 사용 가능’이 같은 뜻이 아닌 이유를 설명한다.