게임을 위한 최고의 오픈 소스 생성형 AI 모델(2026년)
최종 업데이트: 2026년 9월.
생성형 AI에는 이런 문제가 있었습니다. 수년 동안 최고의 모델은 API 키와 예측하기 어려운 요금제 뒤에 갇혀 있었습니다. 어떤 도구를 중심으로 워크플로를 구축하고 익숙해질 즈음이면, 어느 날 요금제가 변경됐다는 이메일을 받곤 했습니다. 더 나쁜 경우에는 회사가 사업 방향을 완전히 바꾸기도 했습니다.
이 상황은 2024년 말부터 달라졌습니다. Tencent, Alibaba, DeepSeek가 실제로 다운로드할 수 있는 모델을 공개하기 시작했습니다. 폐쇄형 대안과 견줄 만한 모델들이었습니다. 그 결과 크리에이터들은 더 이상 다른 회사의 비즈니스 모델에 의존하지 않는 선택지를 갖게 됐습니다.
직접 제어할 수 있는 모델만으로 비디오, 3D 에셋, 음악, 음성을 모두 생성할 수 있다면 어떨까요? 이제 실제로 가능한 일입니다. 이 가이드에서는 무엇이 실재하고, 무엇이 제대로 작동하며, 지금 당장 무엇을 사용할 수 있는지 살펴봅니다.
비디오 생성
수년 동안 비디오 생성은 Runway나 Pika를 의미했습니다. 폐쇄형 플랫폼과 구독료, 결과물 활용 방식에 대한 제약을 감수해야 했습니다. 지금은 어떨까요? 자체 하드웨어에서 비슷한 수준의 모델을 실행할 수 있습니다.
HunyuanVideo 텍스트-투-비디오 생성 예시. 선도적인 오픈 소스 비디오 모델이 만든 720p 결과물
| 모델 | 개발사 | 매개변수 | 사양 | 하드웨어 | 비용 |
|---|---|---|---|---|---|
| HunyuanVideo | Tencent | 13B | 720p, 텍스트+이미지 | 80GB | ~$0.20 |
| HunyuanVideo-1.5 | Tencent | 8.3B | 480p-1080p, 텍스트+이미지 | 14GB | ~$0.05 |
| Mochi 1 | Genmo | 10B | 480p@30fps | 12GB+ | ~$0.10 |
| LTX-Video | Lightricks | — | 768x512, 실시간 | 12GB | ~$0.02 |
| LTX-2 / LTX-2.5 | Lightricks | 19B (2) / 22B (2.5) | 4K, 동기화 오디오, 2.5의 멀티숏 | 고사양 | ~$0.30 |
| Wan 2.1 | Alibaba | 1.3-14B | 480p-720p | 8GB+ | ~$0.03 |
| Wan 2.2 | Alibaba | 27B MoE (14B 활성) | 720p, MoE | 8GB+ | ~$0.03 |
| CogVideoX1.5-5B | Tsinghua | 5B | 1360x768@16fps, 최대 10초 | 12GB | ~$0.04 |
| SkyReels-V3 | Skywork | 14-19B | 오디오 기반, 참조-투-비디오, V2V | 고사양 | ~$0.10 |
| MiniMax H3 | MiniMax | 33B | 2K, 4-15초, 스테레오 오디오, 참조 이미지 최대 9장 | 고사양 | 벤치마크되지 않음 |
| Step-Video-T2V | StepFun | 30B | 최대 규모의 오픈 T2V, 204프레임 | 고사양 | ~$0.15 |
| Open-Sora 2.0 | HPC-AI | 11B | Flux 통합 | 고사양 | ~$0.20 |
가중치: HunyuanVideo ↗ · Mochi 1 ↗ · Wan 2.1 ↗ · Open-Sora ↗
샘플 보기: HunyuanVideo 갤러리 ↗ · Mochi 예시 ↗ · CogVideoX 샘플 ↗
크리에이터에게 어떤 의미인가
HunyuanVideo는 전문가 평가에서 Runway Gen-3보다 뛰어난 성능을 보이며 완전히 개방되어 있습니다. 문제는 고성능 하드웨어가 필요하다는 점입니다. VRAM 80GB를 갖춘 A100 또는 H100이 필요합니다. 대부분의 크리에이터에게는 필요할 때 클라우드 GPU를 대여해야 한다는 뜻입니다.
HunyuanVideo-1.5는 하드웨어에 대한 계산을 바꿨습니다. Tencent가 2025년 11월 공개한 8.3B 매개변수의 오픈 모델로, 14GB 소비자용 GPU에서 실행되며 480p/720p 텍스트-투-비디오와 이미지-투-비디오를 지원하고 선택적으로 1080p 업스케일링도 제공합니다. 새로운 Selective and Sliding Tile Attention(SSTA) 메커니즘을 통해 원본 HunyuanVideo보다 추론 속도가 약 두 배 빨라졌습니다. HunyuanVideo의 품질을 원하지만 80GB 카드를 마련하기 어려웠다면, 실제로 가정에서 실행할 수 있는 버전입니다.
Mochi 1은 실제로 직접 실행하기 좋은 모델입니다. RTX 3060급인 12GB GPU로도 충분히 구동됩니다. 결과물은 독창적이며 뚜렷한 예술적 특성을 보여줍니다. HunyuanVideo 수준의 정밀도에는 조금 못 미치지만, 전체 프로세스를 직접 소유하고 통제할 수 있습니다.
LTX-2는 게임 제작 측면에서 특히 흥미로운 모델입니다. 비디오와 동기화된 오디오를 생성하는 최초의 오픈 모델입니다. 사운드가 그냥 자연스럽게 맞아떨어지는 컷신을 상상해 보세요. 후반 작업에서 따로 동기화할 필요가 없습니다. Lightricks는 2026년 1월 전체 가중치와 추론 및 학습 코드를 오픈 소스로 공개했으며, 최대 50fps의 네이티브 4K 출력과 최대 20초의 동기화 오디오를 지원합니다. 라이선스와 관련해 한 가지 주의할 점이 있습니다. LTX-2의 오픈 가중치는 학술 용도로 무료이며, 상업적 용도는 연 매출 $10M 미만인 회사에만 무료입니다. 이를 기반으로 사업을 구축하기 전에 해당 기준을 확인해야 합니다. 2026년 9월 기준 최신 체크포인트는 LTX-2.5입니다. 이 22B 모델에는 네이티브 멀티숏 생성(하나의 캐릭터와 시각적 스타일을 유지하는 여러 연결된 숏), 단순 VAE 복원 대신 사용하는 확산 비디오 디코더, 더 긴 프롬프트를 위한 Gemma 4 12B 텍스트 인코더가 추가됐습니다. 라이선스는 여전히 LTX-2.x Community License이며, 동일하게 매출 $10M 기준이 적용되고 이를 넘으면 유료 계약이 필요합니다.
SkyReels-V3(Skywork, 2026년 1월)는 주목할 만한 최신 오픈 모델 계열입니다. 오디오 기반 비디오, 참조-투-비디오, 비디오-투-비디오를 모두 처리하는 14B 및 19B 버전의 통합 멀티모달 모델입니다. 캐릭터나 참조 이미지로 장면을 이끌어야 할 때 강점을 보입니다. Step-Video-T2V(StepFun)는 30B 규모로 공개된 텍스트-투-비디오 모델 중 가장 크며, 깔끔한 MIT 라이선스로 배포됩니다. 소형 GPU에서의 실행보다 허용 범위가 넓은 라이선스가 더 중요하다면 알아둘 만합니다.
MiniMax H3(Hailuo 3.0)는 가장 최근에 등장한 오픈 모델이며, 참조 기반 컷신 제작에서 주목할 만합니다. MiniMax는 2026년 7월 31일 이 모델을 API로 출시한 뒤, 8월에 33B 기본 가중치를 두 가지 체크포인트와 함께 Hugging Face에 공개했습니다. FL2VA는 첫 프레임과 마지막 프레임을 이용한 생성을 지원합니다. Ref2VA는 최대 9장의 참조 이미지, 3개의 참조 비디오 클립, 3개의 오디오 클립까지 입력받아 총 12개 파일을 기반으로 네이티브 스테레오 오디오가 포함된 최대 2K 해상도의 4~15초 영상을 생성합니다. MiniMax H3 Community License가 적용되며, 모델 카드에서는 미국, EU, 영국, 대한민국 사용자가 먼저 신청서를 제출하도록 요구합니다. 따라서 모든 스튜디오가 즉시 도입할 수 있는 모델은 아닙니다.
Wan 2.1은 게이밍 노트북에서도 실행됩니다. 소형 버전은 8GB GPU로도 구동할 수 있습니다. 비디오 생성으로 프로토타입을 만들고 싶었지만 하드웨어 비용을 감당하기 어려웠다면 좋은 입문 경로입니다.
Wan 2.2(Alibaba, 2025년 7월)는 Mixture-of-Experts 설계를 기반으로 구축된 최초의 오픈 소스 비디오 모델입니다. 전체 매개변수는 27B지만 각 단계에서는 14B만 활성화됩니다. 텍스트-투-비디오(T2V-A14B), 이미지-투-비디오(I2V-A14B), 소비자용 GPU에서 실행되는 하이브리드 5B 버전으로 제공되며 모두 상업적으로 사용할 수 있는 Apache 2.0 라이선스를 따릅니다.
알아둘 만한 한 가지 주의점이 있습니다. Wan 2.2는 여전히 마지막 오픈 Wan 모델입니다. 이후 출시된 Wan 2.5(2025년 9월), 2.6(2025년 12월), 2.7(2026년 4월), 그리고 현재의 Wan 3.0(2026년 8월, Alibaba Cloud Model Studio에 따르면 최대 1080p의 30초 원테이크 클립과 참조 입력 지원)은 동기화 오디오, 1080p, 더 정밀한 프레임 제어를 추가했지만 모두 API 전용이며 공개 가중치가 없습니다. 제휴 사이트들의 주장과 관계없이, 2026년 9월 기준 Wan-AI Hugging Face 조직에 공개된 최신 버전은 여전히 2.2입니다. 자체 호스팅이 중요하다면 2.2가 한계입니다. 4K와 동기화 오디오가 필요하다면 오픈 모델인 LTX-2.5를 선택하는 편이 좋습니다.
합리적인 워크플로는 이렇습니다. 로컬 프로토타이핑에는 Mochi 1이나 Wan 2.1을 사용하고, 최종 품질이 필요할 때는 클라우드 GPU에서 HunyuanVideo-1.5나 LTX-2.5를 사용하세요.
이미지 생성
이미지 생성은 이미 오픈 소스가 승리한 분야입니다. 지금 다운로드할 수 있는 모델들은 실제로 Midjourney와 경쟁할 수 있습니다. “거의 비슷한 수준”이 아니라 진정으로 경쟁력 있는 수준입니다.
Apache 2.0 라이선스 모델이 생성한 FLUX.1 샘플과 포토리얼리스틱 품질
| 모델 | 개발사 | 출시 | 매개변수 | 주요 기능 | 라이선스 | 이미지당 비용 |
|---|---|---|---|---|---|---|
| FLUX.1 [schnell] | Black Forest Labs | 2024년 8월 | 12B | 4단계 고속 생성 | Apache 2.0 | ~$0.001 |
| FLUX.1 [dev] | Black Forest Labs | 2024년 8월 | 12B | Pro에 가까운 품질 | 비상업적 | ~$0.002 |
| SD 3.5 Large | Stability AI | 2024년 10월 | 8B | 텍스트 렌더링, 다양한 스타일 | Stability 라이선스 | ~$0.002 |
| SD 3.5 Large Turbo | Stability AI | 2024년 10월 | 8B | 4단계 고속 생성 | Stability 라이선스 | ~$0.001 |
| HiDream-I1 | HiDream.ai | 2025년 4월 | 17B | 고품질, Full/Dev/Fast 버전 | MIT | ~$0.002 |
| CogView4 | Tsinghua / Zhipu | 2025년 3월 | 6B | 네이티브 중국어 텍스트, 최대 2048px | Apache 2.0 | ~$0.002 |
| Qwen-Image | Alibaba | 2025년 8월 | 20B | 최고 수준의 텍스트 렌더링과 편집 | Apache 2.0 | ~$0.002 |
| FLUX.2 | Black Forest Labs | 2025년 11월 | 32B | 텍스트+편집, 4MP, 다중 참조 | dev: 비상업적 / klein 4B: Apache 2.0 | ~$0.003 |
| Ideogram 4.0 | Ideogram | 2026년 6월 | 9.3B | 디자인 작업, 텍스트 렌더링, JSON 레이아웃 제어 | 비상업적 | ~$0.002 |
직접 사용해 보기: FLUX.1 schnell 데모 ↗ · SD 3.5 Large 데모 ↗ · GitHub (FLUX) ↗
샘플 보기: FLUX 갤러리 ↗ · FLUX LoRA 갤러리 ↗ · Replicate 예시 ↗
게임 에셋 제작에 활용하기
**FLUX.1 [schnell]**은 꼭 알아둬야 할 모델입니다. Apache 2.0 라이선스이므로 라이선스 문제를 걱정하지 않고 상업용 게임을 출시할 수 있습니다. 단 4단계로 이미지를 생성하므로 빠르게 반복 작업할 수 있습니다. 원하는 결과를 설명하고, 결과를 확인한 뒤, 수정하고 다시 생성하면 됩니다.
SD 3.5 Large는 마침내 텍스트를 제대로 렌더링합니다. 이전 버전은 이미지에 포함하려는 텍스트를 제대로 표현하지 못했습니다. 이는 UI 목업, 게임 내 간판, 타이틀 화면처럼 이미지 안에 읽을 수 있는 문구가 필요한 모든 곳에서 중요합니다.
FLUX.2(Black Forest Labs, 2025년 11월)는 더 큰 후속 모델입니다. 하나의 체크포인트에서 텍스트-투-이미지와 이미지 편집을 모두 처리하는 32B 모델로, 강력한 다중 참조 캐릭터 및 스타일 일관성과 최대 4메가픽셀에서 안정적인 텍스트 렌더링을 제공합니다. 오픈 가중치 FLUX.2 [dev]는 비상업적 라이선스를 사용하지만, 크기를 줄인 FLUX.2 [klein](2026년 1월)의 4B 버전은 Apache 2.0으로 배포됩니다. 1초 이내에 이미지를 생성하고 약 8GB VRAM에서 실행할 수 있으므로 게임 아트를 출시할 때 사용할 수 있는 상업적으로 안전한 선택지가 여전히 존재합니다. 반드시 4B klein을 받으세요. 더 큰 klein 9B에는 비상업적 FLUX 라이선스가 적용됩니다. 양자화 파이프라인을 이용하면 [dev]를 18~24GB GPU에서도 실행할 수 있습니다. Black Forest Labs의 차세대 모델 FLUX 3는 이미지, 비디오, 오디오를 결합한 모델로 2026년 7월 23일 발표됐으며, 2026년 9월 현재 API로만 제공됩니다. 동기화 오디오가 포함된 비디오 기능은 8월 4일 프리뷰로 공개됐고, 오픈 가중치 FLUX 3 Dev는 BFL 릴리스 노트에 따르면 “2026년 후반 공개 예정”입니다. 공개되기 전까지는 klein 4B가 상업적으로 안전한 FLUX 모델입니다.
알아둘 만한 오픈 모델이 두 가지 더 있습니다. Chroma1-HD(8.9B, Apache 2.0)는 완전히 개방된 FLUX.1-schnell 파생 모델이므로 [dev] 라이선스 없이도 상업적으로 안전하게 FLUX 계열의 품질을 얻을 수 있습니다. OmniGen2(Apache 2.0)는 텍스트-투-이미지와 지시 기반 편집을 한곳에서 처리하는 통합 모델입니다. 처음부터 생성하기보다 기존 에셋을 반복 수정할 때(“검이 파란색으로 빛나게 만들어 줘”) 가장 빠른 방법입니다.
Qwen-Image(Alibaba, 2025년 8월)는 간판, UI, 포스터, 아이템 라벨처럼 읽을 수 있는 텍스트가 필요한 아트에 적합한 오픈 모델입니다. 최고 수준의 텍스트 렌더링과 강력한 지시 기반 편집 버전을 갖춘 20B Apache 2.0 모델입니다. 따라서 상업적으로 안전하며, 여전히 대부분의 이미지 모델이 어려워하는 작업에서 유난히 뛰어납니다. 2025년 12월 업데이트된 Qwen-Image-2512는 인물의 사실감과 텍스트 레이아웃을 개선하면서 Apache 2.0 라이선스를 유지했습니다. 자체 호스팅한다면 이 체크포인트를 받으세요. 더 최신 모델인 Qwen-Image-2.0(2026년 2월)은 API 전용입니다. 2026년 9월 기준 QwenLM 저장소에는 공개 가중치를 제공하는 최신 체크포인트로 여전히 Qwen-Image-2512와 Qwen-Image-Edit-2511이 기재되어 있습니다. Ideogram 4.0(2026년 6월)은 Ideogram이 처음으로 공개 가중치로 출시한 모델입니다. 디자인 작업용으로 구축된 93억 매개변수 확산 트랜스포머로, 뛰어난 다국어 텍스트 렌더링을 제공하며 구조화된 JSON 프롬프트를 통해 레이아웃과 색상을 명시적으로 제어할 수 있습니다. 다만 이를 기반으로 작업하기 전에 알아둘 점이 하나 있습니다. 추론 코드는 Apache 2.0이지만 가중치는 비상업적 라이선스로 제공되므로, 상업용 라이선스를 구매하지 않는 한 연구 및 프로토타이핑 도구로만 사용할 수 있습니다.
Stable Diffusion을 둘러싼 생태계는 여전히 타의 추종을 불허합니다. 정밀한 구도를 위한 ControlNet, 수정 작업을 위한 인페인팅, 커스텀 스타일을 위한 LoRA 파인튜닝이 있습니다. FLUX도 빠르게 따라잡고 있지만, 지금 당장 심층적인 커스터마이징이 필요하다면 성숙한 SD 도구 생태계가 더 많은 선택지를 제공합니다.
정리하면 이렇습니다. 텍스처와 스프라이트에는 어느 쪽이든 좋습니다. 특정 스타일이 필요한 콘셉트 아트에는 LoRA를 적용한 SD 3.5가 적합합니다. 상업용 출시에서 순수하게 품질을 중시한다면 FLUX schnell을 선택하세요.
3D 생성
게임에 단 3초 등장하는 소품 하나를 모델링하느라 8시간을 써본 적이 있다면, 이 섹션이 바로 여러분을 위한 내용입니다. 3D 생성은 이미 얼마 전부터 "흥미로운 연구" 단계를 넘어 실질적인 제작 도구가 되었고, 2026년 현재 공개 모델의 품질은 정말 뛰어납니다. 스케치 한 장에서 텍스처가 입혀진 메시까지 1분도 걸리지 않습니다.
이 페이지에서는 직접 호스팅할 수 있는 공개 모델을 다룹니다. 모델이 아니라 도구를 고르는 중이라면, 최고의 AI 3D 모델 생성기 가이드에서 호스팅형 옵션(Meshy, Tripo, Rodin, Hi3D)과 공개 모델을 비교하고 각각의 가격과 상업적 이용 권한을 설명합니다.
TRELLIS는 단일 이미지에서 PBR 재질이 적용된 텍스처 3D 메시를 생성합니다
| 모델 | 개발사 | 출시 | 핵심 기능 | 출력 | 메시당 비용 |
|---|---|---|---|---|---|
| TRELLIS.2-4B | Microsoft | 2025년 12월 | 40억 매개변수, 네이티브 PBR, 최대 1536³ | 노멀을 포함한 텍스처 메시 | ~$0.03 |
| Hunyuan3D 2.1 | Tencent | 2025년 6월 | 제작용 PBR, 전체 가중치 및 학습 코드 | 고품질 텍스처 메시 | ~$0.05 |
| SAM 3D | Meta | 2025년 11월 | 단일 이미지에서 3D 생성(사물 및 인체) | 사진 한 장으로 만든 메시 | ~$0.02 |
| Stable Fast 3D | Stability AI | 2024년 8월 | 단일 이미지 → 약 0.5초 만에 메시 | 빠른 텍스처 메시 | ~$0.001 |
| TripoSG | VAST-AI | 2025년 3월 | 15억 매개변수 정류 흐름 기반 형상 생성 | 고품질 메시 | ~$0.01 |
| TripoSR | Stability / Tripo | 2024년 | 빠른 단일 이미지 재구성 | 메시(텍스처 없음) | ~$0.001 |
| UniRig | Tsinghua / Tripo | 2025년 | 자동 리깅: 스켈레톤 및 스키닝 가중치 | 리깅 및 애니메이션 가능한 메시 | ~$0.01 |
직접 체험하기: TRELLIS.2 데모 ↗ · Hunyuan3D 데모 ↗ · InstantMesh 데모 ↗
샘플 보기: TRELLIS.2 프로젝트 페이지 ↗ · 3D AI Studio 갤러리 ↗
실제로 효과적인 워크플로
현재 크리에이터들에게 효과를 보이고 있는 방식은 여러 모델을 연계하는 것입니다. 생성한 이미지든 촬영한 이미지든 상관없이 이미지 한 장으로 시작하세요. Stable Zero123 또는 Wonder3D를 거쳐 여러 시점의 이미지를 얻습니다. 그 이미지들을 InstantMesh나 TripoSR에 입력해 메시를 만듭니다. 그런 다음 TRELLIS.2 또는 Hunyuan3D로 제대로 된 재질을 적용합니다.
Microsoft의 TRELLIS.2는 이제 제작용 에셋 분야의 새로운 선두 주자입니다. 얇은 표면, 구멍, 복잡한 토폴로지처럼 다른 모델이 어려워하는 지오메트리도 처리합니다. 40억 매개변수 버전은 재질처럼 보이게 꾸민 버텍스 컬러가 아니라 실제 PBR 텍스처가 적용된 메시를 출력합니다.
Stable Fast 3D의 강점은 속도입니다. 이미지에서 메시까지 약 0.5초면 됩니다. 메시 정리와 텍스처링은 필요하지만, 프로토타이핑에는 어떨까요? 몇 시간을 투자하기 전에 아이디어가 효과적인지 확인하려는 용도라면 타의 추종을 불허합니다. 단일 이미지에서 더 깔끔한 지오메트리를 원한다면 TripoSG가 한 단계 더 나은 선택입니다.
Hunyuan3D 2.1은 사용할 만한 Tencent 공개 모델입니다. 전체 가중치와 학습 코드를 제공하며 제작 수준의 PBR 텍스처링을 지원합니다. 이름 때문에 혼동하기 쉬우니 주의하세요. Hunyuan3D 2.5, 3.0, 3.1도 존재하지만 모두 API 전용이며 공개 가중치는 없습니다. 따라서 자체 호스팅이 가능한 기본 생성기는 여전히 2.1이 최신입니다(Tencent에 2.5의 오픈 소스 공개 계획을 문의한 GitHub 스레드는 2026년 9월 현재까지 답변을 받지 못했습니다). 직접 호스팅하는 대신 체험해 보고 싶다면, 브라우저에서 Hunyuan3D를 실행하는 3D 생성기를 이용하세요. Tencent는 2.1을 기반으로 한 유용한 확장 기능 두 가지도 공개했습니다. Hunyuan3D-Omni는 다중 조건 제어(포인트 클라우드, 복셀, 스켈레톤, 바운딩 박스)를 추가하며, Hunyuan3D-Part는 메시를 편집 가능한 파트로 분해합니다. 또한 해당 라이선스는 EU, 영국, 대한민국을 적용 대상에서 제외하므로, 이 지역에서 출시하기 전에 약관을 확인하세요.
SAM 3D(Meta, 2025년 11월)는 가장 새로운 접근 방식입니다. 사진 한 장을 3D 메시로 변환하며 사물과 인체에 각각 별도의 모델을 사용합니다. Meta의 세그멘테이션 기술과 결합하면 이미지 속 사물 하나를 분리해 해당 사물만 재구성할 수 있습니다.
UniRig(Tsinghua 및 Tripo, MIT)는 메시를 얻은 직후 모두가 마주치는 문제인 리깅을 해결합니다. 입력 메시를 위한 유효한 스켈레톤과 스키닝 가중치를 자동 생성하므로, 생성된 캐릭터를 정적인 소품으로 세워두는 대신 실제로 애니메이션화할 수 있습니다. NVIDIA의 SOMA-X 자동 애니메이션 기술과 결합하면 완전히 생성되고 완전히 리깅된 캐릭터가 더 이상 연구용 데모에 머물지 않습니다.
인디 크리에이터가 현실적으로 기대할 수 있는 워크플로는 다음과 같습니다. FLUX로 콘셉트 아트를 생성하고, InstantMesh를 거쳐 지오메트리를 만든 다음, Blender에서 텍스처링하거나 TRELLIS로 PBR을 자동 적용합니다. 에셋 하나당 4~8시간 대신 30~60분이면 됩니다. 시간이 전혀 들지 않는 것은 아니지만, 확실히 큰 차이입니다.
오디오 및 음악
오디오 생성은 아직 이미지와 동영상 수준을 따라잡지 못했습니다. 하지만 특히 프로토타이핑과 음향 효과 작업 방식을 바꿀 만큼은 충분히 발전했습니다.
AI로 생성한 음악 샘플. 원하는 분위기를 설명하면 그에 어울리는 음악을 얻을 수 있습니다
| 모델 | 개발사 | 출시 | 기능 | 라이선스 | 30초당 비용 |
|---|---|---|---|---|---|
| ACE-Step 1.5 | StepFun/ACE Studio | 2026년 1월 | 약 4분 길이의 음악을 빠르게 생성, 19개 언어, 음성 복제 | MIT | ~$0.02 |
| Stable Audio 3.0 | Stability AI | 2026년 5월 | 최대 약 6분 길이의 곡, 공개 Small, Small-SFX 및 Medium 모델 | Stability Community | ~$0.02 |
| YuE | MAP | 2025년 1월 | 가사에서 보컬과 반주가 포함된 전체 곡 생성 | Apache 2.0 | ~$0.05 |
| MusicGen | Meta | 2023년 | 텍스트로 제어 가능한 음악 생성 | 코드 MIT / 가중치 CC-BY-NC | ~$0.01 |
| DiffRhythm 2 | ASLP-lab | 2026년 2월 | 빠른 전체 곡 생성 | Apache 2.0 | ~$0.02 |
| Magenta RealTime | 2025년 6월 | 실시간 프롬프트 제어 음악 | 코드 Apache / 가중치 CC-BY | ~$0.02 |
직접 체험하기: MusicGen 데모 ↗ · AudioCraft 플레이그라운드 ↗
샘플 보기: MusicGen 예시 ↗ · AudioGen 샘플 ↗
실제 출시에 사용할 수 있는 것
Meta의 MusicGen은 여전히 게임 오디오 프로토타이핑에 실용적인 선택입니다. 원하는 분위기를 설명하면 그에 맞는 음악을 생성하며, 12GB GPU에서도 원활하게 실행됩니다. 다만 라이선스에 주의할 점이 있습니다. MusicGen 코드는 MIT이지만 모델 가중치는 CC-BY-NC(비상업적 이용)입니다. 따라서 프로토타입 제작에 사용하고, 실제 출시작에는 ACE-Step이나 Stable Audio처럼 상업적 라이선스를 제공하는 모델로 전환하세요.
**Stable Audio의 공개 음향 효과 모델(Small-SFX)**은 발소리, 문 삐걱이는 소리, 주변의 바람 소리, 기계음을 처리하고 로컬에서 실행되며 Stability의 커뮤니티 라이선스로 제공됩니다. 실제로 상업적으로 사용할 수 있는 사운드가 필요할 때 선택할 만한 공개 SFX 모델입니다. 다른 공개 SFX 모델에는 제약이 있기 때문에 이 모델이 적합합니다. Meta의 AudioGen은 CC-BY-NC이고 TangoFlux는 Stability의 비상업적 커뮤니티 라이선스로 제공되므로, 둘 다 출시할 게임이 아니라 프로토타입에만 사용할 수 있습니다.
Magenta RealTime(Google)은 가장 좋은 의미에서 독특한 모델입니다. 실시간으로 계속 프롬프트를 조정하며 음악을 제어할 수 있도록 제작된 유일한 공개 가중치 모델입니다. 완성된 트랙을 렌더링하는 대신 음악을 실시간으로 생성하고 재생 중에도 방향을 조절할 수 있습니다. 플레이어의 행동에 따라 변화하는 적응형 게임 사운드트랙에 정확히 들어맞는 방식입니다. 코드는 Apache 2.0, 가중치는 CC-BY이며 둘 다 상업적으로 사용할 수 있습니다.
YuE는 정말 흥미로운 모델입니다. 보컬이 포함된 전체 곡을 생성하는 최초의 공개 모델입니다. 테마곡이나 실제 노래가 들어간 배경 음악을 만들 수 있습니다. 품질에는 편차가 있지만 직접 다운로드해 실행할 수 있는 다른 어떤 모델보다 훨씬 앞서 있습니다.
ACE-Step은 지금 알아둘 만한 공개 음악 모델이며, 빠르게 발전해 왔습니다. 1.5 계열(2026년 1월 출시, 더 큰 5B XL 변형 포함)은 2025년 5월의 최초 버전을 대체했으며 현재 MIT 라이선스로 제공됩니다. 몇 분 길이의 음악을 빠르게 생성하고 19개 언어를 지원하며 음성 복제, 리믹스, 가사 편집도 처리합니다. 게임 프로토타이핑에서 YuE와 MusicGen이 남긴 많은 공백을 메워줍니다.
Stable Audio 3.0(2026년 5월)은 사운드 분야에서 더 큰 업데이트입니다. 최대 약 6분 길이의 곡을 생성할 수 있으며, Stability는 네 가지 변형 가운데 세 가지의 가중치를 공개했습니다. Small과 음향 효과 전용 모델인 Small-SFX는 모두 기기에서 실행되며, Medium은 더 나은 음악적 구조와 전체 트랙 길이를 지원합니다. Large 모델만 API 전용으로 남았습니다. Small-SFX는 현재 게임 SFX에 특화된 가장 강력한 공개 옵션입니다. 세 공개 모델은 Stability AI Community License로 제공됩니다. 이 라이선스는 생성 결과를 사용하고 판매할 수 있도록 허용하며, 연 매출이 $1M을 넘는 기업에는 Enterprise License가 적용됩니다. 자세한 내용은 Stability의 발표를 참고하세요. 전체 모델군은 라이선스를 취득한 데이터로 학습되었으므로, 학습 데이터 관련 소송이 해결되지 않은 음악 생성기보다 법적 기반이 더 명확합니다.
솔직히 말하면 공개 모델과 비공개 모델(Suno, Udio)의 격차는 줄고 있지만, 전체 보컬 곡에서는 여전히 분명한 차이가 있습니다. 또한 이러한 비공개 도구들도 학습 데이터와 관련해 해결되지 않은 소송을 안고 있습니다. 음향 효과에서는 공개 모델, 특히 Stable Audio의 SFX 모델이 충분히 경쟁력 있습니다. 출시작에 사용할 곡이라면 많은 반복 작업을 예상해야 하며, 최종 제작에는 음악가를 참여시키고 나머지 작업에 이러한 도구를 사용하는 편이 좋습니다.
음성 및 보이스
음성 생성은 이제 "게임에 쓸 만한 수준"을 훨씬 넘어섰으며, 덕분에 소규모 팀이 구현할 수 있는 범위도 달라졌습니다.
자연스러운 말투와 적절한 속도, 감정을 갖춘 AI 생성 게임 내레이션
| 모델 | 개발사 | 출시 | 핵심 기능 | 라이선스 | 분당 비용 |
|---|---|---|---|---|---|
| Qwen3-TTS | Alibaba | 2026년 1월 | 3초 음성 복제, 음성 디자인, 10개 언어 | Apache 2.0 | ~$0.002 |
| Chatterbox | Resemble AI | 2025년 | 감정 제어, 약 5초 분량으로 복제, 23개 언어 | MIT | ~$0.003 |
| CSM | Sesame AI | 2025년 3월 | 대화 흐름, 자연스러운 쉼 | Apache 2.0 | ~$0.005 |
| Fish Speech 1.5 | Fish Audio | 2024년 | 10~30초 분량으로 제로샷 복제 | 코드 Apache / 가중치 CC-BY-NC-SA | ~$0.002 |
| OpenVoice V2 | MyShell/MIT | 2024년 4월 | 감정 및 억양 제어 | MIT | ~$0.003 |
| XTTS-v2 | Coqui(커뮤니티) | 2024년 | 17개 언어, 음성 복제 | CPML(비상업적) | ~$0.005 |
샘플 듣기: Fish Audio 음성 ↗ · OpenVoice 데모 ↗
NPC가 사람처럼 말하게 만들기
Sesame의 **CSM(Conversational Speech Model)**은 대화를 위해 특별히 제작되었습니다. 자연스럽게 쉬어 말하고, 억양이 변화하며, 실제 대화의 리듬을 구현합니다. 대부분의 TTS는 누군가 대본을 읽는 것처럼 들리고, 그 차이는 즉시 알아챌 수 있습니다. CSM은 누군가 실제로 말하는 것처럼 들립니다. 이 차이는 생각보다 훨씬 중요합니다.
Qwen3-TTS(Alibaba, 2026년 1월)는 상업 프로젝트에서 우선 고려할 모델입니다. 전체 모델군이 Apache 2.0으로 제공되며, 약 3초 분량의 참조 오디오로 음성을 복제하고 10개 언어를 구사합니다. 또한 설명 기반 음성 디자인을 지원하므로 참조 녹음을 찾아다니는 대신 일반 텍스트로 NPC 음성을 지정할 수 있습니다. 0.6B 및 1.7B 모델은 비교적 사양이 낮은 하드웨어에서도 실행됩니다. Chatterbox(Resemble AI)는 감정 표현이 풍부한 음성을 위한 선택지이며, MIT 라이선스라 실제 제품에도 사용할 수 있습니다. 약 5초 분량의 샘플로 음성을 복제하고, 200ms 미만의 지연 시간으로 작동하며, 23개 언어를 지원합니다. 또한 감정 과장 제어 기능을 갖춘 최초의 오픈 모델이라 NPC가 무미건조한 목소리 대신 실제로 화나거나 겁먹은 것처럼 말하게 할 수 있습니다. Apache-2.0 기반의 다른 두 옵션은 특정 용도에 적합합니다. Orpheus(Canopy)는 <laugh>, <sigh> 같은 인라인 감정 태그를 지원해 NPC의 짧은 대사에 자연스럽게 매핑할 수 있고, 저사양 하드웨어용 150M 모델도 제공합니다. Dia(Nari Labs)는 한 번의 처리로 기침이나 웃음 같은 비언어적 소리를 포함한 다중 화자 대화를 생성하도록 설계되었습니다. Mistral의 Voxtral TTS(2026년 3월)는 음성 에이전트를 겨냥한 최신 오픈 가중치 모델로, 자세한 내용은 Mistral 뉴스 페이지에서 확인할 수 있습니다. 단, 출시 전에 라이선스를 확인하세요.
Fish Speech와 OpenVoice는 음성 복제를 지원합니다. 성우의 음성을 10~30초 녹음한 뒤, 그 목소리로 대사를 무제한 생성할 수 있습니다. 이것이 무엇을 의미하는지 생각해 보세요. 핵심 대사에는 성우를 고용하고, 이후 그 연기를 확장해 수백 가지 변형과 주변 대사를 만들 수 있습니다. Fish Speech의 라이선스에는 주의할 점이 하나 있습니다. 코드는 오픈이지만 1.5 가중치는 CC-BY-NC-SA이므로 프로토타이핑 용도로만 적합합니다. 출시할 게임에는 대신 OpenVoice(MIT)나 Qwen3-TTS(Apache 2.0)를 사용하세요.
NVIDIA ACE는 완전히 오픈되지는 않았지만 알아둘 가치가 있으며, 이제 온디바이스 NPC 배포에 Qwen3-8B를 지원합니다. 로컬 LLM, 로컬 TTS, 립싱크가 모두 소비자용 GPU에서 실행됩니다. 클라우드 호출 없이 실시간 NPC 대화를 구현할 때 적합한 스택입니다.
인디 크리에이터에게 적합한 접근 방식은 다음과 같습니다. 주인공과 가장 중요한 대사에는 성우를 고용하세요. 주변 대화, 변형 대사, 그리고 비용 문제로 음성 없이 처리했을 수많은 부수적 대사의 범위는 Qwen3-TTS나 OpenVoice로 확장하세요.
월드 모델과 게임 시뮬레이션
이 분야는 정말 기묘하면서도 진정으로 흥미롭습니다. 이 모델들은 정적인 에셋을 생성하지 않습니다. 게임처럼 느껴지는 경험 자체를 생성합니다.
🎮 Oasis 플레이하기: AI로 생성된 마인크래프트게임 엔진 없이 AI 예측만으로 구현하는 실시간 월드 생성
| 모델 | 조직 | 출시 | 기능 | 상태 | 프레임당 비용 |
|---|---|---|---|---|---|
| DIAMOND | 연구 | 2024년 | 확산 월드 모델, Atari 시뮬레이션 | 오픈 가중치 | ~$0.001 |
| Oasis | Decart/Etched | 2024년 10월 | 실시간 마인크래프트 생성 | 500M 가중치 공개 | ~$0.002 |
| MineWorld | Microsoft | 2025년 4월 | 실시간 마인크래프트, Oasis의 오픈 대안 | MIT | ~$0.002 |
| Hunyuan-GameCraft | Tencent | 2025년 8월 | 인터랙티브 게임 영상, 키보드/마우스 제어 | Tencent Community | ~$0.005 |
| GameGen-X | 연구 | 2024년 | 오픈 월드 영상 생성 | 오픈 코드 + 데이터 세트 | ~$0.005 |
| NVIDIA Cosmos | NVIDIA | 2025년 10월 | 물리 AI 시뮬레이션(Predict2.5) | NVIDIA Open Model License | ~$0.01 |
| Matrix-Game 3.0 | Skywork | 2026년 3월 | 실시간 720p 인터랙티브 월드, 장기 기억 | 오픈 가중치 | ~$0.005 |
| Genie 2 | DeepMind | 2024년 12월 | 이미지로부터 인터랙티브 3D 생성 | 미공개 | 해당 없음 |
| Genie 3 | DeepMind | 2025년 8월 | 실시간 720p 월드, 프롬프트로 이벤트 제어 | 비공개(Project Genie) | 해당 없음 |
연구 자료 보기: DIAMOND 프로젝트 페이지 ↗ · Cosmos 블로그 ↗
직접 사용해 보기: Oasis 라이브 데모 ↗ · Genie 2 예시 ↗
이 분야에 주목해야 하는 이유
DIAMOND는 게임 AI를 바라보는 관점을 바꿀 만한 사실을 입증했습니다. 생성된 월드 안에서만 에이전트를 훈련할 수 있다는 것입니다. 훈련에 실제 게임 엔진이 필요하지 않습니다. AI가 확산 모델의 상상 속에서 플레이한 다음, 학습한 내용을 실제 게임으로 이전합니다. 이는 상당한 의미를 지닙니다.
Oasis는 마인크래프트와 유사한 월드를 프레임 단위로 실시간 실행합니다. 게임 엔진도, 텍스처도, 사전 제작된 에셋도 없습니다. 다음에 올 장면을 예측하는 트랜스포머만 있을 뿐입니다. 아직 개념 증명 단계지만, 이 기술이 어디까지 발전할지 상상해 보세요. 500M 파라미터 버전은 이미 공개되었습니다.
GameGen-X는 오픈 월드 게임 영상 분야에서 가장 큰 데이터 세트를 공개했습니다. 자체 모델을 훈련하거나 기존 모델을 파인튜닝해 게임 같은 콘텐츠를 생성하려는 경우, 이 데이터 세트가 출발점이 됩니다.
NVIDIA Cosmos는 로보틱스와 자율주행차용으로 개발되었지만, 그 기반 월드 모델은 게임에도 활용할 수 있습니다. 물리 법칙, 대상 영속성, 공간 관계를 이해합니다. 현재 공개된 모델 계열은 2025년 10월 NVIDIA Open Model License로 출시된 Cosmos-Predict2.5이며, 상업적 사용과 파생물 제작이 허용됩니다.
Hunyuan-GameCraft(Tencent, 2025년 8월)는 가장 직접적으로 게임에 초점을 맞춘 오픈 월드 모델입니다. 100개 이상의 AAA 게임에서 수집한 100만 개 이상의 플레이 녹화본으로 훈련되었으며, 키보드와 마우스 입력을 공통 제어 공간으로 통합합니다. 따라서 단순히 시청하는 영상이 아니라 실제로 조작할 수 있는 인터랙티브 게임 영상을 생성합니다. Hunyuan3D와 동일한 Tencent Community License가 적용되며 EU, 영국, 대한민국은 사용 지역에서 제외되므로 해당 지역에 출시하기 전에 약관을 확인하세요. MineWorld(Microsoft, MIT)는 Oasis에 대응하는 완전한 허용형 모델입니다. 다운로드해 게임 엔진 없이 실행할 수 있는 실시간 마인크래프트 월드 모델입니다.
Genie 3(DeepMind, 2025년 8월 발표)는 주목할 만한 도약입니다. 실시간 상호작용을 지원하는 최초의 월드 모델로, 24fps의 탐색 가능한 720p 월드를 생성하고 몇 분 동안 일관성을 유지합니다. 또한 명령에 따라 날씨를 바꾸거나 객체를 추가하는 '프롬프트 가능한 월드 이벤트'도 지원합니다. 2026년 1월에는 미국의 Google AI Ultra 구독자를 대상으로 Project Genie라는 이름으로 공개되었습니다. 가중치는 여전히 비공개지만, 플레이 가능한 생성형 월드가 어디로 향하고 있는지 보여줍니다.
Matrix-Game 3.0(Skywork, 2026년 3월)은 Genie에 대한 오픈 대안입니다. 메모리로 강화된 인터랙티브 월드 모델로, 720p 영상을 실시간 40fps로 스트리밍하며 1분 길이의 시퀀스에서도 장면의 일관성을 유지합니다. 5B 증류 버전은 실시간 추론을 처리하고, 더 큰 2x14B MoE 버전은 품질을 높입니다. 가중치는 Apache 2.0으로 Hugging Face에 공개되어 있습니다. DeepMind를 기다리지 않고 지금 당장 플레이 가능한 생성형 월드를 실험하려면 실제로 다운로드할 수 있는 이 모델이 적합합니다.
현재 실용적인 게임 개발 관점에서 보면 이들은 여전히 연구 도구입니다. 하지만 AI 기반 콘텐츠나 절차적 생성에 관심이 있거나, 이 모든 기술이 어디로 향하는지 고민하고 있다면 바로 이곳이 최전선입니다.
대규모 언어 모델
LLM은 대화, 퀘스트 생성, 게임 로직을 구동합니다. 이제 오픈 모델들도 실제로 GPT-4와 경쟁합니다. 2년 전에는 그렇지 않았습니다.
| 모델 | 조직 | 출시 | 크기 | 가장 적합한 용도 | 라이선스 | 1K 토큰당 비용 |
|---|---|---|---|---|---|---|
| DeepSeek-V3 | DeepSeek | 2024년 12월 | 671B MoE(37B 활성) | 추론, 범용 | 허용형 | ~$0.02 |
| DeepSeek-R1 | DeepSeek | 2025년 1월 | V3 기반 | 사고 연쇄 | 허용형 | ~$0.03 |
| DeepSeek-V3.2 | DeepSeek | 2025년 12월 | 희소 어텐션(DSA) | 추론 + 도구 사용 | MIT | ~$0.02 |
| DeepSeek-V4 | DeepSeek | 2026년 4월 | 1.6T MoE(49B 활성) | 최첨단 추론, 1M 컨텍스트 | MIT | ~$0.02 |
| GLM-5 | Zhipu / Z.ai | 2026년 2월 | 744B MoE(40B 활성) | 코딩, 에이전트 작업, 도구 사용 | MIT | ~$0.02 |
| GLM-5.2 | Zhipu / Z.ai | 2026년 6월 | 753B MoE | 코딩, 에이전트, 1M 컨텍스트 | MIT | ~$0.02 |
| GPT-OSS | OpenAI | 2025년 8월 | 120B / 20B MoE | 추론, 도구 사용, 온디바이스 | Apache 2.0 | ~$0.01 |
| Kimi K2 | Moonshot | 2025년 | 1T MoE(32B 활성) | 에이전트 작업, 코딩 | 수정된 MIT | ~$0.02 |
| Kimi K3 | Moonshot | 2026년 7월 | 2.8T MoE(896개 전문가 중 16개 활성) | 최첨단 에이전트 작업, 코딩, 1M 컨텍스트, 비전 | Kimi K3 License | ~$0.03 |
| Hy3 | Tencent | 2026년 7월 | 295B MoE(21B 활성) | 추론, 에이전트 코딩, 256K 컨텍스트 | Apache 2.0 | ~$0.02 |
| Gemma 3 | 2025년 | 1B-27B | 온디바이스, 140개 언어, 비전 | Gemma | ~$0.01 | |
| Gemma 4 | 2026년 4월 | E2B~31B(26B-A4B MoE) | 온디바이스, 140개 이상 언어, 비전 + 오디오, 256K | Apache 2.0 | ~$0.01 | |
| Qwen3 | Alibaba | 2025년 | 235B MoE(22B 활성) | 다국어, 코드 | Apache 2.0 | ~$0.01 |
| Qwen3.5 / 3.6 / 3.8 | Alibaba | 2026년 2월~8월 | 0.8B~2.4T-A95B | 멀티모달, 에이전트 작업, Qwen-Max급 오픈 플래그십 | Apache 2.0 | ~$0.02 |
| Mistral Small 4 | Mistral | 2026년 3월 | 119B MoE(6B 활성) | 추론 + 비전 + 에이전트 코딩, 256K | Apache 2.0 | ~$0.01 |
| Qwen3-Coder | Alibaba | 2025년 | 480B MoE(35B 활성) | 에이전트 코딩, 256K 컨텍스트 | Apache 2.0 | ~$0.02 |
| Llama 4 | Meta | 2025년 | 다양함 | 에이전트, 최대 10M 컨텍스트 | Llama Community | ~$0.01 |
| Muse Glimmer 30B | Meta | 2026년 8월 | 약 30B 밀집형 | 온디바이스 에이전트, 비전, 128K 이상 컨텍스트 | Apache 2.0 | ~$0.01 |
| Qwen3-VL | Alibaba | 2025년 | 2B-235B | 비전 + 언어 | Apache 2.0 | ~$0.02 |
| InternVL3 | Shanghai AI Lab | 2025년 | 1B-78B | 비전, OCR, UI 그라운딩 | MIT | ~$0.02 |
시작하기: Hugging Face의 Qwen3-8B ↗ · Hugging Face의 DeepSeek-V3 ↗ · Hugging Face의 GLM-5 ↗
게임 제작용
Qwen3는 대부분의 게임 용도에 적합한 실용적인 선택입니다. Apache 2.0 라이선스이므로 통합 결과물을 직접 소유할 수 있습니다. 현지화를 고려할 때 중요한 강력한 다국어 지원을 제공하며, 구조화된 지시를 잘 따릅니다. 7B와 14B 모델은 소비자용 GPU에서 로컬로 실행할 수 있습니다.
Qwen3.5, 3.6, 3.8은 2026년 내내 Apache 2.0 계열을 이어갔습니다. Qwen3.5(2026년 2월 16일)는 397B-A17B MoE로 먼저 출시된 후 밀집형 27B, 9B, 4B 모델이 추가되었습니다. Qwen3.6(4월)는 같은 모델군의 안정성을 조정했으며, 그중 35B-A3B는 로컬 실행에 가장 균형 잡힌 선택입니다. 35B 규모의 지식을 갖추면서도 토큰당 3B만 활성화되므로 단일 24GB 카드에서도 빠르게 작동합니다. Qwen3.8(2026년 8월 12~14일)은 대형 모델입니다. Qwen3.8 저장소에서는 이를 오픈으로 출시된 최초의 Qwen-Max급 모델로 설명합니다. 2.4T-A95B 플래그십과 밀집형 27B 모델로 구성되며, 둘 다 Apache 2.0 라이선스와 262K 컨텍스트를 제공합니다.
DeepSeek-V3는 대부분의 벤치마크에서 GPT-4와 대등하거나 더 뛰어난 성능을 보입니다. 아키텍처도 영리합니다. 전체 파라미터는 671B지만 토큰당 37B만 활성화됩니다. 상당한 하드웨어가 필요하지만(멀티 GPU), API에 의존하지 않고도 최첨단 수준의 품질을 얻을 수 있습니다.
DeepSeek-V3.2(2025년 12월)는 추론과 도구 사용을 하나의 모델에 통합하고, 더 저렴한 장문 컨텍스트 추론을 위해 DeepSeek Sparse Attention(DSA)을 도입했습니다. 또한 최고 수준의 추론 벤치마크를 겨냥한 고연산 Speciale 모델도 제공합니다. 게임 로직과 대화 용도로는 V3보다 강력하고 에이전트 역량도 뛰어난 대체 모델입니다.
DeepSeek-V4(2026년 4월)는 오픈 모델의 최전선을 다시 한 번 끌어올렸습니다. V4-Pro는 1.6T 파라미터의 MoE로, 토큰당 49B만 활성화되며 100만 토큰 컨텍스트 창과 선택 가능한 추론 모드를 모두 MIT 라이선스로 제공합니다. V4-Flash 모델(전체 284B, 활성 13B)은 전체 GPU 클러스터가 필요하지 않은 규모에서 1M 컨텍스트를 유지합니다. 오늘날 복잡한 퀘스트 로직이나 긴 게임 상태 컨텍스트에 사용할 오픈 모델을 고른다면 이 모델이 최고 성능의 기준입니다.
GLM-5(Zhipu AI, 2026년 2월)는 코딩과 에이전트 작업에서 가장 강력한 오픈 모델이며, GLM-5.2 업데이트를 통해 도구 사용과 장기 계획 점수가 비공개 최첨단 모델에 근접했습니다. 744B 파라미터의 MoE로 토큰당 40B가 활성화되며, 200K 토큰 컨텍스트와 MIT 라이선스를 제공합니다. GLM-5.2는 2026년 6월 17일 1M 토큰 컨텍스트를 지원하는 753B MoE로 출시되었으며, 여전히 지역 제한 없는 MIT 라이선스입니다. 이후 같은 기반 모델을 후처리 훈련한 GLM-5.3이 출시되었고, 가중치는 Hugging Face에 공개되었습니다. 다만 MIT가 아닌 Z.ai 자체 GLM-5.3 라이선스가 적용되므로 최신 모델을 직접 호스팅하려면 해당 내용을 확인하세요. Z.ai는 증시에 상장된 최초의 기반 모델 기업이며, 호스팅 API의 가격도 공격적으로 책정합니다(입력 토큰 100만 개당 약 $1.40). 직접 호스팅하고 싶다면 가중치를 Hugging Face에서 받을 수 있습니다. 게임이 퀘스트 스크립팅, 도구 호출 에이전트, 코드 기반 시스템에 LLM을 활용한다면 GLM-5는 완전히 직접 제어할 수 있는 강력한 OpenAI 대안입니다. GPT-OSS(OpenAI, 2025년 8월)는 OpenAI가 처음 공개한 오픈 웨이트 모델로, 이 가이드의 주제에 정확히 부합합니다. gpt-oss-120b 모델은 단일 80GB GPU에서 대략 o4-mini 수준으로 추론하고 도구를 호출하며, gpt-oss-20b는 16GB 소비자용 그래픽 카드에서 실행됩니다. 둘 다 Apache 2.0 라이선스입니다. NPC 로직이나 도구를 사용하는 에이전트를 위해 직접 호스팅할 수 있는 서구권 연구소의 모델을 원한다면 이 모델이 적합합니다.
Kimi K2(Moonshot)는 GLM-5 및 DeepSeek와 어깨를 나란히 하는 또 하나의 강력한 오픈 에이전트 모델입니다. 총 1조 개의 매개변수 중 32B가 활성화되는 MoE로, 코딩과 도구 사용에 집중적으로 튜닝되었습니다. Modified MIT 라이선스는 월간 사용자 1억 명 이상일 때만 추가 제한을 두므로, 인디 개발자에게는 사실상 MIT 라이선스와 같습니다. 에이전트가 여러 단계에 걸쳐 계획해야 할 때 선택하세요.
Kimi K3(Moonshot, 2026년 7월)는 지금까지 발표된 오픈 웨이트 모델 중 가장 크며, 이전의 어떤 오픈 모델보다 폐쇄형 프런티어 모델에 가까이 다가갔습니다. 총 2.8조 개의 매개변수 중 토큰당 약 50B만 활성화되는 MoE(896개 전문가 중 16개)이며, 1M 토큰 컨텍스트와 네이티브 비전 기능을 갖췄습니다. Kimi Delta Attention과 Attention Residuals라는 두 가지 새로운 어텐션 설계를 기반으로 제작되었습니다. Moonshot이 7월에 공개한 벤치마크에서는 당시의 Claude Opus와 GPT-5.5보다 코딩 및 에이전트 작업에서 앞섰고, 최상위 독점 모델에만 뒤처졌습니다. 다만 9월에 Claude Fable 5.1과 GPT-6 Astra가 출시되며 이 목표점도 다시 높아졌습니다. 웨이트는 2026년 7월 27일 MXFP4 형식으로 Hugging Face에 공개되었으며, MIT가 아닌 Kimi K3 License가 적용됩니다. 대부분의 용도에는 관대한 라이선스지만, 12개월 동안 매출이 $2,000만을 넘는 서비스형 모델 사업은 Moonshot과 별도 계약을 맺어야 합니다. 또한 월간 사용자 1억 명 또는 월 매출 $2,000만을 넘는 제품은 인터페이스에 "Kimi K3"를 표시해야 합니다. 2.8T 모델을 직접 호스팅하려면 여전히 다중 노드 GPU 클러스터가 필요하므로, 대부분의 팀은 입력 토큰 100만 개당 $3, 출력 토큰 100만 개당 $15인 API를 통해 이용하게 될 것입니다. 실제로 직접 실행할 수 있는 에이전트에는 여전히 K2가 실용적인 Moonshot 모델이지만, K3는 최상위권에서 "오픈"이 의미할 수 있는 범위를 새롭게 정의합니다.
Gemma 3(Google)는 플레이어의 하드웨어에서 실행하거나 다양한 언어로 폭넓게 현지화해야 할 때 가장 적합합니다. 1B, 4B, 12B, 27B 크기로 제공되어 8GB 그래픽 카드부터 실행할 수 있고, 140개 언어와 함수 호출을 지원합니다. 4B 이상 모델은 이미지도 인식하므로 소형 비전 모델로도 활용할 수 있습니다. Gemma 라이선스는 상업적 사용을 허용합니다.
Gemma 4(Google, 2026년 4월 2일)는 신규 프로젝트에서 Gemma 3를 대체하며, 라이선스 문제도 명확히 해결했습니다. 모델 카드에 따르면 전체 제품군에 Apache 2.0이 적용됩니다. 휴대폰과 노트북용 E2B 및 E4B, 12B, 활성 매개변수가 4B 미만인 26B-A4B MoE, 그리고 밀집형 31B 모델로 제공됩니다. 소형 모델은 128K, 나머지는 256K 컨텍스트를 지원하며, 모든 크기에서 네이티브 이미지 입력을, 소형 모델에서는 오디오 입력도 지원합니다. 또한 140개 이상의 언어를 처리합니다. 스크린샷까지 확인해야 하는 온디바이스 NPC 두뇌에는 26B-A4B가 가장 적합합니다.
Meta의 Llama 계열은 사실상 중단된 상태입니다. Llama 4(2025년 4월)가 여전히 마지막 Llama이며, 2026년 4월 Meta Superintelligence Labs는 후속 모델 Muse Spark를 폐쇄형으로 출시했습니다. Meta는 2026년 8월 Muse Glimmer 30B를 공개하며 어느 정도 오픈 모델로 돌아왔습니다. 이 모델은 약 30B 규모의 밀집형 멀티모달 모델로, Apache 2.0 라이선스와 128K 이상의 컨텍스트를 제공하며 24GB 그래픽 카드에 들어가는 4비트 빌드도 있습니다. 강력한 로컬 에이전트 모델이지만 Llama 5를 기다리고 있었다면 이제 그만 기다리고 Qwen, Gemma 4 또는 Glimmer 중에서 선택하세요.
Hy3(Tencent, 2026년 7월)는 또 하나의 대형 Apache 2.0 모델입니다. 모델 카드에 따르면 총 295B 중 21B가 활성화되는 MoE이며, 256K 컨텍스트를 제공합니다. 7월 릴리스에서는 4월 프리뷰에 있던 지역 제한이 제거되었으므로 Tencent의 Hunyuan3D 및 GameCraft 라이선스와 달리 EU, 영국, 한국에서도 사용할 수 있습니다.
Qwen3-Coder(Alibaba)는 전용 오픈 코딩 모델로, 대부분의 용도에서 이전 DeepSeek-Coder 계열을 대체합니다. 총 480B 중 35B가 활성화되는 MoE이며, 네이티브 256K 컨텍스트를 제공하고 1M까지 확장할 수 있습니다. Apache 2.0 라이선스이며 에이전트 코딩 벤치마크에서 Claude-Sonnet급 성능을 냅니다. 게임에서 코드를 생성하거나 실행한다면 이 모델이 오픈 모델의 최고점입니다. 유럽의 Mistral 제품군도 직접 호스팅하기 좋은 탄탄한 대안입니다. 코딩에는 Devstral이 적합하며, Mistral Small 4(2026년 3월 16일)는 총 119B 중 6B가 활성화되는 MoE로, 추론·비전·에이전트 코딩을 256K 컨텍스트의 단일 Apache 2.0 모델에 통합했습니다.
Qwen3-VL은 비전 이해 기능을 추가하며, Apache 2.0 라이선스로 2B부터 235B까지 밀집형 및 MoE 모델을 제공합니다. 스크린샷을 분석하거나, 플레이어가 그린 콘텐츠를 이해하거나, 카메라 입력을 처리해야 하는 게임에 유용합니다. 8B 모델은 단일 GPU에서 실행됩니다. InternVL3(Shanghai AI Lab, MIT)는 또 하나의 강력한 오픈 비전 언어 모델로, 특히 OCR과 UI 그라운딩에 뛰어납니다. 게임 인터페이스를 읽어야 하는 도구에 중요한 특성입니다. Mistral의 Pixtral 12B(Apache 2.0)는 더 가볍고 상업적으로 안전한 선택입니다.
클라우드 호출 없이 플레이어의 하드웨어에서 실시간으로 응답하는 온디바이스 NPC에는 현재 NVIDIA ACE를 통한 Qwen3-8B가 가장 실용적인 경로입니다. 플레이어의 하드웨어에서 게임과 함께 실행됩니다.
유틸리티 모델
이 모델들은 콘텐츠를 직접 생성하지는 않지만, 제작 파이프라인이 작동하도록 해줍니다.
SAM 2는 이미지와 영상 속 모든 객체를 분리합니다. 한 번 클릭하면 완벽한 마스크를 얻을 수 있습니다
| 모델 | 조직 | 출시 | 기능 |
|---|---|---|---|
| SAM 2 | Meta | 2024년 8월 | 이미지와 영상 속 모든 객체 분리 |
| Depth Pro | Apple | 2024년 10월 | 단일 이미지에서 미터법 깊이 추출 |
| gsplat | Nerfstudio | 2024년 이후 | CUDA 가속 가우시안 스플래팅 |
SAM 2는 영상 속 객체를 실시간으로 분리합니다. 무언가를 클릭하면 완벽한 마스크를 얻을 수 있습니다. 로토스코핑, 합성 또는 영상에서 객체를 추출해 게임 에셋으로 사용하는 데 유용합니다. SAM 2 사용해 보기 ↗
Apple의 Depth Pro는 단일 이미지에서 1초 이내에 미터법 깊이 맵을 생성합니다. 이를 통해 2D 아트를 패럴랙스 효과가 있는 2.5D로 변환하고, 3D 재구성을 위한 깊이 데이터를 생성하며, 평면 이미지에서 노멀 맵을 만드는 등 다양한 작업이 가능해집니다. HuggingFace의 Depth Pro ↗
gsplat은 가우시안 스플래팅의 고속 구현체입니다. 포토그래메트리든 환경 스캔이든 게임용 실제 환경을 캡처한다면, 이를 실용적으로 만들어 주는 라이브러리입니다.
실제로 사용한다면
오늘 게임 프로젝트를 시작한다면 다음과 같은 스택이 합리적입니다.
텍스처 및 스프라이트: FLUX.1 [schnell], Apache 2.0, 빠른 반복 작업, 출시 가능한 품질
콘셉트 아트: 스타일 제어를 위한 LoRA와 SD 3.5 Large
3D 에셋: 텍스처 메시에는 Hunyuan3D 2.1 또는 TRELLIS.2, 사진에서 시작할 때는 SAM 3D, 이후 정리 작업에는 Blender
자동 리깅: Mixamo에 의존하는 대신 UniRig 또는 NVIDIA SOMA-X로 생성된 메시에 스켈레톤과 스킨 적용(둘 다 오픈)
음향 효과: Stable Audio의 오픈 Small-SFX 모델, 로컬 실행, 상업적 이용 가능
음악: 프로토타입에는 ACE-Step, 최종 제작에는 작곡가 참여
음성: 음성 복제와 주변 대사에는 Qwen3-TTS(Apache 2.0), 실제 감정 표현이 필요한 대사에는 Chatterbox(MIT), 중요한 대사에는 성우
NPC 대화: 로컬에서는 Qwen3.6-35B-A3B, Gemma 4 26B-A4B 또는 Muse Glimmer 30B, 복잡한 추론과 도구 사용에는 직접 호스팅 가능한 클라우드 LLM(GLM-5.2, DeepSeek-V4 또는 Kimi K3)
영상(컷신): 로컬에서는 Mochi 1 또는 Wan 2.2 5B, 최종 품질이 필요할 때는 클라우드에서 LTX-2.5 또는 HunyuanVideo-1.5
이 모든 것에서 꼭 기억해야 할 점이 있습니다. 흔한 실수는 모든 작업에 AI를 사용하려는 것입니다. 이들은 대체재가 아니라 도구입니다. 반복 작업, 변형 제작, 임시 에셋처럼 지루한 부분을 압축해 실제로 중요한 창의적 결정에 시간을 쓸 수 있게 해줍니다. 바로 게임을 여러분만의 작품으로 만드는 부분입니다.
하드웨어 현실 점검
이 모델들을 실제로 실행하는 데 무엇이 필요한지 솔직히 살펴보겠습니다.
8GB VRAM(RTX 3060, 4060): SD 1.5/SDXL, Wan 2.1 소형 모델, AudioGen, Fish Speech, 소형 LLM(7B 양자화). 게이밍 노트북 수준이며 시작하기에는 충분합니다.
12GB VRAM(RTX 3080, 4070): SD 3.5, FLUX schnell, Mochi 1, MusicGen, TripoSR, Qwen 14B 양자화. 이 정도부터 편안해집니다. 유용한 모델 대부분을 실행할 수 있습니다.
24GB VRAM(RTX 3090, 4090): 대부분의 모델을 전체 정밀도로 실행할 수 있고, InstantMesh와 더 큰 LLM, 그리고 2026년 로컬 에이전트급 모델인 Qwen3.6-35B-A3B, 4비트 Gemma 4 31B, 4비트 Muse Glimmer 30B를 사용할 수 있습니다. 이 워크플로를 진지하게 활용한다면 가장 균형이 좋은 구간입니다.
48~80GB VRAM(A100, H100): HunyuanVideo, LTX-2, DeepSeek-V3, 프로덕션 규모 생성. 기업용 하드웨어입니다. 직접 구매하기보다는 대여하게 될 것입니다.
RunPod, Lambda Labs 또는 Modal의 클라우드 인스턴스에서 A100은 시간당 $2~4입니다. 가끔 사용한다면 하드웨어를 구매하는 것보다 저렴합니다. 최종 품질이 필요할 때 인스턴스를 켜고, 작업이 끝나면 종료하세요.
이 가이드의 비용 추정치에 관하여: 생성당 비용은 시간당 약 $2~3(A100) 또는 약 $0.40(RTX 4090)인 클라우드 GPU에서 직접 호스팅해 추론하는 것을 기준으로 합니다. 실제 비용은 하드웨어, 최적화, 배치 크기에 따라 달라집니다. 계획을 위한 대략적인 수치이므로 실제 결과에는 차이가 있을 수 있습니다.
2026년의 새로운 소식
최근 출시된 모델: LTX-2와 LTX-2.3은 네이티브 4K를 지원하는 오픈 동기화 오디오·영상 생성을 선보였습니다. Microsoft의 TRELLIS.2(2025년 12월)는 오픈 이미지-3D 변환 분야의 선두가 되었고, Meta의 SAM 3D(2025년 11월)는 사진 한 장을 이용한 3D 재구성을 실용적인 수준으로 만들었습니다. 이미지 생성에서는 FLUX.2가 FLUX.1을 대체했으며, NVIDIA의 SOMA-X는 오픈 자동 리깅과 리타기팅을 제공했습니다. 2026년 상반기에도 이 속도는 이어졌습니다. Qwen3-TTS(1월)는 음성 복제에 제대로 된 Apache 2.0 기반을 제공했고, Zhipu의 GLM-5(2월)는 MIT 라이선스의 744B 오픈 코딩·에이전트 모델로 출시되었습니다. Skywork의 Matrix-Game 3.0(3월)은 실시간 인터랙티브 월드 모델을 오픈 웨이트로 공개했고, DeepSeek-V4(4월)는 MIT 라이선스 아래 오픈 LLM의 컨텍스트를 1M 토큰으로 확장했습니다. Stable Audio 3.0(5월)은 라이선스를 확보한 데이터로 학습한 오픈 오디오 모델 세 가지를 출시했고, Ideogram은 첫 오픈 웨이트 이미지 모델을 공개했습니다(6월). 이어 7월에는 Moonshot이 2.8T 매개변수의 오픈 웨이트 모델 Kimi K3를 발표했으며, 7월 27일 Kimi K3 License로 웨이트를 공개했습니다. 같은 달 Tencent는 295B Hy3를 Apache 2.0으로 전환했고, 그보다 몇 주 전인 6월 17일에는 Z.ai가 MIT 라이선스로 GLM-5.2를 출시했습니다. 8월에도 오픈 생태계는 분주했습니다. Alibaba는 Qwen3.8(2.4T-A95B 플래그십 및 밀집형 27B 모델, Apache 2.0)을 공개했고, Meta는 Apache 2.0으로 Muse Glimmer 30B를 출시했으며, MiniMax는 33B H3 영상 모델의 웨이트를 공개했고, Lightricks는 LTX-2.5를 출시했습니다. 그보다 앞서 Google의 Gemma 4(4월, Apache 2.0)와 Mistral Small 4(3월, Apache 2.0)는 온디바이스 모델의 기준을 새로 세웠습니다.
주목해야 할 흐름: 주요 연구소는 이전 버전을 오픈으로 공개했더라도 최신 모델은 API 전용으로 유지하는 경우가 점점 많아지고 있습니다. Wan은 2.5부터 폐쇄형으로 전환해 3.0(2026년 8월)까지 그 방침을 유지했고, Qwen-Image는 2.0부터, Hunyuan3D는 2.5부터 폐쇄형으로 전환했습니다. Meta의 Llama 후속 모델 Muse Spark는 2026년 4월 폐쇄형으로 출시된 후, 더 작은 Muse Glimmer가 8월에 다시 오픈 모델로 공개되었습니다. Black Forest Labs는 FLUX 3를 먼저 API로 제공하고 있으며, 오픈 FLUX 3 Dev는 2026년 후반에 공개하겠다고 약속했습니다. Skywork는 2월에 SkyReels V4를 발표했지만 웨이트를 공개하지 않았습니다. 오픈 생태계는 여전히 활발하고 빠르게 변화하지만, 더 이상 "최신 버전은 오픈일 것"이라고 안전하게 가정할 수 없습니다. 따라서 특정 모델을 중심으로 파이프라인을 구축하기 전에 웨이트 제공 여부를 확인하세요.
방향은 분명합니다. 폐쇄형 모델에 존재하는 모든 기능은 6~12개월 뒤 오픈 모델에도 등장합니다. 문제는 오픈 모델의 성능이 충분해질지 여부가 아닙니다. 대부분의 용도에서는 이미 충분합니다. 문제는 얼마나 빨리 기본 선택지가 되느냐입니다.
그리고 이것이 크리에이터에게 의미하는 바는 이렇습니다. 과거에는 기업 수준의 예산이나 월간 구독이 필요했던 도구를 이제는 그냥... 실행할 수 있게 되고 있습니다. 자신의 하드웨어에서. 누구의 허락도 없이.
이것이 변화입니다. 이것이 우리가 향해 가는 미래입니다.
자주 묻는 질문
게임 에셋 생성에 가장 적합한 오픈 소스 AI 모델은 무엇인가요?
에셋 종류에 따라 다릅니다. 3D 모델에는 2026년 기준 Hunyuan3D가 가장 강력한 오픈 옵션입니다. 2D 아트와 텍스처는 FLUX가 품질 면에서 앞섭니다. 음향 효과와 음악 분야에서도 오픈 오디오 모델이 빠르게 따라잡았습니다. 게임에는 다양한 유형의 에셋이 필요하므로 하나의 "최고" 모델은 없습니다. 대부분의 크리에이터는 단일 모델에 의존하기보다 몇 가지 모델을 연결해 사용합니다.
오픈 소스 AI 모델로 폐쇄형 API를 대체할 수 있을 만큼 성능이 좋은가요?
2026년 기준 대부분의 게임 에셋 작업에는 그렇습니다. 오픈 모델은 이제 이미지, 3D, 오디오 생성에서 폐쇄형 API와 대등한 수준이며, 호출당 요금이나 갑작스러운 가격 변경 없이 자신의 하드웨어에서 실행할 수 있습니다. 장편 영상과 같은 일부 최첨단 작업에서는 여전히 폐쇄형 모델이 앞서지만, 보통 6~12개월 안에 격차가 좁혀집니다.
이런 생성형 AI 모델을 자체 GPU에서 실행할 수 있나요?
많은 모델을 실행할 수 있습니다. 이미지 및 오디오 모델은 RTX 4090 같은 단일 소비자용 GPU에서도 무리 없이 실행됩니다. 더 큰 영상 및 3D 모델은 더 많은 VRAM을 필요로 하며, A100급 클라우드 GPU가 필요한 경우가 많습니다. 위의 하드웨어 섹션에 각 모델의 요구 사항이 정리되어 있으므로 도입하기 전에 계획을 세울 수 있습니다.
2026년 최고의 오픈 소스 프런티어 모델은 무엇인가요?
2026년 9월 기준 오픈 프런티어는 4파전이며, 무엇을 실행할 수 있느냐에 따라 답이 달라집니다. Kimi K3(2.8T MoE)는 규모가 가장 크고 폐쇄형 선두 모델에 가장 근접한 점수를 기록하지만, Kimi K3 License에는 대규모 서비스형 모델 사업자를 위한 추가 조건이 있습니다. DeepSeek-V4-Pro(1.6T, 활성 파라미터 49B)와 Qwen3.8-2.4T-A95B는 이 규모에서 각각 MIT와 Apache 2.0이라는 가장 명확한 라이선스를 제공합니다. GLM-5.2(753B, MIT)는 코딩 및 에이전트 작업에 특화되어 있습니다. 이들 중 어느 것도 단일 GPU에 들어가지 않으므로, 직접 호스팅할 모델 중 실질적인 "최고"는 한 단계 아래인 Qwen3.6-35B-A3B, Gemma 4 31B 또는 Muse Glimmer 30B입니다.
최고의 오픈 및 폐쇄형 프런티어 이미지 생성 모델은 무엇인가요?
오픈 모델: 상업적으로 안전한 게임 아트에는 FLUX.2 [klein] 4B(Apache 2.0, 1초 미만), 읽을 수 있는 텍스트가 필요할 때는 Qwen-Image-2512(Apache 2.0), 라이선스가 용도에 맞고 최고의 품질이 필요하다면 FLUX.2 [dev] 또는 Chroma1-HD를 선택하세요. 폐쇄형 모델: FLUX.2 [pro]와 API 전용 Qwen-Image-2.0이 있으며, 2026년에 등장한 Kling IMAGE 3.0(Kling 가이드에 따르면 참조 이미지 최대 10개 지원) 및 xAI의 Grok Imagine Image 2.0도 있습니다. FLUX 3의 이미지 모델은 현재 BFL의 API를 통해서만 제공되며, 오픈 Dev 버전은 2026년 후반에 공개될 예정입니다. 게임 제작에서는 이미 오픈 모델 계층으로도 충분하므로, 폐쇄형 모델은 주로 편의성을 위해 선택하게 됩니다.
완전한 상업적 배포가 가능한 오픈 가중치 동영상 모델은 무엇이며, 어떤 라이선스가 적용되나요?
매출 상한 없이 엔터프라이즈 규모로 상업적 배포가 가능한 오픈 동영상 모델이 필요하다면 Wan 2.2(Apache 2.0, 5B 및 14B MoE 변형 포함), Mochi 1(Apache 2.0), Step-Video-T2V(MIT), CogVideoX 2B(Apache 2.0)가 안전한 선택입니다. LTX-2와 LTX-2.5는 연간 매출 $10M 미만까지 무료로 상업적 이용이 가능하며, 이를 초과하면 유료 계약이 필요합니다. 이는 Lightricks가 실제로 제공하는 "액세스 구매" 방식입니다. MiniMax H3는 MiniMax H3 Community License에 따라 공개되어 있지만 미국, EU, 영국, 대한민국의 사용자에게 먼저 신청하도록 요구합니다. HunyuanVideo에는 지역별 예외 조항이 포함된 Tencent 커뮤니티 라이선스가 적용되므로, 도입하기 전에 두 라이선스를 모두 확인하세요. Wan 2.5부터 3.0까지, Veo, Kling, Seedance는 공개 가중치를 전혀 제공하지 않습니다. 호스팅 옵션은 참조 동영상 모델 가이드에서 비교합니다.
2026년에 게임 에셋과 환경을 제작하려면 어떤 생성형 AI를 사용해야 하나요?
하나의 모델만 찾기보다는 몇 가지 전문 모델을 연계하세요. 소품과 캐릭터의 경우 FLUX.2 klein 또는 Qwen-Image로 만든 콘셉트를 Hunyuan3D 2.1이나 TRELLIS.2에 입력하고 UniRig으로 리깅하세요. 환경의 경우 스카이박스나 HDRI를 생성하고(스카이박스 생성기를 사용하면 브라우저에서 제작할 수 있습니다), 지형 생성 가이드에서 설명한 것처럼 절차적 방식이나 디퓨전 패스로 지형을 구축하세요. 그런 다음 AI 텍스처 생성기 가이드에서 다루는 이미지 모델과 PBR 추출기를 사용해 텍스처를 제작하세요. 오디오는 Stable Audio 3.0 Small-SFX와 ACE-Step으로, 음성은 Qwen3-TTS 또는 Chatterbox로 생성할 수 있습니다. 이 제작 과정에 포함된 모든 모델은 2026년 9월 기준 오픈 모델이며 상업적으로 사용할 수 있습니다.
2026년에 로컬로 실행할 최고의 LLM은 무엇인가요?
먼저 VRAM 용량에 따라 선택하세요. 8GB에서는 Qwen3.5-4B 또는 Gemma 4 E4B가 적합합니다. 16GB에서는 gpt-oss-20b(Apache 2.0, 16GB용으로 제작됨) 또는 Gemma 4 12B를 선택하세요. 24GB에서는 Qwen3.6-35B-A3B가 대부분의 사용자에게 적합한 범용 모델입니다. 비전 기능을 활용하는 에이전트 작업에는 4비트 Muse Glimmer 30B를, 가장 강력한 밀집 모델을 원한다면 양자화된 Gemma 4 31B를 선택할 수 있습니다. 그 이상의 환경에서는 DeepSeek-V4-Flash(284B, 활성 파라미터 13B)가 워크스테이션에서 1M 토큰 컨텍스트를 사용할 수 있는 가장 작은 모델입니다. 모두 Apache 2.0 또는 MIT 라이선스이며, Ollama나 LM Studio에서 각각 명령어 하나로 실행할 수 있습니다.
AI로 생성한 에셋을 상업용 게임에 사용하는 것은 합법인가요?
직접 실행하는 오픈 소스 모델의 경우 일반적으로 가능하지만, 해당 모델의 라이선스와 학습 데이터에 관한 전제에 따라 달라집니다. 항상 개별 모델의 라이선스를 확인하고, 플랫폼에서 요구하는 경우 AI 생성 콘텐츠임을 공개하세요. 당사의 처리 방침은 AI 생성 콘텐츠 정책을 참조하세요.
더 읽어보기
- AI 논란과 신뢰, 포스트 AI 경제: 게임에서 AI를 활용하는 것에 대한 당사의 입장
- AI 생성 콘텐츠 정책: AI 사용 사실을 공개하는 방식
- 참조 이미지 지원 최고의 AI 동영상 모델: 호스팅 동영상 모델 비교
- 최고의 AI 3D 모델 생성기: 호스팅형 Meshy, Tripo, Rodin과 오픈 모델 비교
- 2026년 웹 게임 기술 스택: 게임을 위한 WebGL, WebGPU 및 Wasm
- 브라우저 3D 오픈 월드 기술: 브라우저 월드에서 AI 생성 3D 에셋 활용하기
- 브라우저 오픈 월드를 위한 지형 생성: 디퓨전 기반 지형 합성
- 무료 게임 에셋을 찾을 수 있는 곳: AI 생성과 함께 활용할 수 있는 전통적인 에셋 출처
- 에이전트형 AI 코딩 도구: 에셋 생성뿐만 아니라 게임 코드 작성에도 AI 활용하기
생성 모델의 결과물을 직접 플레이할 수 있다면 훨씬 더 재미있습니다.