게임을 위한 최고의 오픈소스 생성형 AI 모델 (2026)
마지막 업데이트: 2026년 7월.
생성형 AI에는 이런 점이 있습니다. 수년 동안 가장 좋은 모델들은 API 키와 예측 불가능한 가격 뒤에 숨어 있었죠. 어떤 도구를 중심으로 워크플로를 짜고, 익숙해질 즈음, 어느 날 아침 가격이 바뀌었다는 이메일을 받습니다. 더 나쁘게는 회사가 통째로 방향을 틀어버리기도 하고요.
2024년 말에 상황이 바뀌었습니다. 텐센트, 알리바바, DeepSeek은 실제로 다운로드할 수 있는 모델을 내놓기 시작했습니다. 폐쇄형 대안과 견줄 만한 모델들이죠. 그리고 갑자기 창작자에게는 남의 비즈니스 모델에 의존하지 않는 선택지가 생겼습니다.
자신이 통제하는 모델만으로 비디오, 3D 에셋, 음악, 음성을 모두 만들 수 있다면 어떨까요? 지금 우리가 와 있는 지점이 바로 그곳입니다. 이 가이드는 무엇이 실제이고, 무엇이 작동하며, 오늘 당장 무엇을 쓸 수 있는지 짚어봅니다.
비디오 생성
수년 동안 비디오 생성은 Runway나 Pika를 뜻했습니다. 폐쇄형 플랫폼, 구독료, 결과물 사용에 대한 제약. 이제는요? 같은 수준의 모델을 자신의 하드웨어에서 돌릴 수 있습니다.
HunyuanVideo 텍스트-투-비디오 생성 — 선도적인 오픈소스 비디오 모델의 720p 출력
| 모델 | 기관 | 파라미터 | 사양 | 하드웨어 | 비용 |
|---|---|---|---|---|---|
| HunyuanVideo | 텐센트 | 13B | 720p, 텍스트+이미지 | 80GB | ~$0.20 |
| HunyuanVideo-1.5 | 텐센트 | 8.3B | 480p-1080p, 텍스트+이미지 | 14GB | ~$0.05 |
| Mochi 1 | Genmo | 10B | 480p@30fps | 12GB+ | ~$0.10 |
| LTX-Video | Lightricks | — | 768x512, 실시간 | 12GB | ~$0.02 |
| LTX-2 | Lightricks | 19B | 4K, 음성 동기화 | 고사양 | ~$0.30 |
| Wan 2.1 | 알리바바 | 1.3-14B | 480p-720p | 8GB+ | ~$0.03 |
| Wan 2.2 | 알리바바 | 27B MoE (14B 활성) | 720p, MoE | 8GB+ | ~$0.03 |
| CogVideoX1.5-5B | 칭화대 | 5B | 1360x768@16fps, 최대 10초 | 12GB | ~$0.04 |
| SkyReels-V3 | Skywork | 14-19B | 오디오 구동, 레퍼런스-투-비디오, V2V | 고사양 | ~$0.10 |
| Step-Video-T2V | StepFun | 30B | 최대 규모 오픈 T2V, 204 프레임 | 고사양 | ~$0.15 |
| Open-Sora 2.0 | HPC-AI | 11B | Flux 통합 | 고사양 | ~$0.20 |
가중치: HunyuanVideo ↗ · Mochi 1 ↗ · Wan 2.1 ↗ · Open-Sora ↗
샘플 보기: HunyuanVideo 갤러리 ↗ · Mochi 예시 ↗ · CogVideoX 샘플 ↗
창작자에게 의미하는 것
HunyuanVideo는 전문 평가에서 Runway Gen-3를 능가하면서도 완전히 오픈소스입니다. 단점이라면? 진지한 하드웨어가 필요합니다. 80GB VRAM을 갖춘 A100 또는 H100이요. 대부분의 우리에게 이건 필요할 때 클라우드 GPU를 빌린다는 뜻입니다.
HunyuanVideo-1.5는 하드웨어 계산법을 바꿔놓았습니다. 텐센트는 2025년 11월에 이 모델을 8.3B 파라미터 오픈 모델로 공개했는데, 14GB 소비자용 GPU에서 돌아가고 480p/720p 텍스트-투-비디오와 이미지-투-비디오를 지원하며 선택적으로 1080p 업스케일도 됩니다. 새로운 Selective and Sliding Tile Attention(SSTA) 메커니즘 덕분에 원본 HunyuanVideo의 약 두 배에 달하는 추론 속도를 냅니다. HunyuanVideo 수준의 품질을 원하지만 80GB 카드까지는 정당화하기 어려웠다면, 이게 집에서 실제로 돌릴 수 있는 버전입니다.
Mochi 1은 정말로 돌릴 수 있는 모델입니다. 12GB GPU, 즉 RTX 3060 급이면 무난하게 처리합니다. 출력은 진짜로 창의적이고 독특한 예술적 질감이 있습니다. HunyuanVideo만큼의 충실도는 아니지만 과정을 당신이 소유합니다.
LTX-2는 게임 쪽에서 흥미로워지는 지점입니다. 비디오와 동기화된 오디오를 생성하는 첫 오픈 모델이죠. 사운드가 그냥... 딱 맞아떨어지는 컷신을 상상해 보세요. 후반 작업 동기화가 필요 없습니다. Lightricks는 2026년 1월에 전체 가중치, 추론, 학습 코드를 오픈소스로 공개했고, 최대 50fps의 네이티브 4K 출력과 최대 20초까지의 동기화 오디오를 지원합니다. 라이선스 관련 단서가 하나 있습니다. LTX-2의 오픈 가중치는 학술적 용도로는 무료이고 상업적 용도로는 연 매출 $10M 미만인 기업에만 무료라서, 이걸 기반으로 사업을 짓기 전에 그 기준선을 확인하세요.
SkyReels-V3(Skywork, 2026년 1월)는 주목할 만한 더 새로운 오픈 라인입니다. 오디오 구동 비디오, 레퍼런스-투-비디오, 비디오-투-비디오를 14B와 19B 변형으로 처리하는 통합 멀티모달 모델이라, 캐릭터나 레퍼런스 이미지로 샷을 이끌어야 할 때 강력합니다. Step-Video-T2V(StepFun)는 30B로 가장 큰 오픈 텍스트-투-비디오 모델이고 깔끔한 MIT 라이선스로 제공되니, 작은 GPU에 맞추는 것보다 관대한 라이선스가 더 중요하다면 알아둘 만합니다.
Wan 2.1은 게이밍 노트북에서 돌아갑니다. 8GB GPU면 작은 변형 모델에 충분합니다. 비디오 생성으로 프로토타이핑하고 싶었지만 하드웨어를 정당화하기 어려웠다면, 이게 당신의 진입 경로입니다.
Wan 2.2(알리바바, 2025년 7월)는 Mixture-of-Experts 설계로 만든 첫 오픈소스 비디오 모델입니다. 총 27B 파라미터에 스텝당 14B만 활성화되죠. 텍스트-투-비디오(T2V-A14B), 이미지-투-비디오(I2V-A14B), 그리고 소비자용 GPU에서 돌아가는 하이브리드 5B 변형으로 제공되며, 모두 상업적 사용이 가능한 Apache 2.0 라이선스입니다.
알아둘 만한 단서가 하나 있습니다. Wan 2.2는 여전히 마지막 오픈 Wan입니다. 더 새로운 Wan 2.5(2025년 9월), 2.6(2025년 12월), 2.7(2026년 4월)은 동기화 오디오, 1080p, 더 세밀한 프레임 제어를 더했지만 API 전용이고 공개 가중치가 없습니다. 셀프 호스팅이 중요하다면 2.2가 천장입니다. 4K와 동기화 오디오가 필요할 때 손이 가는 오픈 모델은 LTX-2입니다.
이치에 맞는 워크플로는 이렇습니다. 로컬 프로토타이핑은 Mochi 1이나 Wan 2.1로, 최종 품질이 필요할 때는 클라우드 GPU에서 HunyuanVideo-1.5나 LTX-2로.
이미지 생성
여기는 오픈소스가 이미 이긴 영역입니다. 오늘 다운로드할 수 있는 모델들은 진짜로 Midjourney와 경쟁합니다. "거의 그만큼 좋다"가 아니라 실제로 경쟁력이 있습니다.
FLUX.1 샘플 — Apache 2.0 라이선스 모델의 사진급 사실적 품질
| 모델 | 기관 | 출시 | 파라미터 | 핵심 특징 | 라이선스 | 이미지당 비용 |
|---|---|---|---|---|---|---|
| FLUX.1 [schnell] | Black Forest Labs | 2024년 8월 | 12B | 4스텝 생성, 빠름 | Apache 2.0 | ~$0.001 |
| FLUX.1 [dev] | Black Forest Labs | 2024년 8월 | 12B | Pro에 근접한 품질 | 비상업용 | ~$0.002 |
| SD 3.5 Large | Stability AI | 2024년 10월 | 8B | 텍스트 렌더링, 다양한 스타일 | Stability 라이선스 | ~$0.002 |
| SD 3.5 Large Turbo | Stability AI | 2024년 10월 | 8B | 4스텝, 빠름 | Stability 라이선스 | ~$0.001 |
| HiDream-I1 | HiDream.ai | 2025년 4월 | 17B | 고품질, Full/Dev/Fast 변형 | MIT | ~$0.002 |
| CogView4 | 칭화대 | 2025년 3월 | 6B | 네이티브 중국어 텍스트 | 오픈 | ~$0.002 |
| Qwen-Image | 알리바바 | 2025년 8월 | 20B | 최고 수준 텍스트 렌더링, 편집 | Apache 2.0 | ~$0.002 |
| FLUX.2 | Black Forest Labs | 2025년 11월 | 32B | 텍스트+편집, 4MP, 멀티 레퍼런스 | dev: 비상업용 / klein 4B: Apache 2.0 | ~$0.003 |
| Ideogram 4.0 | Ideogram | 2026년 6월 | 9.3B | 디자인 작업, 텍스트 렌더링, JSON 레이아웃 제어 | 비상업용 | ~$0.002 |
직접 써보기: FLUX.1 schnell demo ↗ · SD 3.5 Large demo ↗ · GitHub (FLUX) ↗
샘플 보기: FLUX 갤러리 ↗ · FLUX LoRA 갤러리 ↗ · Replicate 예시 ↗
게임 에셋을 만들 때
**FLUX.1 [schnell]**은 꼭 알아둬야 할 모델입니다. Apache 2.0 라이선스, 즉 라이선스 문제로 골치 아플 일 없이 상업용 게임을 출시할 수 있습니다. 단 4스텝으로 생성하기 때문에 빠르게 반복할 수 있죠. 원하는 걸 설명하고, 결과를 보고, 조정하고, 반복합니다.
SD 3.5 Large는 드디어 텍스트 렌더링을 제대로 처리합니다. 이전 버전들은 넣으려던 텍스트를 죄다 뭉개버렸죠. 이건 UI 목업, 게임 내 간판, 타이틀 화면처럼 이미지 안에 읽을 수 있는 단어가 필요한 모든 곳에서 중요합니다.
FLUX.2(Black Forest Labs, 2025년 11월)는 더 큰 후속작입니다. 텍스트-투-이미지와 이미지 편집을 하나의 체크포인트로 처리하는 32B 모델이며, 강력한 멀티 레퍼런스 캐릭터/스타일 일관성과 최대 4메가픽셀까지 안정적인 텍스트 렌더링을 갖췄습니다. 오픈 가중치인 FLUX.2 [dev]는 비상업용 라이선스를 쓰지만, 크기를 줄여 증류한 FLUX.2 [klein](2026년 1월)은 4B 버전을 Apache 2.0으로 공개하고, 1초 미만에 생성하며, 약 8GB VRAM에서 돌아가므로 게임 아트를 출시할 때 상업적으로 안전한 선택지가 여전히 존재합니다. 4B klein을 콕 집어서 받으세요. 더 큰 klein 9B는 비상업용 FLUX 라이선스 아래에 있습니다. 양자화 파이프라인을 쓰면 [dev]를 18-24GB GPU까지 낮출 수 있습니다.
알아둘 만한 오픈 선택지가 둘 더 있습니다. Chroma1-HD(8.9B, Apache 2.0)는 완전히 오픈된 FLUX.1-schnell 파생 모델이라, [dev] 라이선스 없이 FLUX 계열 품질을 얻는 상업적으로 안전한 방법입니다. OmniGen2(Apache 2.0)는 텍스트-투-이미지와 지시 기반 편집을 한곳에서 처리하는 통합 모델이라, 처음부터 생성하기보다 기존 에셋을 반복 수정할 때("검을 파랗게 빛나게 해줘") 가장 빠른 경로입니다.
Qwen-Image(알리바바, 2025년 8월)는 아트에 읽을 수 있는 텍스트, 즉 간판, UI, 포스터, 아이템 라벨 같은 것이 필요할 때 손이 가는 오픈 모델입니다. 최고 수준의 텍스트 렌더링과 강력한 지시 기반 편집 변형을 갖춘 20B Apache 2.0 모델이라, 상업적으로 안전하면서도 대부분의 이미지 모델이 여전히 헤매는 부분을 유난히 잘합니다. 2025년 12월 리프레시인 Qwen-Image-2512는 인물 사실감과 텍스트 레이아웃을 다듬고 Apache 2.0 라이선스를 유지했으니, 셀프 호스팅한다면 이 체크포인트를 받으세요. 더 새로운 Qwen-Image-2.0(2026년 2월)은 API 전용입니다.
Ideogram 4.0(2026년 6월)은 Ideogram의 첫 오픈 가중치 릴리스입니다. 디자인 작업을 위해 만들어진 9.3B 디퓨전 트랜스포머로, 강력한 다국어 텍스트 렌더링과 구조화된 JSON 프롬프트를 통한 명시적 레이아웃·색상 제어를 갖췄습니다. 이것을 기반으로 뭔가를 만들기 전에 한 가지 유의점: 추론 코드는 Apache 2.0이지만 가중치는 비상업용 라이선스라서, 상업용 라이선스를 구매하지 않는 한 연구·프로토타이핑 도구입니다.
Stable Diffusion을 둘러싼 생태계는 여전히 따라올 자가 없습니다. 정밀한 구성을 위한 ControlNet, 수정을 위한 Inpainting, 커스텀 스타일을 위한 LoRA 파인튜닝. FLUX가 따라잡고 있지만, 오늘 당장 깊은 커스터마이징이 필요하다면 SD의 성숙한 도구가 더 많은 작업 여지를 줍니다.
저라면 이렇게 생각하겠습니다. 텍스처와 스프라이트는 둘 다 괜찮습니다. 특정 스타일 요구가 있는 콘셉트 아트는 LoRA를 곁들인 SD 3.5. 상업 출시를 위한 순수 품질은 FLUX schnell.
3D 생성
게임에 3초 나오는 소품을 만드느라 여덟 시간을 쏟아본 적이 있다면, 이 섹션은 당신을 위한 것입니다. 3D 생성은 "흥미로운 연구"에서 실제 프로덕션 도구로 넘어간 지 오래고, 2026년에는 오픈 모델도 충분히 좋습니다. 이제 스케치에서 텍스처를 입힌 메시까지 1분 안에 갈 수 있습니다.
TRELLIS는 단일 이미지에서 PBR 머티리얼이 적용된 텍스처 3D 메시를 생성합니다
| 모델 | 기관 | 출시 | 핵심 특징 | 출력 | 메시당 비용 |
|---|---|---|---|---|---|
| TRELLIS 2 | 마이크로소프트 | 2025 | 4B 파라미터, PBR 머티리얼 | 노멀이 포함된 텍스처 메시 | ~$0.03 |
| Hunyuan3D 2.1 | 텐센트 | 2025년 6월 | 프로덕션 PBR, 전체 가중치 + 학습 코드 | 고충실도 텍스처 메시 | ~$0.05 |
| TripoSR | VAST/Stability | 2024년 3월 | 단일 이미지 → 0.5초 만에 메시 | 메시 (텍스처 없음) | ~$0.001 |
| InstantMesh | TencentARC | 2024년 4월 | 멀티뷰 디퓨전 | 고품질 메시 | ~$0.02 |
| Stable Zero123 | Stability AI | 2024 | 새로운 시점 합성 | 멀티뷰 이미지 | ~$0.01 |
| UniRig | 칭화대 / Tripo | 2025 | 자동 리깅: 스켈레톤 + 스키닝 웨이트 | 리깅된, 애니메이션 가능 메시 | ~$0.01 |
직접 써보기: TRELLIS 2 demo ↗ · Hunyuan3D demo ↗ · InstantMesh demo ↗
샘플 보기: TRELLIS 2 프로젝트 페이지 ↗ · 3D AI Studio 갤러리 ↗
실제로 돌아가는 워크플로
지금 창작자들에게 잘 맞아 들어가는 접근법은 모델을 사슬처럼 엮는 것입니다. 이미지에서 시작합니다. 생성한 것이든 촬영한 것이든 상관없습니다. 이걸 Stable Zero123이나 Wonder3D에 통과시켜 여러 시점을 얻습니다. 그 시점들을 InstantMesh나 TripoSR에 넣어 메시를 만듭니다. 그다음 TRELLIS 2나 Hunyuan3D로 제대로 된 머티리얼을 입힙니다.
마이크로소프트의 TRELLIS 2는 프로덕션에 바로 쓸 수 있는 에셋의 새로운 선두주자입니다. 다른 모델이 망가뜨리는 지오메트리, 즉 얇은 면, 구멍, 복잡한 토폴로지를 잘 처리합니다. 4B 파라미터 버전은 머티리얼인 척하는 버텍스 컬러가 아니라 진짜 PBR 텍스처가 입혀진 메시를 출력합니다.
TripoSR은 속도가 핵심입니다. 이미지에서 메시까지 0.5초. 메시는 정리와 텍스처 작업이 필요하지만, 프로토타이핑용으로는요? 몇 시간을 투자하기 전에 아이디어가 통하는지 알아보는 용도로는? 따라올 자가 없습니다.
Hunyuan3D 2.1은 사용할 만한 오픈 텐센트 모델입니다. 프로덕션급 PBR 텍스처링과 함께 전체 가중치와 학습 코드를 제공하죠. 이름 붙이는 방식을 눈여겨보세요, 사람들이 자주 헷갈리니까요. Hunyuan3D 2.5, 3.0, 3.1이 모두 존재하지만 API 전용이고 공개 가중치가 없어서, 셀프 호스팅용 기본 생성기는 여전히 2.1이 최상단입니다. 텐센트는 2.1 위에 만든 유용한 확장 두 가지를 오픈했습니다. Hunyuan3D-Omni는 다중 조건 제어(포인트 클라우드, 복셀, 스켈레톤, 바운딩 박스)를 더하고, Hunyuan3D-Part는 메시를 편집 가능한 부품으로 분해합니다. 라이선스가 EU, 영국, 한국을 제외하고 있으니, 해당 지역에서 출시하기 전에 약관을 확인하세요.
UniRig(칭화대와 Tripo, MIT)는 메시를 얻은 직후 누구나 부딪히는 간극, 즉 리깅을 메웁니다. 입력 메시에 유효한 스켈레톤과 스키닝 웨이트를 자동으로 생성해서, 생성된 캐릭터가 정적인 소품으로 가만히 있는 대신 실제로 애니메이션될 수 있게 해줍니다. NVIDIA SOMA-X의 자동 애니메이션 작업과 짝지으면, 완전히 생성되고 완전히 리깅된 캐릭터가 더 이상 연구 데모에 그치지 않습니다.
인디 창작자에게 현실적인 기대치는 이렇습니다. FLUX로 콘셉트 아트를 생성하고, InstantMesh로 지오메트리를 뽑은 다음, Blender에서 텍스처를 입히거나 TRELLIS로 PBR을 자동 처리합니다. 에셋 하나에 4-8시간이 아니라 30-60분이 걸립니다. 시간이 제로는 아니지만 진짜 차이입니다.
오디오와 음악
오디오 생성은 아직 이미지와 비디오를 따라잡지 못했습니다. 하지만 작업 방식을 바꾸기에 충분한 것들이 여기 있습니다. 특히 프로토타이핑과 음향 효과에서요.
AI 생성 음악 샘플 — 원하는 분위기를 설명하면 그에 맞는 음악이 나옵니다
| 모델 | 기관 | 출시 | 하는 일 | 라이선스 | 30초당 비용 |
|---|---|---|---|---|---|
| ACE-Step 1.5 | StepFun/ACE Studio | 2026년 1월 | 빠르게 ~4분 음악, 19개 언어, 보이스 클론 | MIT | ~$0.02 |
| YuE | MAP | 2025년 1월 | 가사에서 완성곡, 보컬 + 반주 | Apache 2.0 | ~$0.05 |
| MusicGen | Meta | 2023 | 텍스트-투-뮤직, 제어 가능 | MIT | ~$0.01 |
| AudioGen | Meta | 2023 | 음향 효과, 환경음 | 코드 MIT / 가중치 CC-BY-NC | ~$0.01 |
| Stable Audio 3.0 | Stability AI | 2026년 5월 | 최대 ~6분 곡; 오픈 Small, Small-SFX + Medium 모델 | Stability Community | ~$0.02 |
| Magenta RealTime | 2025년 6월 | 실시간, 프롬프트로 조종 가능한 음악 | code Apache / weights CC-BY | ~$0.02 |
직접 써보기: MusicGen demo ↗ · AudioCraft playground ↗
샘플 보기: MusicGen 예시 ↗ · AudioGen 샘플 ↗
실제로 출시에 쓸 수 있는 것
Meta의 MusicGen은 게임 오디오에 실용적인 선택입니다. 원하는 분위기를 설명하면 그에 맞는 음악이 나옵니다. MIT 라이선스라 출시할 수 있죠. 3.3B 모델은 12GB GPU에서 무난하게 돌아갑니다. 설명하고, 생성하고, 반복합니다.
AudioGen은 음향 효과를 처리합니다. 발소리, 문 삐걱거리는 소리, 바람 같은 환경음, 기계음. 라이선스 주의점 하나: 코드는 MIT지만 가중치는 CC-BY-NC(비상업용)라서, MusicGen처럼 프로토타이핑 도구입니다. 출시하는 게임의 SFX에는 Stable Audio의 Small-SFX를 쓰세요.
YuE는 정말 흥미롭습니다. 보컬이 들어간 완성곡을 생성하는 첫 오픈 모델입니다. 테마곡. 실제 노래가 있는 배경 음악. 품질은 들쭉날쭉하지만, 직접 다운로드해서 돌릴 수 있는 다른 어떤 것보다 한참 앞서 있습니다.
ACE-Step은 지금 알아둘 가치가 있는 오픈 음악 모델이고, 빠르게 움직여 왔습니다. 1.5 라인(2026년 1월, 더 큰 5B XL 변형 포함)이 원래의 2025년 5월 릴리스를 대체했고 이제 MIT 라이선스입니다. 몇 분 분량의 음악을 빠르게 생성하고, 19개 언어를 지원하며, 보이스 클로닝, 리믹스, 가사 편집을 처리합니다. 게임 프로토타이핑에서는 YuE와 MusicGen이 남겨둔 격차를 상당히 좁혀줍니다.
Stable Audio 3.0(2026년 5월)은 사운드 쪽의 더 큰 업데이트입니다. 최대 약 6분 길이의 곡을 생성할 수 있고, Stability는 네 가지 변형 중 세 가지의 오픈 가중치를 공개했습니다. Small과 전용 음향 효과 모델 Small-SFX는 둘 다 온디바이스로 돌아가고, Medium은 더 나은 음악 구조와 전체 트랙 길이를 더합니다. Large 모델만 API 전용으로 남았습니다. Small-SFX는 이제 게임 SFX에 특화된 가장 강력한 오픈 옵션입니다. 이 제품군 전체가 라이선스된 데이터로 학습됐기 때문에, 미해결 소송을 안고 있는 음악 생성기들보다 법적 근거가 깔끔합니다.
Magenta RealTime(Google)은 가장 좋은 의미로 별종입니다. 실시간으로, 재생 중에 계속 프롬프트로 조종할 수 있는 음악을 위해 만들어진 유일한 오픈 가중치 모델이죠. 완성된 트랙을 렌더링하는 대신 재생되는 동안 조종할 수 있는 음악을 실시간으로 생성하는데, 이건 플레이어의 행동에 따라 변하는 적응형 게임 사운드트랙의 형태 그 자체입니다. 코드는 Apache 2.0, 가중치는 CC-BY로 둘 다 상업적 사용에 문제없습니다.
솔직히 말하자면, 완성된 보컬 곡에서는 오픈 모델과 폐쇄형(Suno, Udio) 사이의 격차가 좁아지고 있지만 아직 실재하며, 그 폐쇄형 도구들도 미해결 학습 데이터 소송을 안고 있습니다. 음향 효과라면 오픈 모델(특히 Stable Audio의 SFX 모델)이 진짜로 경쟁력이 있습니다. 출시하려는 완성곡이라면 많은 반복을 각오하세요. 아니면 최종 제작은 음악가를 데려오고 나머지 모든 것에 이 도구들을 쓰는 방법도 있습니다.
음성
음성 생성은 이제 "게임에 쓰기 충분함"을 한참 넘어섰습니다. 그리고 이건 소규모 팀이 할 수 있는 일을 바꿔놓습니다.
AI 생성 게임 내레이션 — 적절한 페이싱과 감정이 담긴 자연스러운 음성
| 모델 | 기관 | 출시 | 핵심 특징 | 라이선스 | 분당 비용 |
|---|---|---|---|---|---|
| Qwen3-TTS | 알리바바 | 2026년 1월 | 3초 보이스 클로닝, 보이스 디자인, 10개 언어 | Apache 2.0 | ~$0.002 |
| Chatterbox | Resemble AI | 2025 | 감정 제어, ~5초 클로닝, 23개 언어 | MIT | ~$0.003 |
| CSM | Sesame AI | 2025년 3월 | 대화 흐름, 자연스러운 멈춤 | Apache 2.0 | ~$0.005 |
| Fish Speech 1.5 | Fish Audio | 2024 | 10-30초 제로샷 클로닝 | code Apache / weights CC-BY-NC-SA | ~$0.002 |
| OpenVoice V2 | MyShell/MIT | 2024년 4월 | 감정/억양 제어 | MIT | ~$0.003 |
| XTTS-v2 | Coqui (커뮤니티) | 2024 | 17개 언어, 보이스 클로닝 | CPML (비상업용) | ~$0.005 |
샘플 듣기: Fish Audio 음성 ↗ · OpenVoice demo ↗
NPC를 사람처럼 들리게 만들기
Sesame의 **CSM(Conversational Speech Model)**은 대화 전용으로 만들어졌습니다. 자연스러운 멈춤을 만들어내죠. 억양 변화도요. 실제 대화의 리듬을 살립니다. 대부분의 TTS는 누군가 대본을 읽는 것처럼 들립니다. 단번에 알아챌 수 있죠. CSM은 누군가 말하는 것처럼 들립니다. 이 차이는 생각보다 더 중요합니다.
Qwen3-TTS(알리바바, 2026년 1월)는 상업 프로젝트에서 손이 가는 모델입니다. 제품군 전체가 Apache 2.0이고, 약 3초의 레퍼런스 오디오로 목소리를 클론하며, 10개 언어를 말하고, 설명 기반 보이스 디자인을 지원합니다. 그래서 레퍼런스 녹음을 찾아 헤매는 대신 NPC 목소리를 평범한 텍스트로 명세할 수 있죠. 0.6B와 1.7B 모델은 소박한 하드웨어에서 돌아갑니다.
Chatterbox(Resemble AI)는 표현력 있는 음성을 위한 선택이고, MIT 라이선스라서 출시할 수 있습니다. 약 5초로 목소리를 클론하고, 200ms 미만 지연으로 돌아가며, 23개 언어를 지원하고, 감정 과장 제어를 갖춘 첫 오픈 모델이라 NPC가 밋밋하지 않고 실제로 화나거나 겁먹은 것처럼 들릴 수 있습니다. Apache 2.0 옵션 둘이 특정 틈새를 채웁니다. Orpheus(Canopy)는 <laugh>나 <sigh> 같은 인라인 감정 태그를 받아 NPC 대사에 깔끔하게 매핑되고 저사양 하드웨어용 150M 변형을 제공하며, Dia(Nari Labs)는 기침이나 웃음 같은 비언어 표현을 한 번에 담아 다중 화자 대화를 위해 만들어졌습니다.
Fish Speech와 OpenVoice는 보이스 클로닝을 처리합니다. 성우의 음성을 10-30초 녹음하면 그 목소리로 무제한 대화를 생성할 수 있습니다. 이게 무엇을 뜻하는지 생각해 보세요. 핵심 대사에는 성우를 고용하고, 그 연기를 확장해 수백 가지 변형과 환경 대사를 채울 수 있습니다. Fish Speech에 대한 라이선스 참고: 코드는 오픈이지만 1.5 가중치는 CC-BY-NC-SA라서 프로토타이핑 도구입니다. 출시하는 게임에는 대신 OpenVoice(MIT)나 Qwen3-TTS(Apache 2.0)를 쓰세요.
NVIDIA ACE(완전한 오픈소스는 아니지만 알아둘 가치가 있음)는 이제 온디바이스 NPC 배포를 위해 Qwen3-8B를 지원합니다. 로컬 LLM + 로컬 TTS + 립싱크가 모두 소비자용 GPU에서 돌아갑니다. 클라우드 호출이 필요 없는 실시간 NPC 대화를 위한 스택이죠.
인디 창작자에게 이치에 맞는 접근법은 이렇습니다. 주요 캐릭터와 가장 중요한 대사에는 성우를 고용하세요. 환경 대사, 변형, 그리고 그렇지 않으면 무음이거나 비용이 엄청나게 들었을 모든 부수적 대사를 채우는 데에는 Qwen3-TTS나 OpenVoice를 써서 커버리지를 확장하세요.
월드 모델과 게임 시뮬레이션
여기서 일이 진짜로 기묘해집니다. 그리고 진짜로 흥미로워지죠. 이 모델들은 정적인 에셋을 생성하지 않습니다. 게임처럼 느껴지는 경험을 생성합니다.
🎮 Oasis 플레이하기 — AI가 생성한 Minecraft게임 엔진 없이, 오직 AI 예측만으로 이루어지는 실시간 월드 생성
| 모델 | 기관 | 출시 | 하는 일 | 상태 | 프레임당 비용 |
|---|---|---|---|---|---|
| DIAMOND | 연구 | 2024 | 디퓨전 월드 모델, Atari 시뮬레이션 | 오픈 가중치 | ~$0.001 |
| Oasis | Decart/Etched | 2024년 10월 | 실시간 Minecraft 생성 | 500M 가중치 공개 | ~$0.002 |
| MineWorld | Microsoft | 2025년 4월 | 실시간 Minecraft, 오픈 Oasis 대안 | MIT | ~$0.002 |
| Hunyuan-GameCraft | 텐센트 | 2025년 8월 | 인터랙티브 게임 비디오, 키보드/마우스 제어 | Tencent Community | ~$0.005 |
| GameGen-X | 연구 | 2024 | 오픈 월드 비디오 생성 | 코드 + 데이터셋 공개 | ~$0.005 |
| NVIDIA Cosmos | NVIDIA | 2025년 10월 | 물리 AI 시뮬레이션 (Predict2.5) | NVIDIA Open Model License | ~$0.01 |
| Matrix-Game 3.0 | Skywork | 2026년 3월 | 실시간 720p 인터랙티브 월드, 롱호라이즌 메모리 | 오픈 가중치 | ~$0.005 |
| Genie 2 | DeepMind | 2024년 12월 | 이미지에서 인터랙티브 3D | 미공개 | N/A |
| Genie 3 | DeepMind | 2025년 8월 | 실시간 720p 월드, 프롬프트 가능한 이벤트 | 비공개 (Project Genie) | N/A |
연구 보기: DIAMOND 프로젝트 페이지 ↗ · Cosmos 블로그 ↗
써보기: Oasis 라이브 demo ↗ · Genie 2 예시 ↗
왜 이걸 신경 써야 하는가
DIAMOND는 게임 AI에 대한 생각을 바꾸는 무언가를 증명했습니다. 에이전트를 생성된 월드 안에서 완전히 학습시킬 수 있습니다. 학습에 진짜 게임 엔진이 필요 없죠. AI는 디퓨전 모델의 상상 속에서 플레이한 다음 실제 게임으로 옮겨갑니다. 여기서 시사하는 바가 큽니다.
Oasis는 Minecraft 같은 월드를 실시간으로 돌립니다. 프레임 하나하나씩. 게임 엔진도, 텍스처도, 미리 만든 에셋도 없습니다. 그저 트랜스포머가 다음에 무엇이 올지 예측할 뿐이죠. 개념 증명이지만, 이게 어디로 갈지 상상해 보세요. 500M 파라미터 버전은 이미 공개돼 있습니다.
GameGen-X는 오픈 월드 게임 비디오에 대한 가장 큰 데이터셋을 공개했습니다. 자신만의 모델을 학습시키거나 기존 모델을 파인튜닝해 게임 같은 콘텐츠를 생성하고 싶다면, 여기가 출발점입니다.
NVIDIA Cosmos는 로보틱스와 자율주행차를 위해 만들어졌지만, 월드 파운데이션 모델은 게임에도 통합니다. 물리, 객체 영속성, 공간 관계를 이해하죠. 현재 오픈 라인은 2025년 10월 NVIDIA Open Model License로 공개된 Cosmos-Predict2.5로, 상업적 사용과 파생물을 허용합니다.
Hunyuan-GameCraft(텐센트, 2025년 8월)는 가장 게임에 가까운 형태의 오픈 월드 모델입니다. 100개 이상 AAA 게임에서 나온 100만 건 넘는 녹화로 학습했고, 키보드와 마우스 입력을 공유 제어 공간으로 통합해서, 그냥 지켜보는 게 아니라 실제로 조작하는 인터랙티브 게임 비디오를 생성합니다. Hunyuan3D와 같은 Tencent Community License를 따르며 EU, 영국, 대한민국을 제외하니 해당 지역 출시 전에는 약관을 확인하세요. MineWorld(마이크로소프트, MIT)는 Oasis의 완전 허용형 대응물입니다. 게임 엔진 없이 다운로드해서 돌릴 수 있는 실시간 Minecraft 월드 모델이죠.
Genie 3(DeepMind, 2025년 8월 발표)는 주목할 만한 도약입니다. 실시간 상호작용이 가능한 첫 월드 모델로, 24fps의 탐색 가능한 720p 월드를 생성하고 몇 분 동안 일관성을 유지하며, 명령 한 번으로 날씨를 바꾸거나 객체를 추가하는 '프롬프트 가능한 월드 이벤트'까지 갖췄습니다. 2026년 1월에 미국의 Google AI Ultra 구독자를 대상으로 Project Genie라는 이름으로 대중에 공개됐습니다. 여전히 비공개 가중치지만, 플레이 가능한 생성형 월드가 어디로 향하는지 보여줍니다.
Matrix-Game 3.0(Skywork, 2026년 3월)은 Genie에 대한 오픈 진영의 응답입니다. 메모리가 보강된 인터랙티브 월드 모델로, 720p를 40fps로 실시간 스트리밍하고 1분 길이의 시퀀스 내내 장면 일관성을 유지합니다. 5B 증류 버전이 실시간 추론을 담당하고, 더 큰 2x14B MoE 버전이 품질을 끌어올리며, 가중치는 Apache 2.0으로 Hugging Face에 올라와 있습니다. DeepMind를 기다리는 대신 오늘 플레이 가능한 생성형 월드를 실험해 보고 싶다면, 이게 실제로 다운로드할 수 있는 모델입니다.
오늘의 실제 게임 개발에서 이것들은 아직 연구 도구입니다. 하지만 AI 기반 콘텐츠, 절차적 생성 작업을 하고 있거나, 이 모든 것이 어디로 갈지 그저 생각하고 있다면, 여기가 최전선입니다.
대규모 언어 모델
LLM은 대화, 퀘스트 생성, 게임 로직을 구동합니다. 그리고 오픈 옵션들은 이제 진짜로 GPT-4와 경쟁합니다. 2년 전에는 그렇지 않았죠.
| 모델 | 기관 | 출시 | 크기 | 최적 용도 | 라이선스 | 1K 토큰당 비용 |
|---|---|---|---|---|---|---|
| DeepSeek-V3 | DeepSeek | 2024년 12월 | 671B MoE (37B 활성) | 추론, 범용 | 관대함 | ~$0.02 |
| DeepSeek-R1 | DeepSeek | 2025년 1월 | V3 기반 | 사고의 연쇄 | 관대함 | ~$0.03 |
| DeepSeek-V3.2 | DeepSeek | 2025년 12월 | 희소 어텐션 (DSA) | 추론 + 도구 사용 | MIT | ~$0.02 |
| DeepSeek-V4 | DeepSeek | 2026년 4월 | 1.6T MoE (49B 활성) | 최전선 추론, 1M 컨텍스트 | MIT | ~$0.02 |
| GLM-5 | Zhipu / Z.ai | 2026년 2월 | 744B MoE (40B 활성) | 코딩, 에이전트, 도구 사용 | MIT | ~$0.02 |
| GPT-OSS | OpenAI | 2025년 8월 | 120B / 20B MoE | 추론, 도구 사용, 온디바이스 | Apache 2.0 | ~$0.01 |
| Kimi K2 | Moonshot | 2025 | 1T MoE (32B 활성) | 에이전트, 코딩 | Modified MIT | ~$0.02 |
| Kimi K3 | Moonshot | 2026년 7월 | 2.8T MoE (~50B 활성) | 최전선 에이전트, 코딩, 1M 컨텍스트, 비전 | 오픈 가중치(7월 27일) | ~$0.03 |
| Gemma 3 | 2025 | 1B-27B | 온디바이스, 140개 언어, 비전 | Gemma | ~$0.01 | |
| Qwen3 | 알리바바 | 2025 | 235B MoE (22B 활성) | 다국어, 코드 | Apache 2.0 | ~$0.01 |
| Qwen3-Coder | 알리바바 | 2025 | 480B MoE (35B 활성) | 에이전트 코딩, 256K 컨텍스트 | Apache 2.0 | ~$0.02 |
| Llama 4 | Meta | 2025 | 다양함 | 에이전트, 최대 10M 컨텍스트 | Llama Community | ~$0.01 |
| Qwen3-VL | 알리바바 | 2025 | 2B-235B | 비전 + 언어 | Apache 2.0 | ~$0.02 |
| InternVL3 | 상하이 AI 연구소 | 2025 | 1B-78B | 비전, OCR, UI 그라운딩 | MIT | ~$0.02 |
시작하기: HuggingFace의 Qwen3-8B ↗ · HuggingFace의 DeepSeek-V3 ↗ · HuggingFace의 GLM-5 ↗
게임을 만들 때
Qwen3은 대부분의 게임 용도에 실용적인 선택입니다. Apache 2.0 라이선스, 즉 통합 결과물을 당신이 소유합니다. 강력한 다국어 지원은 로컬라이제이션을 생각한다면 중요한 부분이죠. 구조화된 지시를 잘 따릅니다. 7B와 14B 변형은 소비자용 GPU에서 로컬로 돌아갑니다.
DeepSeek-V3는 대부분의 벤치마크에서 GPT-4와 동등하거나 능가합니다. 아키텍처가 영리합니다. 총 671B인데도 토큰당 37B 파라미터만 활성화되죠. 진지한 하드웨어(멀티 GPU)가 필요하지만, API 의존성 없이 최전선급 품질을 냅니다.
DeepSeek-V3.2(2025년 12월)는 추론과 도구 사용을 하나의 모델로 합치고, 저렴한 롱컨텍스트 추론을 위한 DeepSeek Sparse Attention(DSA)을 도입했으며, 최상위 추론 벤치마크를 겨냥한 고연산 Speciale 변형도 있습니다. 게임 로직과 대화에서는 V3보다 더 강하고 에이전트 능력이 뛰어난 대체재입니다.
DeepSeek-V4(2026년 4월)는 오픈 최전선을 다시 밀어 올렸습니다. V4-Pro는 토큰당 49B만 활성화되는 1.6T 파라미터 MoE로, 100만 토큰 컨텍스트 윈도우와 선택 가능한 추론 모드를 갖췄고, 모두 MIT 라이선스입니다. V4-Flash 변형(총 284B, 13B 활성)은 완전한 GPU 클러스터를 요구하지 않는 패키지로 1M 컨텍스트를 유지합니다. 복잡한 퀘스트 로직이나 긴 게임 상태 컨텍스트를 위해 오늘 오픈 모델을 고른다면, 여기가 천장입니다.
GLM-5(Zhipu AI, 2026년 2월)는 코딩과 에이전트 작업에서 제쳐야 할 오픈 모델이고, GLM-5.2 리프레시는 도구 사용과 장기 계획 점수를 닫힌 최전선 가까이 끌어올렸습니다. 토큰당 40B가 활성화되는 744B 파라미터 MoE로, 200K 토큰 컨텍스트와 MIT 라이선스를 갖췄습니다. Z.ai는 최초의 상장 파운데이션 모델 기업으로 호스팅 API를 공격적으로 가격 책정하지만(입력 100만 토큰당 약 $1.40), 직접 셀프호스팅하고 싶다면 가중치가 Hugging Face에 올라와 있습니다. 게임이 퀘스트 스크립팅, 도구 호출 에이전트, 코드 기반 시스템에서 LLM에 기댄다면, GLM-5는 당신이 완전히 통제하는 강력한 OpenAI 대안입니다.
GPT-OSS(OpenAI, 2025년 8월)는 OpenAI의 첫 오픈 가중치 릴리스이고, 이 가이드의 주제에 정확히 들어맞습니다. gpt-oss-120b는 단일 80GB GPU에서 대략 o4-mini 수준으로 추론하고 도구를 호출하며, gpt-oss-20b는 16GB 소비자용 카드에서 돌아갑니다. 둘 다 Apache 2.0입니다. NPC 로직이나 도구 사용 에이전트를 위해 셀프호스팅할 서구권 모델을 원한다면 이게 그 답입니다.
Kimi K2(Moonshot)는 GLM-5, DeepSeek과 함께 오픈 에이전트 중량급입니다. 32B가 활성화되는 1조 파라미터 MoE로 코딩과 도구 사용에 강하게 튜닝됐고, Modified MIT 라이선스는 월 1억 사용자 이상에서만 제약이 붙어 인디에게는 사실상 MIT입니다. 에이전트가 여러 단계에 걸쳐 계획해야 할 때 손이 갑니다.
Kimi K3(Moonshot, 2026년 7월)는 지금까지 발표된 것 중 가장 큰 오픈 가중치 모델이고, 이전의 어떤 오픈 모델보다 클로즈드 최전선에 가깝게 다가섰습니다. 토큰당 약 50B만 활성화되는(896개 전문가 중 16개) 2.8조 파라미터 MoE로, 1M 토큰 컨텍스트와 네이티브 비전을 갖췄고, Kimi Delta Attention과 Attention Residuals라는 두 가지 새 어텐션 설계 위에 만들어졌습니다. Moonshot의 수치로는 코딩과 에이전트 벤치마크에서 Claude Opus 4.8과 GPT-5.5를 앞서고, 최상위 독점 모델들에만 뒤집니다. 문제는 규모입니다. 가중치는 2026년 7월 27일에 MXFP4 포맷으로 약 1.4TB 크기로 공개되므로, 셀프호스팅은 멀티 노드 GPU 클러스터를 뜻하고, 대부분의 팀은 API(입력 100만 토큰당 $3, 출력 $15)로 쓰게 될 겁니다. 직접 돌릴 수 있는 에이전트라면 K2가 여전히 Moonshot의 실용적인 선택이지만, K3는 최상단에서 "오픈"이 어디까지 갈 수 있는지를 다시 정의합니다.
Gemma 3(Google)은 플레이어의 하드웨어에서 돌리거나 폭넓게 로컬라이제이션해야 할 때 가장 잘 맞습니다. 1B, 4B, 12B, 27B 크기로 나와 8GB 카드부터 확장되고, 140개 언어를 다루며, 함수 호출을 하고, 4B 이상 변형은 이미지도 봅니다. 그래서 작은 비전 모델 역할도 겸하죠. Gemma 라이선스는 상업적 사용을 허용합니다.
Qwen3-Coder(알리바바)는 대부분의 용도에서 낡은 DeepSeek-Coder 라인을 대체하는 전용 오픈 코딩 모델입니다. 35B가 활성화되는 480B MoE로, 256K 네이티브 컨텍스트(1M까지 확장 가능)에 Apache 2.0이며, 에이전트 코딩 벤치마크에서 Claude Sonnet 급입니다. 게임이 코드를 생성하거나 실행한다면 여기가 오픈 천장입니다. 유럽의 Mistral 제품군(코딩용 Devstral, 온디바이스용 Mistral Small 3.x, 둘 다 Apache 2.0)은 셀프호스팅 가능한 견고한 대안입니다.
Qwen3-VL은 비전 이해를 더합니다. 2B부터 235B까지 dense와 MoE 크기가 Apache 2.0으로 제공되죠. 스크린샷을 분석하거나, 플레이어가 그린 콘텐츠를 이해하거나, 카메라 입력을 처리해야 하는 게임에 유용합니다. 8B 변형은 단일 GPU에서 돌아갑니다. InternVL3(상하이 AI 연구소, MIT)는 또 하나의 강력한 오픈 비전-언어 옵션으로, OCR과 UI 그라운딩에 특히 강해서 툴이 게임 인터페이스를 읽어야 할 때 유용합니다. Mistral의 Pixtral 12B(Apache 2.0)는 더 가벼운 상업적 안전 선택지입니다.
온디바이스 NPC, 즉 클라우드 호출 없이 실시간으로 반응하는 캐릭터를 위해서는 NVIDIA ACE를 통한 Qwen3-8B가 현재 가장 실용적인 경로입니다. 플레이어의 하드웨어에서 게임과 함께 돌아갑니다.
유틸리티 모델
이것들은 콘텐츠를 직접 생성하지는 않습니다. 하지만 당신의 파이프라인이 돌아가게 만듭니다.
SAM 2는 이미지와 비디오에서 어떤 객체든 분할합니다 — 한 번 클릭하면 완벽한 마스크가 나옵니다
| 모델 | 기관 | 출시 | 하는 일 |
|---|---|---|---|
| SAM 2 | Meta | 2024년 8월 | 이미지와 비디오에서 무엇이든 분할 |
| Depth Pro | Apple | 2024년 10월 | 단일 이미지에서 메트릭 뎁스 |
| gsplat | Nerfstudio | 2024+ | 가우시안 스플래팅, CUDA 가속 |
SAM 2는 비디오 속 객체를 실시간으로 분할합니다. 무언가를 클릭하면 완벽한 마스크가 나오죠. 로토스코핑, 합성, 또는 푸티지에서 객체를 추출해 게임 에셋으로 쓰는 데 유용합니다. SAM 2 써보기 ↗
Apple의 Depth Pro는 단일 이미지에서 1초 안에 메트릭 뎁스 맵을 만들어냅니다. 이게 많은 걸 가능하게 합니다. 2D 아트를 시차 효과가 있는 2.5D로 변환하기, 3D 재구성용 뎁스 데이터 생성하기, 평면 이미지에서 노멀 맵 만들기. HuggingFace의 Depth Pro ↗
gsplat은 가우시안 스플래팅의 빠른 구현체입니다. 게임을 위해 실제 환경을 캡처하고 있다면, 즉 포토그래메트리나 환경 스캔을 하고 있다면, 이게 그 작업을 실용적으로 만들어주는 라이브러리입니다.
내가 실제로 쓸 것
오늘 게임 프로젝트를 시작한다면, 이치에 맞는 스택은 이렇습니다.
텍스처와 스프라이트: FLUX.1 [schnell] — Apache 2.0, 빠른 반복, 출시할 수 있는 품질
콘셉트 아트: 스타일 제어를 위한 LoRA를 곁들인 SD 3.5 Large
3D 에셋: 텍스처 메시는 Hunyuan3D 2.1이나 TRELLIS.2, 사진에서 시작할 때는 SAM 3D, 그다음 정리는 Blender
오토 리깅: 생성된 메시에 스켈레톤과 스킨을 입히려면 Mixamo에 기대는 대신 UniRig나 NVIDIA SOMA-X(둘 다 오픈)
음향 효과: Stable Audio의 오픈 Small-SFX 모델 — 로컬에서 돌아가고, 상업용 라이선스
음악: 프로토타입은 ACE-Step, 그다음 최종 제작은 작곡가를 데려오기
음성: 클로닝과 환경 대사는 Qwen3-TTS(Apache 2.0), 대사에 진짜 감정이 필요할 때는 Chatterbox(MIT), 중요한 대사는 성우
NPC 대화: 로컬 Qwen3-8B, 또는 복잡한 추론과 도구 사용을 위한 셀프호스팅 가능 클라우드 LLM(GLM-5 또는 DeepSeek-V4)
비디오(컷신): 로컬 Mochi 1, 최종 품질이 필요할 때는 클라우드의 HunyuanVideo
이 모든 것에 대해 이런 점이 있습니다. 흔한 실수는 모든 것에 AI를 쓰려고 하는 것입니다. 이것들은 도구이지 대체물이 아닙니다. 지루한 부분, 즉 반복, 변형, 플레이스홀더 에셋을 압축해 주어, 정말로 중요한 창의적 결정에 시간을 쓸 수 있게 해줍니다. 게임을 당신만의 것으로 만드는 그 부분에요.
하드웨어 현실 점검
이걸 돌리는 데 실제로 무엇이 필요한지 솔직하게 짚어봅시다.
8GB VRAM(RTX 3060, 4060): SD 1.5/SDXL, Wan 2.1 소형, AudioGen, Fish Speech, 작은 LLM(7B 양자화). 게이밍 노트북 영역이고, 시작하기에는 충분합니다.
12GB VRAM(RTX 3080, 4070): SD 3.5, FLUX schnell, Mochi 1, MusicGen, TripoSR, Qwen 14B 양자화. 여기서부터 편해집니다. 유용한 모델 대부분이 여기서 돌아갑니다.
24GB VRAM(RTX 3090, 4090): 대부분의 모델을 풀 프리시전으로, InstantMesh, 더 큰 LLM. 이 워크플로를 진지하게 한다면 여기가 스위트 스팟입니다.
48-80GB VRAM(A100, H100): HunyuanVideo, LTX-2, DeepSeek-V3, 프로덕션 규모의 생성. 엔터프라이즈급 하드웨어입니다. 사는 게 아니라 빌리는 거죠.
RunPod, Lambda Labs, Modal의 클라우드 인스턴스는 A100 기준 시간당 2-4달러입니다. 가끔 쓰는 용도라면 하드웨어를 사는 것보다 저렴합니다. 최종 품질이 필요할 때 켜고, 끝나면 끄세요.
이 가이드의 비용 추정치에 대하여: 생성당 비용은 시간당 약 2-3달러(A100) 또는 약 0.40달러(RTX 4090)의 클라우드 GPU에서 셀프 호스팅 추론을 한다는 가정입니다. 실제 비용은 하드웨어, 최적화, 배치 크기에 따라 달라집니다. 이건 계획을 위한 대략적인 수치이며, 당신의 경우는 다를 수 있습니다.
2026년의 새로운 것
최근 출시됨: LTX-2와 LTX-2.3이 네이티브 4K와 함께 오픈 음성-비디오 동기화를 가져왔습니다. 마이크로소프트의 TRELLIS.2(2025년 12월)가 오픈 이미지-투-3D 선두가 됐고, Meta의 SAM 3D(2025년 11월)가 단일 사진 3D 재구성을 실용적으로 만들었습니다. FLUX.2가 이미지 생성에서 FLUX.1을 대체했고, NVIDIA의 SOMA-X가 오픈 오토 리깅과 리타기팅을 가져왔습니다. 2026년 상반기도 속도를 유지했습니다. Qwen3-TTS(1월)가 보이스 클로닝에 제대로 된 Apache 2.0 보금자리를 마련했고, Zhipu의 GLM-5(2월)가 MIT 라이선스로 744B 오픈 코딩·에이전트 모델을 내놨으며, Skywork의 Matrix-Game 3.0(3월)이 실시간 인터랙티브 월드 모델을 오픈 가중치로 내놨으며, DeepSeek-V4(4월)가 오픈 LLM을 MIT 라이선스의 100만 토큰 컨텍스트까지 밀어붙였고, Stable Audio 3.0(5월)이 라이선스된 데이터로 학습한 세 개의 오픈 오디오 모델을 공개했으며, Ideogram이 첫 오픈 가중치 이미지 모델을 내놨습니다(6월). 그리고 7월, Moonshot이 에이전트 벤치마크에서 Claude Opus 4.8과 GPT-5.5를 앞서는 2.8T 파라미터 오픈 가중치 모델 Kimi K3를 발표했고, 가중치는 7월 27일에 공개됩니다.
주목할 흐름: 최상위 연구소들이 이전 버전은 오픈이었더라도 최신 모델은 점점 API 전용으로 유지하고 있습니다. Wan은 2.5에서 닫혔고 2.7까지 계속 닫힌 채이며, Qwen-Image는 2.0에서, Hunyuan3D는 2.5에서 닫혔습니다. 오픈 생태계는 여전히 활기차고 빠르게 움직이지만, '최신 버전은 오픈'이라는 가정은 더 이상 안전하지 않으니, 어떤 모델을 중심으로 파이프라인을 짜기 전에 가중치 공개 여부를 확인하세요.
흐름은 명확합니다. 폐쇄형 모델에 존재하는 모든 기능은 6-12개월 뒤 오픈 모델에 나타납니다. 질문은 오픈 모델이 충분히 좋아질지가 아닙니다. 대부분의 용도에서는 이미 충분히 좋으니까요. 질문은 그것들이 얼마나 빨리 기본 선택지가 되느냐입니다.
그리고 이게 창작자에게 의미하는 바는 이렇습니다. 과거에 엔터프라이즈 예산이나 월 구독이 필요했던 도구들이, 그냥... 돌릴 수 있는 것이 되어가고 있습니다. 자신의 하드웨어에서. 누구의 허락도 없이.
그게 바로 그 전환입니다. 그게 바로 우리가 만들어가고 있는 방향입니다.
자주 묻는 질문
게임 에셋 생성에 가장 좋은 오픈소스 AI 모델은 무엇인가요?
에셋에 따라 다릅니다. 3D 모델이라면 2026년 기준 Hunyuan3D가 가장 강력한 오픈 옵션입니다. 2D 아트와 텍스처라면 FLUX가 품질에서 앞섭니다. 음향 효과와 음악이라면 오픈 오디오 모델들이 빠르게 따라잡았습니다. 게임은 여러 종류의 에셋이 필요하기 때문에 단 하나의 "최고" 모델은 없으며, 대부분의 창작자는 하나에 의존하기보다 몇 가지를 엮어서 씁니다.
오픈소스 AI 모델이 폐쇄형 API를 대체할 만큼 충분히 좋은가요?
2026년 대부분의 게임 에셋 작업에서는 그렇습니다. 오픈 모델은 이제 이미지, 3D, 오디오 생성에서 폐쇄형 API와 맞먹고, 호출당 요금이나 갑작스러운 가격 변경 없이 자신의 하드웨어에서 돌릴 수 있습니다. 폐쇄형 모델은 장편 비디오 같은 일부 최전선 작업에서 여전히 앞서지만, 그 격차는 보통 6-12개월 안에 좁혀집니다.
이 생성형 AI 모델들을 내 GPU에서 돌릴 수 있나요?
상당수는 그렇습니다. 이미지와 오디오 모델은 RTX 4090 같은 단일 소비자용 GPU에서 무난하게 돌아갑니다. 더 큰 비디오와 3D 모델은 더 많은 VRAM을 원하고 종종 A100급 클라우드 GPU가 필요합니다. 위의 하드웨어 섹션에 각 모델이 무엇을 필요로 하는지 정리돼 있으니, 결정하기 전에 계획을 세울 수 있습니다.
AI가 생성한 에셋을 상업용 게임에 사용하는 것이 합법인가요?
직접 돌리는 오픈소스 모델이라면 대체로 그렇지만, 모델의 라이선스와 학습 데이터에 대한 가정에 따라 달라집니다. 항상 특정 모델의 라이선스를 확인하고, 플랫폼이 요구하는 경우 AI 생성 콘텐츠를 공개하세요. 우리가 이를 어떻게 다루는지는 AI 생성 콘텐츠 정책을 참고하세요.
더 읽을거리
- AI 논란, 신뢰, 그리고 포스트 AI 경제 — 게임 속 AI에 대한 우리의 입장
- AI 생성 콘텐츠 정책 — AI 공개를 다루는 방식
- 2026년 웹 게임 기술 스택 — 게임을 위한 WebGL, WebGPU, Wasm
- 브라우저 3D 오픈 월드 기술 — 브라우저 월드에서 AI 생성 3D 에셋 사용하기
- 브라우저 오픈 월드를 위한 랜드스케이프 생성 — 디퓨전 기반 지형 합성
- 무료 게임 에셋을 찾을 수 있는 곳 — AI 생성과 함께 쓰는 전통적인 에셋 출처
- 에이전트형 AI 코드 도구 — 에셋 생성만이 아니라 게임 코드를 쓰는 AI