最佳开源游戏生成式 AI 模型(2026)
最后更新:2026 年 7 月。
生成式 AI 的情况是这样的。多年来,最优秀的模型都藏在 API 密钥和难以预测的定价之后。你围绕某个工具建立工作流,逐渐用得得心应手,结果某天醒来就收到一封邮件,告诉你价格变了。更糟糕的是,公司可能彻底转型。
这种局面在 2024 年末发生了变化。腾讯、阿里巴巴和 DeepSeek 开始发布真正可以下载的模型。这些模型足以与闭源替代方案抗衡。创作者突然有了更多选择,不必再受制于别人的商业模式。
如果你可以使用完全由自己掌控的模型生成视频、3D 资产、音乐和语音,会怎样?我们如今已经走到了这一步。本指南将带你了解哪些技术已经成熟、哪些确实好用,以及哪些是你今天就能开始使用的。
视频生成
多年来,视频生成基本意味着 Runway 或 Pika:封闭平台、订阅费用,以及对生成内容用途的种种限制。现在呢?你可以在自己的硬件上运行水平相当的模型。
HunyuanVideo 文本生成视频效果,来自领先开源视频模型的 720p 输出
| 模型 | 机构 | 参数量 | 规格 | 硬件 | 成本 |
|---|---|---|---|---|---|
| HunyuanVideo | 腾讯 | 13B | 720p,文本+图像 | 80GB | ~$0.20 |
| HunyuanVideo-1.5 | 腾讯 | 8.3B | 480p-1080p,文本+图像 | 14GB | ~$0.05 |
| Mochi 1 | Genmo | 10B | 480p@30fps | 12GB+ | ~$0.10 |
| LTX-Video | Lightricks | — | 768x512,实时 | 12GB | ~$0.02 |
| LTX-2 | Lightricks | 19B | 4K,同步音频 | 高端硬件 | ~$0.30 |
| Wan 2.1 | 阿里巴巴 | 1.3-14B | 480p-720p | 8GB+ | ~$0.03 |
| Wan 2.2 | 阿里巴巴 | 27B MoE(激活 14B) | 720p,MoE | 8GB+ | ~$0.03 |
| CogVideoX1.5-5B | 清华大学 | 5B | 1360x768@16fps,最长 10 秒 | 12GB | ~$0.04 |
| SkyReels-V3 | Skywork | 14-19B | 音频驱动、参考图生视频、V2V | 高端硬件 | ~$0.10 |
| Step-Video-T2V | StepFun | 30B | 最大的开源 T2V,204 帧 | 高端硬件 | ~$0.15 |
| Open-Sora 2.0 | HPC-AI | 11B | 集成 Flux | 高端硬件 | ~$0.20 |
模型权重:HunyuanVideo ↗ · Mochi 1 ↗ · Wan 2.1 ↗ · Open-Sora ↗
查看示例: HunyuanVideo 作品集 ↗ · Mochi 示例 ↗ · CogVideoX 示例 ↗
这对创作者意味着什么
HunyuanVideo 在专业评测中的表现超过了 Runway Gen-3,而且完全开源。问题是什么?你需要强大的硬件。一张拥有 80GB 显存的 A100 或 H100。对我们大多数人来说,这意味着需要时租用云端 GPU。
HunyuanVideo-1.5 改变了硬件成本的计算方式。腾讯于 2025 年 11 月发布了这个拥有 8.3B 参数的开源模型,它可以在 14GB 显存的消费级 GPU 上运行,支持 480p/720p 的文本生成视频和图像生成视频,并可选择上采样至 1080p。全新的选择性滑动分块注意力(Selective and Sliding Tile Attention,SSTA)机制,使其推理速度大约达到原版 HunyuanVideo 的两倍。如果你想要 HunyuanVideo 的质量,却无法接受购买 80GB 显卡的成本,那么这就是你真正能在家运行的版本。
Mochi 1 是你真正可以运行起来的模型。12GB 显存的 GPU,也就是 RTX 3060 这一档,已经足以顺畅运行。它的输出确实很有创意,并带有鲜明的艺术质感。虽然保真度还比不上 HunyuanVideo,但整个流程都掌握在你自己手中。
LTX-2 对游戏创作而言格外有趣。它是首个能够同时生成同步音频和视频的开源模型。想象一下,过场动画里的声音就这么……自然地对上了。不再需要后期同步。Lightricks 于 2026 年 1 月开放了完整权重、推理代码和训练代码,原生支持最高 50fps 的 4K 输出,以及最长 20 秒的同步音频。需要注意一项许可限制:LTX-2 的开放权重可免费用于学术用途,但只有年收入低于 1000 万美元的公司才能免费用于商业用途,因此在围绕它开展业务之前,请先确认自己是否符合这一门槛。
SkyReels-V3(Skywork,2026 年 1 月)是较新的重要开源模型系列。它是一款统一多模态模型,拥有 14B 和 19B 两种变体,支持音频驱动视频、参考图生成视频以及视频到视频,因此在需要由角色或参考图像驱动画面时尤其出色。Step-Video-T2V(StepFun)则是目前最大的开源文本生成视频模型,参数量达到 30B,并采用简洁宽松的 MIT 许可证。如果宽松的许可条款比能否在小显存 GPU 上运行更重要,它值得你关注。
Wan 2.1 可以在游戏本上运行。较小的变体使用 8GB 显存的 GPU 即可。如果你一直想用视频生成做原型,却无法承受高端硬件的成本,这就是适合你的入门路径。
Wan 2.2(阿里巴巴,2025 年 7 月)是首个采用混合专家架构的开源视频模型:总参数量为 27B,但每一步只激活 14B。它提供文本生成视频(T2V-A14B)、图像生成视频(I2V-A14B),以及可在消费级 GPU 上运行的混合 5B 变体,全部采用 Apache 2.0 许可证,可用于商业用途。
有一点值得注意:Wan 2.2 仍然是最后一个开源的 Wan 版本。更新的 Wan 2.5(2025 年 9 月)、2.6(2025 年 12 月)和 2.7(2026 年 4 月)增加了同步音频、1080p 和更精细的帧控制,但都仅提供 API,没有公开权重。如果自托管对你很重要,2.2 就是上限。需要 4K 和同步音频时,则应选择 LTX-2 这款开源模型。
更合理的工作流是:在本地使用 Mochi 1 或 Wan 2.1 制作原型,需要最终成片质量时,再通过云端 GPU 运行 HunyuanVideo-1.5 或 LTX-2。
图像生成
在这个领域,开源模型已经胜出。你今天可以下载的模型确实能够与 Midjourney 竞争。不是“几乎一样好”,而是真正具有竞争力。
FLUX.1 示例,来自采用 Apache 2.0 许可证模型的照片级写实效果
| 模型 | 机构 | 发布时间 | 参数量 | 主要特性 | 许可证 | 每张图像成本 |
|---|---|---|---|---|---|---|
| FLUX.1 [schnell] | Black Forest Labs | 2024 年 8 月 | 12B | 4 步生成,速度快 | Apache 2.0 | ~$0.001 |
| FLUX.1 [dev] | Black Forest Labs | 2024 年 8 月 | 12B | 质量接近 Pro | 非商业用途 | ~$0.002 |
| SD 3.5 Large | Stability AI | 2024 年 10 月 | 8B | 文字渲染,风格丰富 | Stability 许可证 | ~$0.002 |
| SD 3.5 Large Turbo | Stability AI | 2024 年 10 月 | 8B | 4 步生成,速度快 | Stability 许可证 | ~$0.001 |
| HiDream-I1 | HiDream.ai | 2025 年 4 月 | 17B | 高质量,提供 Full/Dev/Fast 变体 | MIT | ~$0.002 |
| CogView4 | 清华大学 / 智谱 | 2025 年 3 月 | 6B | 原生中文文字,最高 2048px | Apache 2.0 | ~$0.002 |
| Qwen-Image | 阿里巴巴 | 2025 年 8 月 | 20B | 顶级文字渲染与编辑能力 | Apache 2.0 | ~$0.002 |
| FLUX.2 | Black Forest Labs | 2025 年 11 月 | 32B | 文生图+编辑,4MP,多参考图 | dev:非商业用途 / klein 4B:Apache 2.0 | ~$0.003 |
| Ideogram 4.0 | Ideogram | 2026 年 6 月 | 9.3B | 设计工作、文字渲染、JSON 布局控制 | 非商业用途 | ~$0.002 |
直接试用:FLUX.1 schnell 演示 ↗ · SD 3.5 Large 演示 ↗ · GitHub(FLUX)↗
查看示例: FLUX 作品集 ↗ · FLUX LoRA 作品集 ↗ · Replicate 示例 ↗
用于制作游戏资产
FLUX.1 [schnell] 是你最应该了解的模型。它采用 Apache 2.0 许可证,这意味着你可以发布商业游戏,而不必担心许可证纠纷。它只需 4 步即可生成,因此你能快速迭代。描述你想要的内容,查看结果,调整,然后重复。
SD 3.5 Large 终于能够正确处理文字渲染。此前的版本会把你试图加入的任何文字弄得面目全非。这对 UI 设计稿、游戏内标牌、标题画面,以及任何需要图像中出现可读文字的场景都很重要。
FLUX.2(Black Forest Labs,2025 年 11 月)是规模更大的后继模型:它拥有 32B 参数,可通过同一个检查点处理文本生成图像和图像编辑,在多参考图下具备出色的角色与风格一致性,并能以最高 400 万像素可靠渲染文字。开放权重的 FLUX.2 [dev] 使用非商业许可证,但经过尺寸蒸馏的 FLUX.2 [klein](2026 年 1 月)将其 4B 版本以 Apache 2.0 许可证发布,生成耗时不到一秒,并且只需约 8GB 显存即可运行,因此依然有适合商业发行游戏美术资产的安全选项。请务必选择 4B klein:更大的 klein 9B 仍采用非商业用途的 FLUX 许可证。量化流水线则可以让 [dev] 在 18-24GB 显存的 GPU 上运行。
另外还有两个值得了解的开源选择。Chroma1-HD(8.9B,Apache 2.0)是完全开放的 FLUX.1-schnell 衍生模型,因此能让你在避开 [dev] 许可证限制的同时,以适合商业用途的方式获得 FLUX 系列的质量。OmniGen2(Apache 2.0)是一款统一模型,可同时完成文本生成图像和基于指令的编辑。如果你是在现有资产上迭代(“让这把剑发出蓝光”),而不是从头生成,它是最快捷的路径。
Qwen-Image(阿里巴巴,2025 年 8 月)是美术资产需要清晰可读文字时的首选开源模型,例如标牌、UI、海报或物品标签。它是一款拥有 20B 参数、采用 Apache 2.0 许可证的模型,具备顶级文字渲染能力和强大的指令式编辑变体,因此既可安全用于商业项目,也格外擅长处理大多数图像模型依然容易出错的文字任务。2025 年 12 月的更新版本 Qwen-Image-2512 改进了人物真实感和文字排版,同时保留 Apache 2.0 许可证,因此如果你要自行托管,应优先选择这个检查点。更新的 Qwen-Image-2.0(2026 年 2 月)仅提供 API。
Ideogram 4.0(2026 年 6 月)是 Ideogram 首次发布的开放权重模型:这是一款专为设计工作打造的 9.3B 扩散 Transformer,通过结构化 JSON 提示词提供出色的多语言文字渲染,以及明确的布局和颜色控制。在围绕它开展项目之前,需要注意一个限制:推理代码采用 Apache 2.0 许可证,但模型权重使用非商业许可证,因此除非购买商业许可证,否则它只能用于研究和原型制作。
围绕 Stable Diffusion 建立的生态系统依然无可匹敌。ControlNet 可用于精确控制构图,局部重绘可用于修正细节,LoRA 微调可用于定制风格。FLUX 正在迎头赶上,但如果你现在需要深度定制,SD 更成熟的工具生态会给你更多发挥空间。
我的建议是这样考虑:制作纹理和精灵图时,两者都可以。制作有特定风格要求的概念美术时,选择搭配 LoRA 的 SD 3.5。追求可用于商业发行的纯粹质量时,选择 FLUX schnell。
3D 生成
如果你曾花八小时制作一个在游戏里只出现三秒的道具模型,这一节就是为你准备的。3D 生成早已从“有趣的研究”发展为真正的生产工具;到了 2026 年,开源模型的表现已经相当优秀。你可以在不到一分钟内,将一张草图变成带纹理的网格模型。
TRELLIS 可根据单张图像生成带 PBR 材质的纹理化 3D 网格模型
| 模型 | 机构 | 发布时间 | 主要特性 | 输出 | 每个网格模型成本 |
|---|---|---|---|---|---|
| TRELLIS.2-4B | Microsoft | 2025 年 12 月 | 4B 参数,原生 PBR,最高 1536³ | 带法线的纹理化网格模型 | ~$0.03 |
| Hunyuan3D 2.1 | 腾讯 | 2025 年 6 月 | 生产级 PBR,完整权重及训练代码 | 高保真纹理化网格模型 | ~$0.05 |
| SAM 3D | Meta | 2025 年 11 月 | 单图生成 3D(物体+人体) | 从单张照片生成网格模型 | ~$0.02 |
| Stable Fast 3D | Stability AI | 2024 年 8 月 | 单张图像 → 约 0.5 秒生成网格模型 | 快速生成纹理化网格模型 | ~$0.001 |
| TripoSG | VAST-AI | 2025 年 3 月 | 1.5B 修正流形状生成 | 高质量网格模型 | ~$0.01 |
| TripoSR | Stability / Tripo | 2024 | 快速单图重建 | 网格模型(无纹理) | ~$0.001 |
| UniRig | 清华大学 / Tripo | 2025 | 自动绑定:骨架+蒙皮权重 | 已绑定、可制作动画的网格模型 | ~$0.01 |
| 直接体验:TRELLIS.2 演示 ↗ · Hunyuan3D 演示 ↗ · InstantMesh 演示 ↗ |
查看示例: TRELLIS.2 项目页面 ↗ · 3D AI Studio 展示库 ↗
一个真正可行的工作流
目前真正受到创作者认可的做法,是将多个模型串联起来。先准备一张图片,无论是生成的还是拍摄的都可以。用 Stable Zero123 或 Wonder3D 将它转换为多个视角。再把这些视图交给 InstantMesh 或 TripoSR 生成网格。最后使用 TRELLIS.2 或 Hunyuan3D 制作合格的材质。
微软的 TRELLIS.2 是目前制作可用于生产的资产时表现最好的模型。它能处理其他模型容易出错的几何结构:薄表面、孔洞和复杂拓扑。其 4B 参数版本可输出带有真正 PBR 纹理的网格,而不是用顶点颜色冒充材质。
Stable Fast 3D 的重点是速度。从图片生成网格大约只需半秒。生成的网格仍需清理和制作纹理,但用于原型制作呢?用于在投入数小时之前判断一个想法是否可行呢?它无可匹敌。如果你想从单张图片获得更干净的几何结构,TripoSG 是更进一步的选择。
Hunyuan3D 2.1 是值得使用的腾讯开源模型:它提供完整权重、训练代码以及生产级 PBR 纹理功能。需要注意它的命名,因为这很容易让人混淆。Hunyuan3D 2.5、3.0 和 3.1 虽然都已存在,但只提供 API,没有公开权重,因此对于自托管而言,基础生成器的最高版本仍然是 2.1。腾讯还开放了两个基于 2.1 构建的实用扩展:Hunyuan3D-Omni 增加了多条件控制能力(点云、体素、骨骼、边界框),而 Hunyuan3D-Part 可以将网格拆分为可编辑的部件。它的许可证还排除了欧盟、英国和韩国,因此在这些地区发布作品前,请先核对相关条款。
SAM 3D(Meta,2025 年 11 月)是最新的入门方案:它可以将单张照片转换为 3D 网格,并分别提供用于物体和人体的模型。结合 Meta 的分割技术,你可以从图片中分离出某个物体,并只重建该物体。
UniRig(清华大学和 Tripo,MIT 许可证)填补了每个人生成网格后都会立即遇到的空白:绑定。它可以为输入网格自动生成有效的骨骼和蒙皮权重,让生成的角色真正能够制作动画,而不是只能作为静态道具摆在那里。将它与 NVIDIA SOMA-X 的自动动画技术结合后,全生成、全绑定的角色就不再只是研究演示。
对于独立创作者,比较现实的做法是:用 FLUX 生成概念图,通过 InstantMesh 制作几何结构,然后在 Blender 中绘制纹理,或者使用 TRELLIS 自动生成 PBR 材质。这样每项资产大约需要 30–60 分钟,而不是 4–8 小时。并非完全不花时间,但差别确实很大。
音频与音乐
音频生成尚未赶上图像和视频生成。但这里已经有足够多的工具能够改变你的工作方式,尤其是在原型制作和音效设计方面。
AI 生成的音乐示例。描述你想要的氛围,即可获得与之匹配的音乐
| 模型 | 机构 | 发布时间 | 功能 | 许可证 | 每 30 秒成本 |
|---|---|---|---|---|---|
| ACE-Step 1.5 | StepFun/ACE Studio | 2026 年 1 月 | 快速生成约 4 分钟音乐,支持 19 种语言、声音克隆 | MIT | 约 $0.02 |
| Stable Audio 3.0 | Stability AI | 2026 年 5 月 | 最长约 6 分钟的歌曲;开放 Small、Small-SFX 和 Medium 模型 | Stability Community | 约 $0.02 |
| YuE | MAP | 2025 年 1 月 | 根据歌词生成完整歌曲,包括人声与伴奏 | Apache 2.0 | 约 $0.05 |
| MusicGen | Meta | 2023 | 文本生成音乐,可控 | 代码 MIT / 权重 CC-BY-NC | 约 $0.01 |
| DiffRhythm 2 | ASLP-lab | 2026 年 2 月 | 快速生成完整歌曲 | Apache 2.0 | 约 $0.02 |
| Magenta RealTime | 2025 年 6 月 | 实时生成、可通过提示词控制的音乐 | 代码 Apache / 权重 CC-BY | 约 $0.02 |
直接体验:MusicGen 演示 ↗ · AudioCraft 体验场 ↗
查看示例: MusicGen 示例 ↗ · AudioGen 示例 ↗
真正可以用于发布的工具
Meta 的 MusicGen 仍然是制作游戏音频原型的实用选择。描述你想要的氛围,就能获得与之匹配的音乐,而且它在 12GB 显存的 GPU 上也能顺畅运行。不过许可证有一个需要注意的地方:MusicGen 的代码采用 MIT 许可证,但模型权重采用 CC-BY-NC(非商业)许可证,因此可以用它制作原型,但对于要正式发布的内容,应改用 ACE-Step 或 Stable Audio 等具备商业许可的模型。
**Stable Audio 的开放音效模型(Small-SFX)**可以处理脚步声、门轴吱呀声、环境风声和机械声,能够在本地运行,并采用 Stability 的社区许可证。因此,当你需要真正可用于商业项目的声音时,它是首选的开放音效方案。之所以应该选择它,是因为其他开放音效模型都附带额外限制:Meta 的 AudioGen 采用 CC-BY-NC 许可证,TangoFlux 则采用 Stability 的非商业社区许可证,因此对于要发布的游戏,两者都只能用于原型制作。
Magenta RealTime(Google)是其中最特别也最出色的一个:它是唯一专为实时、持续通过提示词控制的音乐而构建的开放权重模型。它不会渲染一条完成的音轨,而是在播放过程中实时生成音乐,并允许你不断调整方向。这正好符合自适应游戏配乐的需求——音乐可以随着玩家的行为发生变化。代码采用 Apache 2.0 许可证,权重采用 CC-BY 许可证,两者均可用于商业项目。
YuE 确实令人兴奋。它是第一个能够生成人声完整歌曲的开放模型。主题曲、带有真实演唱的背景音乐,它都能生成。质量会有波动,但相比其他可以下载并自行运行的工具,它已经领先了一大截。
ACE-Step 是目前值得了解的开放音乐模型,而且进步很快:1.5 系列(2026 年 1 月发布,并包含更大的 5B XL 变体)已经取代 2025 年 5 月发布的初始版本,如今采用 MIT 许可证。它可以快速生成数分钟的音乐,支持 19 种语言,并具备声音克隆、混音和歌词编辑功能。在游戏原型制作方面,它填补了 YuE 和 MusicGen 遗留的许多空白。
Stable Audio 3.0(2026 年 5 月)是音频领域更重大的一次更新。它能够生成最长约六分钟的歌曲,而且 Stability 为四个变体中的三个发布了开放权重:Small 和专用音效模型 Small-SFX 都能在设备端运行,Medium 则提供更出色的音乐结构和完整的音轨长度。只有 Large 模型仍然仅提供 API。Small-SFX 目前是专门生成游戏音效的最强开放方案。整个系列均使用获得许可的数据进行训练,因此相比那些仍面临训练数据诉讼争议的音乐生成器,它在法律层面的基础更加稳妥。
坦率地说:开放模型与封闭模型(Suno、Udio)之间的差距正在缩小,但在完整人声歌曲方面仍然十分明显,而且这些封闭工具也面临尚未解决的训练数据诉讼。对于音效,开放模型(尤其是 Stable Audio 的 SFX 模型)已经具备真正的竞争力。对于准备正式发布的歌曲,应做好大量迭代的准备,或者请音乐人负责最终制作,并将这些工具用于其他环节。
语音与配音
语音生成早已超过了“游戏够用”的水平,这改变了小型团队所能实现的内容。
AI 生成的游戏旁白,语音自然,节奏恰当且富有情感
| 模型 | 机构 | 发布时间 | 核心功能 | 许可证 | 每分钟成本 |
|---|---|---|---|---|---|
| Qwen3-TTS | Alibaba | 2026 年 1 月 | 3 秒声音克隆、声音设计、10 种语言 | Apache 2.0 | 约 $0.002 |
| Chatterbox | Resemble AI | 2025 | 情绪控制、用约 5 秒音频克隆、23 种语言 | MIT | 约 $0.003 |
| CSM | Sesame AI | 2025 年 3 月 | 对话节奏、自然停顿 | Apache 2.0 | 约 $0.005 |
| Fish Speech 1.5 | Fish Audio | 2024 | 使用 10–30 秒音频进行零样本克隆 | 代码 Apache / 权重 CC-BY-NC-SA | 约 $0.002 |
| OpenVoice V2 | MyShell/MIT | 2024 年 4 月 | 情绪与口音控制 | MIT | 约 $0.003 |
| XTTS-v2 | Coqui(社区) | 2024 | 17 种语言、声音克隆 | CPML(非商业) | 约 $0.005 |
试听示例: Fish Audio 声音 ↗ · OpenVoice 演示 ↗
让 NPC 听起来像真人
Sesame 的 **CSM(Conversational Speech Model)**专为对话构建。它能够生成自然的停顿、语调变化以及真实交谈的节奏。大多数 TTS 听起来都像有人在照着脚本朗读,而且你立刻就能听出来。CSM 则听起来像有人真的在说话。这种差别比你想象的更加重要。
Qwen3-TTS(阿里巴巴,2026 年 1 月)是商业项目的首选。整个系列都采用 Apache 2.0 许可证,只需约 3 秒的参考音频即可克隆声音,支持 10 种语言,还支持基于描述的声音设计,因此你可以直接用自然语言指定 NPC 的声音,而不必四处寻找参考录音。0.6B 和 1.7B 模型可以在配置适中的硬件上运行。
Chatterbox(Resemble AI)是表现力丰富的声音生成首选,而且采用 MIT 许可证,因此可以用于正式发布。它只需约 5 秒音频即可克隆声音,延迟低于 200 毫秒,支持 23 种语言,并且是首个提供情绪夸张程度控制的开放模型,因此 NPC 可以真正表现出愤怒或恐惧,而不是语气平淡。另外两个采用 Apache 2.0 许可证的选项适合特定场景:Orpheus(Canopy)支持 <laugh> 和 <sigh> 等内联情绪标签,非常适合映射到 NPC 的短促台词,并提供适合低端硬件的 150M 变体;Dia(Nari Labs)则专为多说话人对话而构建,可以单次生成包含咳嗽、笑声等非语言声音的内容。
Fish Speech 和 OpenVoice 可以处理声音克隆。录制配音演员 10–30 秒的声音,随后即可用该声音生成不限数量的对白。想想这意味着什么:你可以聘请配音演员录制关键台词,然后扩展其表演,覆盖数百种变化和环境对白。关于 Fish Speech,有一点许可证问题需要注意:代码是开放的,但 1.5 版权重采用 CC-BY-NC-SA 许可证,因此它只能用于原型制作。对于正式发布的游戏,请改用 OpenVoice(MIT)或 Qwen3-TTS(Apache 2.0)。
NVIDIA ACE(并非完全开放,但值得了解)现在支持使用 Qwen3-8B 在设备端部署 NPC。本地 LLM、本地 TTS 和口型同步全部运行在消费级 GPU 上。对于无需调用云端服务的实时 NPC 对话,这就是一套完整的技术栈。
对独立创作者来说,合理的做法是:为主要角色和最重要的台词聘请配音演员。使用 Qwen3-TTS 或 OpenVoice 扩展环境对白、台词变体,以及所有那些原本只能保持沉默或制作成本过高的零散台词。
世界模型与游戏模拟
从这里开始,一切变得真正奇异,也真正令人兴奋。这些模型生成的不是静态资产,而是具有游戏体验感的内容。
🎮 体验 Oasis:AI 生成的《我的世界》无需游戏引擎,只靠 AI 预测实时生成世界
| 模型 | 机构 | 发布时间 | 功能 | 状态 | 每帧成本 |
|---|---|---|---|---|---|
| DIAMOND | Research | 2024 | 扩散世界模型、Atari 模拟 | 开放权重 | 约 $0.001 |
| Oasis | Decart/Etched | 2024 年 10 月 | 实时生成《我的世界》 | 开放 500M 权重 | 约 $0.002 |
| MineWorld | Microsoft | 2025 年 4 月 | 实时《我的世界》,Oasis 的开放替代方案 | MIT | 约 $0.002 |
| Hunyuan-GameCraft | Tencent | 2025 年 8 月 | 交互式游戏视频、键盘和鼠标控制 | Tencent Community | 约 $0.005 |
| GameGen-X | Research | 2024 | 开放世界视频生成 | 开放代码和数据集 | 约 $0.005 |
| NVIDIA Cosmos | NVIDIA | 2025 年 10 月 | 物理 AI 模拟(Predict2.5) | NVIDIA Open Model License | 约 $0.01 |
| Matrix-Game 3.0 | Skywork | 2026 年 3 月 | 实时 720p 交互世界、长期记忆 | 开放权重 | 约 $0.005 |
| Genie 2 | DeepMind | 2024 年 12 月 | 从图像生成交互式 3D 内容 | 未发布 | 不适用 |
| Genie 3 | DeepMind | 2025 年 8 月 | 实时 720p 世界、可通过提示词触发事件 | 封闭(Project Genie) | 不适用 |
查看研究成果:DIAMOND 项目页面 ↗ · Cosmos 博客 ↗立即体验:Oasis 在线演示 ↗ · Genie 2 示例 ↗
为什么你应该关注这些模型
DIAMOND 证明了一件足以改变你对游戏 AI 看法的事:你可以完全在生成的世界中训练智能体,训练时根本不需要真实的游戏引擎。AI 在扩散模型的想象世界中游玩,之后再将能力迁移到真实游戏中。这背后的意义非常重大。
Oasis 可以实时运行一个类似《我的世界》的世界,一帧一帧地生成。没有游戏引擎,没有纹理,也没有预制资源,只有一个 Transformer 在预测接下来会发生什么。它目前只是概念验证,但可以想象这项技术未来会走向何方。拥有 5 亿参数的版本已经开放。
GameGen-X 发布了规模最大的开放世界游戏视频数据集。如果你想训练自己的模型,或对现有模型进行微调来生成类似游戏的内容,可以从这里开始。
NVIDIA Cosmos 原本是为机器人和自动驾驶车辆构建的,但它的世界基础模型同样适用于游戏。这些模型能够理解物理规律、物体恒存性和空间关系。目前的开放模型系列是 Cosmos-Predict2.5,于 2025 年 10 月根据 NVIDIA Open Model License 发布,允许商业使用和创建衍生作品。
Hunyuan-GameCraft(腾讯,2025 年 8 月)是开放世界模型中形态最贴近游戏的一款。它使用来自 100 多款 AAA 游戏、超过 100 万份录像进行训练,并将键盘和鼠标输入统一到共享控制空间中,因此生成的是可以由你实际操控的交互式游戏视频,而不只是供你观看的视频。它采用与 Hunyuan3D 相同的 Tencent Community License,同样排除了欧盟、英国和韩国,因此在这些地区发布产品之前请先核对条款。MineWorld(Microsoft、MIT)则是 Oasis 的完全宽松许可版本:一个无需游戏引擎即可下载并运行的实时《我的世界》世界模型。
Genie 3(DeepMind,于 2025 年 8 月公布)是一次值得关注的飞跃:它是第一个支持实时交互的世界模型,能以 24fps 生成可探索的 720p 世界,并在数分钟内保持一致性;它还支持“可提示的世界事件”,能够根据指令改变天气或添加物体。2026 年 1 月,它以 Project Genie 的形式向美国的 Google AI Ultra 订阅用户开放。权重仍未开放,但它展示了可游玩生成世界的发展方向。
Matrix-Game 3.0(Skywork,2026 年 3 月)是针对 Genie 的开放方案。这是一款具备记忆增强能力的交互式世界模型,能以 40fps 实时流式生成 720p 画面,并在长达一分钟的序列中保持场景一致性。其 5B 蒸馏版本可实现实时推理,体量更大的 2x14B MoE 版本则进一步提升质量;模型权重已在 Hugging Face 上以 Apache 2.0 许可证发布。如果你现在就想试验可游玩的生成世界,而不是等待 DeepMind,那么这款模型是你真正可以下载使用的选择。
就现阶段的实际游戏开发而言,这些仍然属于研究工具。但如果你正在研究 AI 驱动的内容、程序化生成,或者只是在思考这一切将走向何方,那么这里就是技术前沿。
大语言模型
LLM 可以驱动对话、任务生成和游戏逻辑。如今的开放模型已经能够真正与 GPT-4 竞争,而两年前还并非如此。
| 模型 | 机构 | 发布时间 | 规模 | 最适合 | 许可证 | 每千 Token 成本 |
|---|---|---|---|---|---|---|
| DeepSeek-V3 | DeepSeek | 2024 年 12 月 | 671B MoE(激活 37B) | 推理、通用任务 | 宽松许可 | ~$0.02 |
| DeepSeek-R1 | DeepSeek | 2025 年 1 月 | 基于 V3 | 思维链推理 | 宽松许可 | ~$0.03 |
| DeepSeek-V3.2 | DeepSeek | 2025 年 12 月 | 稀疏注意力(DSA) | 推理与工具调用 | MIT | ~$0.02 |
| DeepSeek-V4 | DeepSeek | 2026 年 4 月 | 1.6T MoE(激活 49B) | 前沿推理、1M 上下文 | MIT | ~$0.02 |
| GLM-5 | Zhipu / Z.ai | 2026 年 2 月 | 744B MoE(激活 40B) | 编程、智能体、工具调用 | MIT | ~$0.02 |
| GPT-OSS | OpenAI | 2025 年 8 月 | 120B / 20B MoE | 推理、工具调用、端侧运行 | Apache 2.0 | ~$0.01 |
| Kimi K2 | Moonshot | 2025 年 | 1T MoE(激活 32B) | 智能体、编程 | 修改版 MIT | ~$0.02 |
| Kimi K3 | Moonshot | 2026 年 7 月 | 2.8T MoE(约激活 50B) | 前沿智能体、编程、1M 上下文、视觉 | 开放权重(7 月 27 日) | ~$0.03 |
| Gemma 3 | 2025 年 | 1B-27B | 端侧运行、140 种语言、视觉 | Gemma | ~$0.01 | |
| Qwen3 | Alibaba | 2025 年 | 235B MoE(激活 22B) | 多语言、编程 | Apache 2.0 | ~$0.01 |
| Qwen3-Coder | Alibaba | 2025 年 | 480B MoE(激活 35B) | 智能体编程、256K 上下文 | Apache 2.0 | ~$0.02 |
| Llama 4 | Meta | 2025 年 | 多种规模 | 智能体、最高 10M 上下文 | Llama Community | ~$0.01 |
| Qwen3-VL | Alibaba | 2025 年 | 2B-235B | 视觉与语言 | Apache 2.0 | ~$0.02 |
| InternVL3 | Shanghai AI Lab | 2025 年 | 1B-78B | 视觉、OCR、界面定位 | MIT | ~$0.02 |
开始使用:Hugging Face 上的 Qwen3-8B ↗ · Hugging Face 上的 DeepSeek-V3 ↗ · Hugging Face 上的 GLM-5 ↗
用于游戏开发
Qwen3 是大多数游戏用途中的务实选择。它采用 Apache 2.0 许可证,意味着你拥有自己的集成成果。它具备强大的多语言支持,如果你正在考虑本地化,这一点非常重要。它也很擅长遵循结构化指令。7B 和 14B 版本可以在消费级 GPU 上本地运行。
DeepSeek-V3 在大多数基准测试中能够追平或超越 GPT-4。它的架构设计很巧妙:尽管总参数量达到 671B,但每个 Token 仅激活 37B 参数。你需要性能强劲的硬件(多 GPU),但无需依赖 API 即可获得前沿级别的质量。
DeepSeek-V3.2(2025 年 12 月)将推理与工具调用整合到同一个模型中,并引入 DeepSeek Sparse Attention(DSA),以降低长上下文推理的成本;它还提供面向顶级推理基准测试、投入更多计算资源的 Speciale 版本。对于游戏逻辑和对话而言,它比 V3 更强,也更适合作为具备智能体能力的直接替代方案。
DeepSeek-V4(2026 年 4 月)再次推动了开放模型的前沿。V4-Pro 是一个拥有 1.6T 参数的 MoE 模型,每个 Token 仅激活 49B 参数,具备 100 万 Token 的上下文窗口和可选择的推理模式,并且完全采用 MIT 许可证。V4-Flash 版本(总计 284B 参数,激活 13B)保留了 1M 上下文能力,同时不需要完整的 GPU 集群。如果你现在要为复杂任务逻辑或超长游戏状态上下文选择开放模型,它代表着目前的能力上限。
GLM-5(智谱 AI,2026 年 2 月)是目前在编程和智能体任务方面最具竞争力的开放模型,GLM-5.2 更新版又将工具调用和长周期规划能力提升到了接近闭源前沿模型的水平。它是一个拥有 744B 参数、每个 Token 激活 40B 参数的 MoE 模型,具备 200K Token 上下文,并采用 MIT 许可证。Z.ai 是第一家上市的基础模型公司,其托管 API 定价也非常激进(每百万输入 Token 约 1.40 美元);如果你更愿意自行托管,模型权重也已发布在 Hugging Face 上。如果你的游戏依赖 LLM 进行任务脚本编写、工具调用型智能体或代码驱动系统,GLM-5 是一个由你完全掌控的强大 OpenAI 替代方案。
GPT-OSS(OpenAI,2025 年 8 月)是 OpenAI 首次发布的开放权重模型,也完全契合本指南的主题。gpt-oss-120b 可以在单张 80GB GPU 上以大致相当于 o4-mini 的水平进行推理和调用工具,而 gpt-oss-20b 可以在一张 16GB 消费级显卡上运行,两者均采用 Apache 2.0 许可证。如果你想自行托管一款来自西方实验室的模型,用于 NPC 逻辑或可调用工具的智能体,这就是首选。
Kimi K2(Moonshot)是与 GLM-5 和 DeepSeek 并列的另一款开放智能体重量级模型。它是一个拥有 1 万亿参数、激活 32B 参数的 MoE 模型,重点针对编程和工具调用进行了调优。其修改版 MIT 许可证仅对月活用户超过 1 亿的产品增加限制,因此对独立开发者而言基本等同于 MIT。需要智能体执行多步骤规划时,可以考虑它。
Kimi K3(Moonshot,2026 年 7 月)是有史以来公布的最大开放权重模型,其能力比此前任何开放模型都更接近闭源前沿模型。它是一个拥有 2.8 万亿参数、每个 Token 仅激活约 50B 参数(896 个专家中激活 16 个)的 MoE 模型,具备 1M Token 上下文和原生视觉能力,并采用名为 Kimi Delta Attention 和 Attention Residuals 的两种全新注意力设计。根据 Moonshot 公布的数据,它在编程和智能体基准测试中击败了 Claude Opus 4.8 和 GPT-5.5,仅落后于最顶尖的少数专有模型。问题在于它的规模:权重将于 2026 年 7 月 27 日发布,MXFP4 格式下约为 1.4TB,因此自行托管需要多节点 GPU 集群,大多数团队会通过 API 使用它,价格为每百万输入 Token 3 美元、每百万输出 Token 15 美元。对于你真正能够自行运行的智能体,K2 仍然是更实用的 Moonshot 选择,但 K3 重新定义了顶级“开放”模型所能达到的高度。
Gemma 3(Google)最适合需要在玩家硬件上运行或进行大范围本地化的情况。它提供 1B、4B、12B 和 27B 多种规模,因此从 8GB 显卡起即可运行;它支持 140 种语言和函数调用,4B 及以上版本还可以理解图像,因此也能兼作小型视觉模型。Gemma 许可证允许商业使用。
Qwen3-Coder(Alibaba)是专用的开放编程模型,在大多数用途上取代了较早的 DeepSeek-Coder 系列。它是一个拥有 480B 参数、激活 35B 参数的 MoE 模型,原生上下文长度为 256K(可扩展至 1M),采用 Apache 2.0 许可证,并在智能体编程基准测试中达到 Claude Sonnet 级别。如果你的游戏会生成或运行代码,它就是目前开放模型的能力上限。欧洲的 Mistral 系列(用于编程的 Devstral、用于端侧运行的 Mistral Small 3.x,二者均采用 Apache 2.0)则是可靠且可自行托管的替代方案。
Qwen3-VL 增加了视觉理解能力,提供从 2B 到 235B 的稠密和 MoE 版本,并采用 Apache 2.0 许可证。它适用于需要分析截图、理解玩家绘制内容或处理摄像头输入的游戏。8B 版本可以在单张 GPU 上运行。InternVL3(Shanghai AI Lab,MIT)是另一个强大的开放视觉语言模型,尤其擅长 OCR 和界面定位;如果你的工具需要读取游戏界面,这一点很重要。Mistral 的 Pixtral 12B(Apache 2.0)则是更轻量、可放心用于商业项目的选择。
对于端侧 NPC,也就是无需调用云端服务即可实时响应的角色,目前最实用的方案是通过 NVIDIA ACE 运行 Qwen3-8B。它可以在玩家的硬件上与游戏同时运行。
实用工具模型
这些模型不会直接生成内容,但能让你的工作流真正运转起来。
SAM 2 可以分割图像和视频中的任意物体。只需点击一次,即可获得完美蒙版
| 模型 | 机构 | 发布时间 | 功能 |
|---|---|---|---|
| SAM 2 | Meta | 2024 年 8 月 | 分割图像和视频中的任意内容 |
| Depth Pro | Apple | 2024 年 10 月 | 从单张图像生成度量深度 |
| gsplat | Nerfstudio | 2024 年至今 | CUDA 加速的高斯泼溅 |
SAM 2 可以实时分割视频中的物体。点击某个对象,即可获得完美蒙版。它适用于动态遮罩、合成,或者从影像中提取物体作为游戏资源。试用 SAM 2 ↗
Apple 的 Depth Pro 能在不到一秒的时间内从单张图像生成度量深度图。这带来了许多可能性:利用视差效果将 2D 美术转换为 2.5D、为 3D 重建生成深度数据,以及从平面图像创建法线贴图。Hugging Face 上的 Depth Pro ↗
gsplat 是高斯泼溅的高速实现。如果你要为游戏采集真实环境,无论采用摄影测量还是环境扫描,它都能让这项工作变得切实可行。
我实际会使用的方案
如果你现在要启动一个游戏项目,下面这套技术栈比较合理:
纹理和精灵图:FLUX.1 [schnell],Apache 2.0,迭代速度快,质量足以用于正式发布
概念美术:SD 3.5 Large,并使用 LoRA 控制风格
3D 资源:使用 Hunyuan3D 2.1 或 TRELLIS.2 生成带纹理的网格;如果从照片开始,则使用 SAM 3D,之后在 Blender 中进行清理
自动绑定:使用 UniRig 或 NVIDIA SOMA-X 为生成的网格创建骨骼并蒙皮(二者均开放),而不是依赖 Mixamo
音效:Stable Audio 的开放 Small-SFX 模型,可本地运行并获得商业许可
音乐:原型阶段使用 ACE-Step,最终制作时再邀请作曲家参与
语音:使用 Qwen3-TTS 进行声音克隆和环境对话生成(Apache 2.0);需要真正情感表现的台词使用 Chatterbox(MIT);重要台词则交给配音演员
NPC 对话:本地运行 Qwen3-8B;复杂推理和工具调用则使用可自行托管的云端 LLM(GLM-5 或 DeepSeek-V4)
视频(过场动画):本地使用 Mochi 1,需要最终成片质量时在云端使用 HunyuanVideo
关于这一切,有一点必须说明:最常见的错误就是试图让 AI 完成所有工作。这些是工具,而不是替代品。它们可以压缩迭代、制作变体和创建占位资源等繁琐环节所需的时间,让你把精力投入到真正重要的创意决策上——也就是那些让你的游戏独一无二的部分。
硬件现实检查
坦白来说,要运行这些模型,你实际需要的硬件如下:
8GB 显存(RTX 3060、4060):SD 1.5/SDXL、Wan 2.1 小型版、AudioGen、Fish Speech、小型 LLM(7B 量化版)。这属于游戏本级别的配置,但已经足够让你开始尝试。 12GB 显存(RTX 3080、4070):SD 3.5、FLUX schnell、Mochi 1、MusicGen、TripoSR、量化版 Qwen 14B。到了这个档位,使用体验就比较舒适了。大多数实用模型都能在这里运行。
24GB 显存(RTX 3090、4090):可全精度运行大多数模型、InstantMesh 和更大的 LLM。如果你打算认真采用这套工作流,这是最理想的配置。
48-80GB 显存(A100、H100):HunyuanVideo、LTX-2、DeepSeek-V3,以及生产规模的生成任务。这是企业级硬件。你不会购买它,而是租用它。
RunPod、Lambda Labs 或 Modal 上的云实例使用 A100 每小时约需 2-4 美元。对于偶尔使用的场景,这比购买硬件更便宜。需要最终成品质量时启动实例,完成后将其关闭即可。
关于本指南中的成本估算:单次生成成本按在云端 GPU 上自行托管推理计算,价格约为每小时 2-3 美元(A100)或每小时 0.40 美元(RTX 4090)。实际成本会因硬件、优化方式和批量大小而异。这些只是用于规划的粗略数字,实际情况可能有所不同。
2026 年的新进展
近期发布:LTX-2 和 LTX-2.3 带来了支持原生 4K 的开放式音视频同步生成。微软的 TRELLIS.2(2025 年 12 月)成为开放式图像转 3D 领域的领先模型,Meta 的 SAM 3D(2025 年 11 月)则让通过单张照片重建 3D 模型真正具备了实用性。FLUX.2 取代 FLUX.1 成为新一代图像生成模型,NVIDIA 的 SOMA-X 则带来了开放式自动绑定与动作重定向。2026 年上半年依然保持着这一发展速度:Qwen3-TTS(1 月)为语音克隆提供了一个真正采用 Apache 2.0 许可证的归宿;智谱的 GLM-5(2 月)以 MIT 许可证发布了一个拥有 744B 参数、面向编程和智能体任务的开放模型;Skywork 的 Matrix-Game 3.0(3 月)以开放权重形式推出了实时交互式世界模型;DeepSeek-V4(4 月)以 MIT 许可证将开放式 LLM 的上下文窗口推向 100 万 token;Stable Audio 3.0(5 月)发布了三个基于获授权数据训练的开放音频模型;Ideogram 则发布了其首个开放权重图像模型(6 月)。随后在 7 月,Moonshot 宣布推出 Kimi K3——一个拥有 2.8T 参数的开放权重模型,在智能体基准测试中超过 Claude Opus 4.8 和 GPT-5.5,其权重将于 7 月 27 日发布。
值得关注的趋势:头部实验室越来越倾向于仅通过 API 提供最新模型,即便其早期版本曾经开放。Wan 从 2.5 开始转为闭源,并一直延续到 2.7;Qwen-Image 从 2.0 开始闭源;Hunyuan3D 也从 2.5 开始闭源。开放生态依然充满活力并快速发展,但不能再想当然地认为“最新版本一定开放”。因此,在围绕某个模型构建工作流之前,请先确认其权重是否可用。
发展轨迹很清晰:闭源模型具备的每项能力,通常都会在 6-12 个月后出现在开放模型中。问题已经不再是开放模型是否足够好——对于大多数用途,它们已经足够优秀。真正的问题是,它们会多快成为默认选择。
而这对创作者意味着:过去需要企业级预算或按月订阅才能使用的工具,正在变成你可以直接……运行的东西。就在你自己的硬件上。无需获得任何人的许可。
这就是正在发生的转变。也是我们努力构建的未来。
常见问题
哪款开源 AI 模型最适合生成游戏资产?
这取决于资产类型。对于 3D 模型,Hunyuan3D 是 2026 年最强的开放选项。对于 2D 美术和纹理,FLUX 在质量方面领先。对于音效和音乐,开放音频模型也已迅速追赶上来。不存在唯一“最佳”的模型,因为游戏需要多种类型的资产,所以大多数创作者会串联使用多个模型,而不是依赖单一模型。
开源 AI 模型是否足以取代闭源 API?
对于 2026 年的大多数游戏资产制作工作来说,答案是肯定的。开放模型在图像、3D 和音频生成方面如今已能媲美闭源 API,而且你可以在自己的硬件上运行它们,无需支付按次调用费用,也不用担心突如其来的价格调整。在长视频等少数前沿任务上,闭源模型仍然领先,但差距通常会在 6 到 12 个月内缩小。
我能在自己的 GPU 上运行这些生成式 AI 模型吗?
很多模型都可以。图像和音频模型可以在 RTX 4090 这类单张消费级 GPU 上流畅运行。更大的视频和 3D 模型需要更多显存,通常需要使用 A100 级别的云端 GPU。上面的硬件章节列出了各模型的需求,方便你在投入使用前做好规划。
在商业游戏中使用 AI 生成的资产合法吗?
对于你自行运行的开源模型,通常是合法的,但具体取决于模型许可证以及你对训练数据的判断。务必查看具体模型的许可证,并在平台要求时披露 AI 生成内容。有关我们的处理方式,请参阅 AI 生成内容政策。
延伸阅读
- AI 争议、信任与后 AI 经济 — 我们对游戏中 AI 应用的立场
- AI 生成内容政策 — 我们如何处理 AI 内容披露
- 2026 年 Web 游戏技术栈 — 游戏开发中的 WebGL、WebGPU 和 Wasm
- 浏览器 3D 开放世界技术 — 在浏览器世界中使用 AI 生成的 3D 资产
- 浏览器开放世界的景观生成 — 基于扩散模型的地形合成
- 去哪里寻找免费游戏资产 — 除 AI 生成外的传统资产来源
- 智能体式 AI 编程工具 — 用 AI 编写游戏代码,而不只是生成资产