Skip to content

支持参考图像的最佳 AI 视频模型(2026) ​

最后更新:2026 年 9 月。

如今,生成一段 10 秒的视频轻而易举。各大主流模型都能做到。真正的问题是:你能否生成 5 分钟或 10 分钟的连贯视频,让一个角色在第 1 分钟和第 8 分钟看起来始终一致?让场景在数百帧画面中保持统一?

这才是真正的难题,也是目前变化最快的领域。本指南涵盖了我们找到的所有此类模型:它们要么能原生生成长视频,要么支持通过参考图像保持角色一致性,从而构建长篇内容所需的工作流。我们将其分为三个层级:可直接生成数分钟视频的模型、具备强大参考图像支持并可通过续写来扩展视频的模型,以及可自行运行的开源方案。

第一梯队:原生长视频生成(数分钟以上) ​

这些模型生成的视频以分钟而非秒来衡量。它们从底层开始就是为长序列中的时间一致性而设计的。

LongCat Video ​

美团于 2025 年底发布了 LongCat Video。这是一个拥有 136 亿参数的扩散 Transformer,也是首个能可靠生成最长 15 分钟连贯视频的模型。

该模型在统一的管线中支持文生视频、图生视频和视频续写。在 I2V 模式下,输入图像会成为视频真正的第一帧。它并不是可放入任意场景的宽松角色参考;模型会从该起始帧向后生成动画,同时使用“跨片段潜变量拼接”(Cross-Chunk Latent Stitching),在整个生成过程中持续参考原始图像,从而防止色彩漂移,并在长序列中维持视觉一致性。2026 年更新的版本还加入了音频驱动的数字人生成能力,可为 5 分钟以上的真人讲解视频实现口型同步。

在底层,LongCat 采用由粗到细的生成方法,并通过块稀疏注意力(Block Sparse Attention)处理超长序列。RLHF 调优则改善了运动质量。在 VBench 2.0 基准测试中,它的综合排名位列第三,仅次于 Google Veo 3 和生数科技的 Vidu Q1。

**可用性:**采用 MIT 许可证开源。可通过 fal.ai API 使用,每生成 1 秒收费 0.04 美元(生成一段 720p、15 分钟的视频需 36 美元)。LongCat 自有平台也提供按点数计费的服务。

规格数值
最长时长约 15 分钟
分辨率720p、30fps
参数量136 亿
参考图像仅限首帧(I2V 模式,并非角色参考)
许可证MIT
API 成本约 0.04 美元/秒(fal.ai)

Seaweed APT2 ​

字节跳动的 Seaweed APT2 采用了不同的方法。它不会预先生成完整视频,而是以 24fps 自回归生成画面,在单张 H100 上每帧延迟仅为 0.16 秒。最终可生成最长 5 分钟的稳定视频,同时保持时间一致性。

其技术诀窍是自回归对抗后训练(Autoregressive Adversarial Post-Training,AAPT),它将预训练的双向视频扩散模型转换为单向自回归生成器。每一帧只需一次网络前向计算,因而能够实现实时生成。

除了时长本身,这个模型的另一个亮点是交互性。你可以控制镜头、通过姿态检测驱动角色,并在视频渲染期间操控场景。与其把它理解为“生成一段视频”,不如将其看作“实时引导一段视频”。

**可用性:**目前仅处于研究阶段,尚未公开。其 70 亿参数基础模型(Seaweed-7B)已有公开论文,但 APT2 的权重尚未发布。

规格数值
最长时长约 5 分钟
分辨率736x416(单 GPU),最高 720p(8 张 GPU)
参数量80 亿
参考图像通过 I2V 和交互式姿态控制支持
许可证尚未发布
状态研究预览

Helios ​

Helios 来自北京大学,基于 Wan 2.1 构建。这是一个拥有 140 亿参数的模型,可在单张 H100 上以 19.5 FPS 生成分钟级视频。其关键创新在于处理长视频漂移的方式。Helios 没有采用自强制或关键帧采样等传统抗漂移技术,而是在训练期间模拟漂移,让模型学会自行纠正。

它原生支持文生视频、图生视频和视频转视频任务。I2V 模式可接受参考图像作为生成起点。

**可用性:**采用 Apache 2.0 许可证完全开源。于 2026 年 3 月发布。代码和权重托管于 GitHub(PKU-YuanGroup/Helios),并已集成到 Diffusers、SGLang 和 vLLM-Omni 中。HuggingFace Spaces 上提供 Gradio 演示。

规格数值
最长时长分钟级(无固定上限)
分辨率720p
参数量140 亿
参考图像支持(I2V 模式)
许可证Apache 2.0
硬件单张 H100 可实时生成

SkyReels V2 / V3 ​

SkyReels V3 可接受 1~4 张参考图像,并生成时长不限的视频,支持多镜头切换和音频引导的数字人合成。

Skywork 的 SkyReels 系列以无限时长视频为目标。V2 使用自回归扩散强制(AutoRegressive Diffusion-Forcing)架构,可在没有固定时长上限的情况下生成视频。V3 于 2026 年 1 月发布,在单一模型中统一了参考图像转视频、视频转视频扩展和音频引导的数字人生成能力。

V3 可接受 1~4 张参考图像,并在生成的视频中保持主体身份一致。视频转视频模式既支持无缝的单镜头续写,也支持带有电影化转场的多镜头切换。

Skywork 于 2026 年 2 月 25 日发布了 SkyReels V4。这是一个双流模型,可同时生成最高 1080p/32fps 的视频和音频,并接受文本、图像、视频片段、蒙版和音频作为条件输入。这里需要更正我们 7 月文章中的一处说法:V4 并未开源。截至 2026 年 9 月,SkyworkAI GitHub 组织中只有 V1 至 V3 和 Matrix-Game 的仓库,没有 V4 权重或公开 API,因此 V3 仍是 Skywork 开源参考图生视频模型的最高水平。

**可用性:**完全开源。模型参数量从 13 亿到 140 亿不等,提供 540p 和 720p 版本。代码和权重托管于 GitHub 和 HuggingFace。

规格数值
最长时长不限(自回归)
分辨率540p、720p
参数量13 亿、50 亿、140 亿
参考图像1~4 张图像(V3)
许可证开源
硬件最低 RTX 4090,建议 4~8 张 A100

第二梯队:支持强参考与扩展的短片模型 ​

这些模型可生成 8~60 秒的短片,但提供强大的参考图像支持和视频扩展功能。对于长篇内容,你可以使用模型的续写或扩展端点将多个片段串联起来。角色一致性来自在多次生成中持续使用的参考图像。

这是目前大多数创作者制作一分钟以上内容时使用的实用工作流。单个片段的画质通常高于原生长视频模型。

Kling 3.0 Omni(快手) ​

Kling 3.0 Omni 可在一次调用中结合角色元素、风格参考和多镜头分镜,并原生输出 4K 60fps 视频。

Kling 拥有所有视频模型中最完整的参考图像系统。它将参考输入划分为三个不同类别,每个类别各有用途:

参考图像(image_urls):最多 4 张图像,用于引导风格和外观。你可以在提示词中通过 @Image1、@Image2 等标签引用它们。这些图像会影响整体视觉效果、场景风格和环境,而不会被用作第一帧。

元素(elements):专用于角色或物体的输入。每个元素需要一个 frontal_image_url(清晰的正面照片),还可添加可选的 reference_image_urls(其他角度)。你可以在提示词中通过 @Element1、@Element2 引用它们。模型会提取角色身份,并将其放入你描述的任意场景。这是制作冒险电影式内容的关键功能:上传一张角色照片,然后描述该角色穿越森林、与巨龙战斗,或进行任何你想要的活动。

起始帧/结束帧(start_image_url、end_image_url):将特定图像固定为第一帧或最后一帧。它们是真实的视频帧,而不是风格指南。

这三个类别合计最多可提供 7 个参考输入(同时使用参考视频时降至 4 个)。通过 "@Element1 and @Element2 are having dinner at this table on @Image1" 这样的单条提示词,就能将角色与场景参考组合起来。

对于长篇内容,Kling 提供两条路径。多镜头模式可在一次调用中生成最多 6 个场景,每个场景都有自己的提示词和时长(每段 3~15 秒)。角色元素会自动在所有镜头中保持一致。扩展 API 会从已完成视频的结尾继续生成,通过连续扩展最长可达到约 3 分钟。V2V 编辑模式可接收现有视频(3~10 秒),并使用元素参考和文本提示对其进行转换:它会保留源视频中的镜头运动和角色调度,同时根据参考素材重新设计角色和环境的风格。这使 Kling 特别适合增强现有素材,包括低保真 3D 渲染视频。

Kling 3.0 Omni 在单一模型中统一了文生视频、图生视频、参考图生视频和视频编辑,并支持原生音频生成与口型同步。2026 年 6 月,快手推出了 Kling 3.0 Turbo,这是一个更快、更便宜的版本,在 720p 和 1080p 下均捆绑音频;同时,Omni 的编辑管线也升级为可输入和输出 4K 视频。截至 2026 年 9 月,Kling 3.5 或 4.0 均未发布,因此 3.0 Omni 仍是当前的视频模型。

**可用性:**可通过快手、fal.ai 和 Replicate 的商业 API 使用,按秒计费,价格因分辨率和版本而异。网页界面位于 klingai.com。

规格数值
原生片段时长3~15 秒
扩展后时长约 3 分钟(通过连续扩展)
分辨率720p、1080p(Omni 编辑模式支持 4K)
参考图像最多 4 张(@Image 风格参考)
元素最多 4 个(@Element 角色参考,包含正面图和其他角度)
参考输入总数合计最多 7 个(使用参考视频时为 4 个)
多镜头支持(分镜中最多 6 个镜头)
音频原生同步音频与口型同步
视频编辑支持(以文本引导编辑现有视频)
API快手、fal.ai、Replicate

Kling 使用多张参考图像进行图生视频 ​

这是我们收到的关于 Kling 最多的问题,因此下面根据 Kling 官方的 VIDEO 3.0 Omni 指南,简要说明当前模型的多图参考工作方式。标准图生视频会接收一张图片,并将其作为第一帧进行动画化。多图参考则是一种不同的模式:你可以上传多张图像,在提示词中为它们添加标签,然后由模型根据这些图像合成一个新镜头。如果请求中没有参考视频,可附加的图像和元素合计最多为 7 个;如果包含参考视频,则降至 4 个。一个角色元素本身最多可以由 4 张不同角度的照片构建,也可以由一段 3~8 秒的单角色视频片段构建;你还可以为它绑定一段 5~30 秒的录音,使角色在不同镜头中保持相同声音。在提示词中,你可以使用 @Image1 引用风格或场景参考,使用 @Element1(或你为元素指定的名称)引用锁定的角色或物体。因此,像“@Grace walks through @Image1 at dusk”这样的提示词,会把一个保持一致的角色放进你提供的场景中。输出最长可达 15 秒,支持 720p 或 1080p,并带有原生音频;同一套元素库还可用于 Kling 的多镜头分镜功能,让同一个角色在六镜头序列中保持一致。如果你只需要一致的静态图像而非视频,根据其图像指南,Kling IMAGE 3.0 最多可接受 10 张参考图像。常见工作流是先在其中锁定角色,再将生成的静态图作为元素输入视频模型。

Grok Imagine(xAI) ​

Grok Imagine 将参考模式与首帧模式分开,让你可以在提示词中标记最多 7 张图像,作为角色或物体参考。
xAI 于 2026 年初推出了 Grok Imagine 的参考图生视频模式,支持 1–7 张参考图。文档明确说明了它与图生视频的区别:“图生视频会将源图像作为起始帧,而参考图像只会影响视频中出现的内容,不会锁定第一帧。”

你可以在提示词中使用 <IMAGE_1>、<IMAGE_2> 等标签标记图像。像 "让 <IMAGE_1> 中的模特穿着 <IMAGE_2> 中的衬衫走上 T 台" 这样的提示词,会将人物参考与服装参考结合起来。该模型适用于虚拟试穿、产品植入,以及跨场景保持角色一致的叙事。

有一个限制:同一请求中不能同时使用参考图像和图生视频。你只能选择首帧模式或参考模式,不能同时使用两者。

Grok Imagine 还提供视频延长端点,可在现有视频末尾添加新画面。duration 参数仅控制新增部分的时长。你可以连续执行多次延长,以制作更长的内容。

xAI 于 2026 年 6 月 3 日以 API 预览版形式发布 Grok Imagine 1.5,并于 6 月 16 日以 grok-imagine-video-1.5 的名称正式开放,同时开始向消费级应用推出 Fast 变体。它是一款图生视频模型,可通过镜头运动、氛围、物理效果和在同一次推理中原生生成的同步音频,将单张静态图像转化为具有电影感的动态画面。它支持多镜头编排,可串联场景并保持一致性,能在约 25 秒内生成一段 6 秒的 720p 视频,并在发布时位列 Artificial Analysis 图生视频竞技场第三名。截至 2026 年 9 月,xAI 的模型页面显示,Grok Imagine Video 1.5 的价格为每秒 $0.08,初代 Grok Imagine Video 的价格为每秒 $0.05。xAI 更新的 Grok Imagine Image 2.0(列于其发行说明中)是一款静态图像模型,适合在制作动画前锁定角色形象,但它并不是新的视频模型。

可用性: xAI API(于 2026 年 1 月推出)、fal.ai 和 Replicate。提供 Python SDK、JavaScript/AI SDK 和 REST API。带音频的 720p 视频价格为每秒 $0.05。X Premium 订阅用户也可使用。

规格参数
原生视频片段时长1–15 秒
延长后时长可通过延长 API 连续扩展
分辨率480p、720p
参考图像1–7 张(真正的参考图,不是首帧)
提示词标签<IMAGE_1>、<IMAGE_2> 等
音频支持(720p)
视频编辑支持(文本引导)
APIxAI API、fal.ai、Replicate
API 费用每秒 $0.05(Video)、每秒 $0.08(Video 1.5)

Seedance 2.0(字节跳动) ​

Seedance 2.0 可同时接收最多 12 个多模态输入,并生成具有原生音频同步和 8 种以上语言音素级口型同步的视频。

字节跳动的 Seedance 2.0 可接收的参考输入数量在所有模型中最多:可同时输入最多 12 个文件,包括最多 9 张图像、3 个视频和 3 个音频文件。该模型支持原生音视频生成,并可实现 8 种以上语言的音素级口型同步。

单张图像最大可达 30MB。参考视频时长必须为 2–15 秒。模型会使用这些参考内容来确定角色外观、场景风格并引导动作。

下一次重大升级现已发布。字节跳动于 2026 年 6 月 23 日在火山引擎 FORCE 大会上公布 Seedance 2.5,并于 2026 年 7 月 31 日正式发布。根据 Seed 团队的公告,它可以生成最长 30 秒的单个原生视频片段,并支持多轮延长;在一次生成中最多可接收 30 张图像、10 个视频片段和 10 个音频片段作为参考(共 50 个文件,高于此前的 12 个);还新增了时间戳级编辑功能,让你无需重新生成整个视频,即可修改片段中的某个时刻。该模型首先登陆即梦和豆包,随后进入 BytePlus ModelArk 企业 API,第三方平台也迅速跟进:根据 Runway 更新日志,Runway API 于 2026 年 8 月 7 日加入 Seedance 2.5,支持 4–30 秒时长以及最多 30 张参考图像。对于本指南中的叙事工作流,能够在单次生成中制作 30 秒长镜头并使用 50 个参考文件,可以省去下文所述的大量片段拼接工作。

可用性: 字节跳动官方 API(通过火山引擎提供,于 2026 年 2 月推出)和第三方 API 提供商。API 输出分辨率为 480p–720p,通过平台最高可达 2K 电影级分辨率。

规格参数
原生视频片段时长4–15 秒
分辨率最高 2K(电影级)
参考图像最多 9 张图像 + 3 个视频 + 3 个音频(共 12 个)
Seedance 2.5 视频片段时长原生最长 30 秒,并支持延长
Seedance 2.5 参考内容最多 30 张图像 + 10 个视频 + 10 个音频(共 50 个)
音频原生音频,支持口型同步(8 种以上语言)
API字节跳动/火山引擎、BytePlus ModelArk(2.5)、Runway API(2.5)、第三方提供商

Runway Gen-4.5 ​

Runway Gen-4.5 发布时以 1,247 ELO 登顶 Artificial Analysis 文生视频排行榜,领先于当时的 Veo 3 和 Sora 2 Pro。到 2026 年 9 月,竞技场排名已重新洗牌(Gemini Omni Flash 与阿里巴巴的 Wan 3.0 并列榜首,Gen-4.5 则跌出前十),但 Gen-4.5 在电影级画面质量和可控动作方面依然表现强劲,而且 Runway 尚未推出 Gen-5。该模型在文生视频模式下可生成 2–10 秒的视频片段,并通过多镜头编排支持最长约一分钟、角色保持一致的长视频。

图生视频功能于 2026 年初加入,并支持所有宽高比的参考图像。Runway 在 2026 年的其他动作主要集中在编辑和模型路由上,而非推出新的基础模型:Aleph 2.0(2026 年 6 月 2 日)可根据文本提示词以及最多 5 张固定在时间戳上的关键帧图像,编辑现有的 2–30 秒视频;Gen-3 Alpha Turbo 和初代 Gen-4 Aleph 已于 2026 年 7 月 30 日从 API 下线;API 现在还提供包括 Gemini Omni Flash 和 Seedance 2.5 在内的第三方模型,以上信息均来自 Runway 更新日志。该模型在扩散架构中集成了神经辐射场和高斯泼溅技术,因此具备 3D 几何理解能力,而不只是像素级预测。这带来了更好的物体持久性和更符合物理规律的运动。

可用性: 商业 API 和网页界面。提供 Node 和 Python SDK。也可通过 Replicate 使用。

规格参数
原生视频片段时长2–10 秒
长视频模式最长约 1 分钟
分辨率最高 1080p
参考图像每次生成 0–1 张
音频原生音频生成
多镜头支持
API支持(Runway、Replicate)

Google Veo 3.1 ​

Google 的 Veo 3.1 可原生生成 4 秒、6 秒或 8 秒的视频片段。“Extend Video”功能目前处于预览阶段,可连续扩展片段,使视频总时长达到约 1–2.5 分钟,但在较长序列中,一致性可能逐渐下降。

“Ingredients to Video”功能最多可接收 3 张参考图像作为输入。你可以提供要制作动画的角色、背景和材质纹理。使用参考图像时,模型会更贴近你的视觉参考,并减少随机改动。一个限制是:参考图像模式只能使用 8 秒时长选项。

截至 2026 年 1 月,Veo 3.1 已在 Vertex AI 上为基于参考图的生成加入竖屏视频(9:16)和 4K 放大功能。Google 随后于 2026 年 3 月 31 日推出其价格最低的视频模型 Veo 3.1 Lite,并于 2026 年 6 月 30 日停用 Veo 2.0 和 3.0。根据 Gemini API 更新日志,截至 2026 年 9 月,Google 尚未公布 Veo 4。其更新的视频研发成果正在流向下文介绍的 Gemini Omni Flash。

可用性: Google Vertex AI API、Gemini API 和 Google Flow。需要 Google Cloud 账号。

规格参数
原生视频片段时长4 秒、6 秒或 8 秒
延长后时长约 1–2.5 分钟
分辨率最高 4K(通过放大)
参考图像最多 3 张(“Ingredients to Video”)
音频同步对白和音乐
APIVertex AI、Gemini API

Google Gemini Omni Flash ​

Google 于 2026 年 5 月的 I/O 大会上公布 Gemini Omni 系列,并率先推出 Gemini Omni Flash。它很快超越 Veo 3.1,登上 Artificial Analysis 竞技场榜首。其核心卖点是对话式视频创作:你可以根据文本、图像或视频生成一段 10 秒的视频片段,然后通过相互衔接的后续指令继续编辑。调整灯光、替换服装、修改镜头,都无需从头重新生成。

在参考内容支持方面,Omni Flash 可接收图像和短视频片段作为风格、动作和效果参考,并计划支持音频参考。在对话式编辑过程中,角色一致性通常能够保持,不过 Google 自己的文档指出,在场景切换和镜头平移期间可能出现偏差,因此发布前应仔细检查角色占比较高的输出。

可用性: API(gemini-omni-flash-preview)于 2026 年 6 月 30 日通过 Google AI Studio 和 Gemini API 开放公开预览,视频输出价格约为每秒 $0.10。根据 Gemini API 更新日志,gemini-omni-1.1-flash 于 2026 年 8 月 27 日正式开放,并提供视频延长、插帧和分辨率控制功能。每个视频片段都带有 SynthID 水印。消费者可通过 Gemini 应用、Google Flow 和 YouTube Shorts 使用,Runway API 也提供该模型的路由。

规格参数
原生视频片段时长10 秒(计划支持更长时长)
分辨率720p
参考输入图像 + 短视频片段(计划支持音频)
编辑对话式、迭代式
音频原生
APIGemini API(以 gemini-omni-1.1-flash 正式开放),约 $0.10/秒

OpenAI Sora 2 / Sora 2 Pro ​

即将停用(2026): OpenAI 正在逐步关闭 Sora。根据 OpenAI 的弃用页面,面向消费者的 Sora 应用已于 2026 年 4 月 26 日关闭,Sora 2 API 将于 2026 年 9 月 24 日停止服务,且尚未公布后继产品。下述能力仍值得关注,但不要再基于 Sora 构建新的工作流。请改用 Kling、Grok Imagine 或开源模型。

Sora 2 Pro 可生成最长 20 秒的视频片段。Characters API 采用了与 Kling 或 Grok 不同的方法:你无需上传静态图像,而是让 API 指向一段视频片段(包含 1–3 秒的时间戳范围),以创建 character_id。Sora 会分析视频帧,提取面部结构、身体比例、服装风格及其他身份特征。该 character_id 会永久保留,并可在之后无限次生成中重复使用。

每次生成最多可以引用 2 个已上传的角色。截至 2026 年 3 月,角色参考不仅适用于人物,也适用于物体和动物。视频延长功能会将完整的初始片段作为续写上下文。

角色系统要求使用视频输入而非静态图像来创建角色。如果你只有照片,就需要先生成一段短视频,再从中提取角色。

可用性: OpenAI API,并支持用于生产工作流的 Batch API。

规格参数
原生视频片段时长最长 20 秒
分辨率最高 1920x1080
角色参考每次生成最多 2 个(持久化 character_id)
角色输入视频片段(1–3 秒时间戳范围),而非静态图像
音频同步
延长支持(将完整片段作为上下文)
APIOpenAI API + Batch API

MiniMax Hailuo 02 ​

Hailuo 02 发布时在 Artificial Analysis 基准测试中位列全球第二,超过 Veo 3。它可以原生 1080p 分辨率生成 10 秒的视频片段,并具备业内领先的物理模拟效果。该模型能够处理体操和杂技等极限动作,而不会出现画面崩坏。

它支持图生视频,并通过面部识别和身体追踪实现出色的角色一致性。感知噪声的计算重分配架构会根据场景复杂度动态分配计算资源。

此后,MiniMax 推出了超越 Hailuo 02 的 Hailuo 2.3 系列(Standard、Pro、Fast、Fast Pro),进一步改善了肢体动作、风格化效果和角色微表情。它可以输出 6 秒的 1080p 视频或 10 秒的 768p 视频,并可通过 MiniMax 平台和 fal.ai 使用。

可用性: 商业 API。可通过 MiniMax 平台、fal.ai 和 Replicate 使用。每个视频 $0.28。

规格参数
原生视频片段时长最长 10 秒
分辨率原生 1080p
参考图像支持(I2V 模式)
音频非原生
物理效果同类领先的模拟能力
APIMiniMax、fal.ai、Replicate

MiniMax H3(Hailuo 3.0) ​

MiniMax 于 2026 年 7 月 31 日用 MiniMax H3 取代 Hailuo 2.x 系列,也改变了 Hailuo 在本指南中的定位。Hailuo 02 是一个首帧模型,而 H3 则是一个全模态模型:根据 MiniMax 的公告,单个 Transformer 可同时读取文本、图像、视频和音频,并输出一段 4–15 秒、最高 2K 分辨率且带原生立体声音频的视频片段。其参考模式(Ref2VA)最多可接收 9 张参考图像、3 个参考视频片段和 3 个音频片段,上限为 12 个文件,因此它与 Kling 和 Seedance 2.0 一样属于真正的参考生成模型;首尾帧模式(FL2VA)则覆盖了经典的关键帧工作流。截至 2026 年 9 月,在 Artificial Analysis 文生视频竞技场上,H3 和 H3 Max 的排名仅次于 Omni Flash 和 Wan 3.0。 对自托管用户来说,更重磅的消息是 MiniMax 于 2026 年 8 月在 Hugging Face 上发布了 33B 基础权重,包括 FL2VA 和 Ref2VA 检查点。其许可证为 MiniMax H3 Community License,模型卡要求美国、欧盟、英国和韩国的用户在使用前提交申请表,因此它属于附带地区限制的开放模型,而不是 Apache 风格的开放模型。

可用渠道: MiniMax API 和平台、fal.ai 及其他托管平台,另提供可下载权重。

规格值
原生片段时长4-15 秒
分辨率最高 2K(默认短边 768p)
参考图像最多 9 张图像 + 3 个视频 + 3 段音频(共 12 个,Ref2VA)
关键帧首帧和/或末帧(FL2VA)
音频原生立体声,32 kHz
开放权重是,33B,MiniMax H3 Community License(美国/欧盟/英国/韩国用户需申请)
APIMiniMax、fal.ai

Luma Ray3.2 ​

Luma 的 Ray2 已被 Ray3 系列取代。Ray3(2025 年 9 月)新增了用于锁定身份的 Character Reference,以及 Modify 视频转视频模式;Ray3.2(2026 年 6 月 9 日)则新增了帧级控制,每个片段最多支持 16 个关键帧,还加入了 Reframe 功能,并将片段时长延长至 20 秒,同时首次为 Ray3 系列提供公开 API。输出原生为 1080p,并可通过 Hi-Fi 超分辨率放大至 4K。图生视频可将参考图像作为起始或结束关键帧。

可用渠道: Luma API 和网页界面。

规格值
原生片段时长最长 20 秒(Ray3.2)
参考类型起始/结束关键帧 + Character Reference(身份)
分辨率原生 1080p,通过超分辨率放大至 4K
参考图像是(关键帧 + 角色参考)
APILuma API

Pika 2.5 ​

Pika 通过 Pikaframes 采用基于关键帧的方法。上传 2-5 个关键帧(关键时刻的参考图像),模型便会在它们之间生成平滑过渡。总时长可达 20-25 秒。

Pikascenes 最多接受 10 张参考图像,并将它们组合成一个视频。模型会利用图像识别,自动判断每个参考对象的作用(角色、背景、道具)。

可用渠道: Pika 网页平台和 API。订阅方案从免费版到 Pro 版不等。

规格值
原生片段时长5-10 秒
Pikaframes 时长20-25 秒
分辨率最高 1080p
参考图像最多 10 张(Pikascenes),2-5 个关键帧(Pikaframes)
API是

Vidu Q3(生数科技) ​

Vidu 值得拥有一个在本指南早期版本中没有的独立章节,因为其 Q3 系列已经成为目前最强的主体参考系统之一。生数科技于 2026 年早些时候发布了 Vidu Q3,支持原生音频以及最长 16 秒的片段;根据其发布公告,又于 2026 年 4 月 13 日推出了 Q3 Reference-to-Video。参考模式可在一次请求中组合主体、环境、服装、道具和视觉风格。根据 Vidu API 文档,reference2video 端点最多接受 7 张参考图像,你可以在提示词中用 @1、@2 等方式标记它们(“@1 和 @2 正在一起做饭”);使用 viduq3 时,时长为 3 至 16 秒,分辨率最高可达 1080p,音频生成则通过一个标志启用。它还能在单个片段内进行智能镜头切换,这一功能并不常见,但对对话场景非常实用。生数科技表示,Q3 在 SuperCLUE 首个 Reference-to-Video 排行榜中位居榜首;而在我们最初撰写本指南时,Vidu 就已经是在 VBench 2.0 上对 Veo 构成有力挑战的模型。

可用渠道: Vidu 网页应用和 API(viduq3、viduq3-turbo),以及阿里云百炼和第三方托管平台。

规格值
原生片段时长3-16 秒
分辨率最高 1080p
参考图像最多 7 张(@1、@2 标签)
参考类型主体、环境、道具、服装、风格
音频原生(音效、对白、音乐)
APIVidu API、阿里云百炼

第 3 梯队:适用于自托管工作流的开源模型 ​

这些模型生成的片段较短,但完全开放。你可以在自己的硬件上运行和微调它们,并构建不依赖 API 的自定义扩展流水线。

Wan 2.1(阿里巴巴) ​

Wan 2.1 是其他多个模型(包括 Helios)赖以构建的基础。Wan-VAE 架构能够编码和解码任意长度的 1080p 视频,同时保留时序信息。该模型提供 480p 和 720p 的 I2V 变体,以及可在两张参考图像之间生成视频的 First-Last-Frame-to-Video 模型。

Wan-Edit 可利用参考图像进行风格与内容迁移,同时保持特定结构或角色姿势。Wan 2.2(2025 年 7 月)是较新的开放版本,采用混合专家模型架构,其中 5B 变体可在单张 RTX 4090 上运行,依然使用 Apache 2.0 许可证。自托管用户需要注意一个重要限制:Wan 从 2.5 开始转为闭源。更新的 Wan 2.5、2.6、2.7 以及现在的 Wan 3.0 增加了同步音频和更高分辨率,但只提供 API,没有公开权重,因此 2.2 仍是开放版本的上限。Wan 3.0 于 2026 年 8 月登陆阿里云百炼,根据其模型页面,它可以根据文本、图像、视频和音频参考,一次生成最长 30 秒的 480p、720p 或 1080p 视频;截至 2026 年 9 月,它与 Gemini Omni Flash 并列位居 Artificial Analysis 文生视频竞技场榜首。它是一款托管产品,不能下载。不要相信那些声称可以下载 Wan 2.7 或 3.0 权重的 SEO 页面。官方 GitHub 组织和 Hugging Face 账号 都止步于 2.2(最新上传的是更新后的 Wan2.2-Animate)。

规格值
参数量1.3B、5B、14B(2.1);5B + 14B MoE(2.2)
I2V 模式I2V-480P、I2V-720P、FLF2V-720P
开放版本上限Wan 2.2(2.5 至 3.0 仅提供 API)
许可证Apache 2.0
硬件8GB+ VRAM(较小变体)
平台Diffusers、ComfyUI

HunyuanVideo(腾讯) ​

腾讯这款 13B 参数模型在 2025 年的大部分时间里都是开源视频生成领域的领先者。HunyuanVideo-I2V 使用 token replace 技术,并结合预训练 MLLM 来融入参考图像信息。HunyuanVideo-1.5 于 2025 年 11 月发布,提升了运行效率。HunyuanCustom 支持多模态驱动的定制化视频生成。

规格值
参数量13B
I2V是(token replace 技术)
许可证开源
硬件60GB+ VRAM(720p)
变体Base、I2V、1.5、Avatar、Custom

LTX-2(Lightricks) ​

Lightricks 于 2026 年 1 月将 LTX-2 开源,提供完整权重、推理代码和训练代码。它是一款基于 DiT 的模型,可一次性共同生成视频和同步音频,原生支持 4K 和最高 50fps,片段最长可达 20 秒。图生视频和多关键帧条件控制均为内置功能,因此你可以像使用 Pikaframes 一样,将参考静帧固定在片段时间轴上的不同位置。

许可证是它的限制所在——当然,这是否构成限制取决于你的业务规模。LTX-2 可免费用于研究,以及年收入低于 $10M 的商业用途。超过这一门槛就需要商业许可证,因此严格来说,它属于开放权重,而不是开源。LTX-2.3 是一次 22B 参数更新,改善了音频效果和提示词遵循能力;截至 2026 年 9 月,当前检查点为 LTX-2.5,它保持 22B 规模,并新增原生多镜头生成能力,可在多个连续镜头中维持同一角色和视觉风格;同时用扩散视频解码器取代普通 VAE 重建,并使用 Gemma 4 12B 文本编码器处理长提示词。它依然采用 LTX-2.x Community License,年收入 $10M 的门槛也保持不变。权重已发布在 Hugging Face 上,同时提供蒸馏变体、LoRA 适配器,以及 ComfyUI 和 Diffusers 集成;托管 API 则运行在 LTX 平台、fal.ai 和 Replicate 上。

规格值
参数量22B(LTX-2.3 和 LTX-2.5)
最大片段时长约 20 秒
分辨率原生 4K,最高 50fps
音频原生同步
I2V是(图像 + 多关键帧条件控制)
许可证LTX-2 Community License(ARR 低于 $10M 时免费)
硬件面向消费级 GPU 的蒸馏和 FP8 变体

CogVideoX(清华大学/智谱 AI) ​

CogVideoX 使用 3D 因果 VAE 来缩短序列长度并防止闪烁。自适应 LayerNorm Transformer 改善了文本与视频的对齐。它提供 2B(Apache 2.0)和 5B(研究许可证)变体,并原生集成 Diffusers。

片段时长为 6-10 秒,分辨率为 720x480。虽然较短,但画质与算力需求的比例很好,而且可以在 12GB GPU 上运行。

规格值
参数量2B、5B
I2V是(CogVideoXImageToVideoPipeline)
分辨率720x480,8fps
许可证Apache 2.0(2B)、研究许可证(5B)
硬件12GB VRAM

首帧与真正参考的区别:关键差异 ​

并非所有“参考图像”支持都一样。理解其中差异,对选择正确的模型至关重要。

首帧模型(LongCat、Helios、Hailuo、Luma Ray2、HunyuanVideo)会将你的图像视为实际的开场帧。模型从这一确切画面开始向后生成动画。你不能上传一张角色头像,然后描述其出现在另一个场景中。图像本身就是场景。

真正的参考模型(Kling、Grok Imagine、Seedance、Vidu Q3、MiniMax H3、SkyReels V3)会从图像中提取身份,并将该角色或物体放入你所描述的任意场景中。上传一个人的照片,然后输入提示词“这个人在日落时分穿过森林”。该角色会出现在一个全新的环境中,同时保持身份一致。制作冒险电影等多场景叙事内容时,你需要的正是这种能力。

角色 ID 模型(Sora 2 Pro)从视频片段而非静态图像中提取身份。你只需创建一次持久化角色 ID,之后即可在不限次数的生成任务中重复使用。

风格/素材模型(Veo 3.1)使用参考图像来影响视觉风格、纹理和整体观感,而不是提取特定角色的身份。它们适合在整个项目中保持视觉一致性,但对单个角色的控制不够精确。

制作 10 分钟视频的实际工作流 ​

实话实说,截至 2026 年年中,还没有任何单一模型能够可靠地一次生成 10 分钟连贯且高质量的视频。LongCat Video 声称可生成 15 分钟视频,是最接近这一目标的模型,但在如此长的时长下,质量和连贯性会出现显著波动。Helios 和 SkyReels V2 分别可生成“分钟级”和“无限长度”视频,但输出需要精心设计提示词,而且通常要尝试多次。

对大多数制作 5-15 分钟视频的创作者而言,真正可行的工作流需要组合使用多种方法:

对于口播/虚拟人内容: LongCat Video 的 2026 年音频驱动模式或 SkyReels V3 的虚拟人生成可以制作持续 5 分钟以上、角色一致的口播视频。这是最接近“按一下按钮,直接得到长视频”的方案。

对于包含多个场景的叙事内容(冒险电影风格): 使用具备真正角色参考图像能力的 Kling 3.0、Grok Imagine 或 Seedance 2.0。分别生成 10-15 秒的单个镜头。在每次生成中使用相同的 @Element 或 <IMAGE> 引用,以保持角色身份一致。通过多镜头模式(Kling 每次调用支持 6 个镜头)或扩展 API 将镜头串联起来。Kling 是这类工作流中经受实践检验最多的选择。Grok Imagine 明确区分“参考模式”和“首帧模式”,因此也是很有竞争力的替代方案。Seedance 2.5 目前接受的参考输入最多(50 个文件),并可生成 30 秒镜头,大约能将拼接次数减少一半;Vidu Q3(使用 @ 标签引用 7 个参考)和 MiniMax H3(12 个文件)也是可信的新选择。

对于跨大量片段保持角色一致性: Sora 2 Pro 的持久化 character_id 系统是超长项目中最简洁的方案。先从一段短视频中提取一次角色,然后生成数十个引用该 ID 的片段。角色身份不会随时间推移而劣化,因为它被存储为持久化嵌入,而不是每次都从图像中重新解读。

对于风格迁移内容: fal.ai 上的 Lucy Restyle 可处理最长 30 分钟的现有视频,在保留运动的同时应用 AI 风格转换。如果你有源素材,这种方法可以完全绕开生成时长问题。每秒源视频收费 $0.01。

对于开源流水线: 可以基于 Wan 2.2 或 Helios 构建视频续写循环;如果 MiniMax H3 的社区许可证适用于你所在的地区,也可以使用其 Ref2VA 检查点,因为它是首个提供 9 图像参考模式的开放模型。先生成一个片段,将其末帧用作下一个片段的起始帧,然后不断重复。ComfyUI 工作流可以将这一过程自动化。经过多次迭代后,一致性会下降,但这种方案免费且可控。

核心挑战依然存在:即使支持真正的参考图像,角色漂移也会在数十个片段中不断累积。面部特征、发型、服装和肤色都会逐渐变化。高质量参考照片、一致的提示词和批量生成镜头等变通方法仍然必不可少。不过,Kling 和 Grok Imagine 这类将角色身份与场景构图分离的模型,已经让这项工作比仅支持首帧的模型轻松得多。

3D 脚手架方法:低质量渲染,高质量转换 ​

有一种日益流行的工作流,可以完全绕开大多数长视频生成问题。它不会要求 AI 模型从零开始生成 10 分钟视频,而是先渲染一段低保真的 3D 过场动画,确保运镜、角色调度和时间节奏正确,再使用参考图像和增强提示词,通过视频转视频模型进行处理。3D 引擎负责结构,AI 负责美学效果。 这是因为 V2V 转换比完整生成要解决的问题更窄。模型不需要创造镜头运动、角色位置或场景构图,只需要在遵循视觉参考的同时,让现有素材看起来更逼真。这要容易处理得多,而且可扩展到你的 3D 引擎能够渲染的任意时长。

为什么这种方法有效 ​

你的 3D 引擎可以提供 AI 视频模型仍不擅长的一切:精准的镜头控制、角色在画面中的准确位置、正确的物理交互,以及数分钟素材中一致的时序。滑动变焦、跟踪镜头、角色按提示进入和离开画面——这些在 3D 引擎里都轻而易举,但在文本提示生成中都不可靠。V2V 模型唯一的任务,就是将材质、光照和纹理转换为逼真的输出,同时保留你已经定义好的几何结构与运动。

保持角色一致性也会更容易。你不必再费力对抗 50 次独立 AI 生成之间的身份漂移,而是在每一帧中向模型展示同一个 3D 角色。参考图像则告诉模型,这个角色在最终输出中应该是什么样子。相比每次都从零开始生成一致的角色,这是一个简单得多的问题。

而且,时长也不再是限制。Lucy Restyle 一次调用就能处理 30 分钟。ComfyUI 中的 Wan 2.1 可以分块处理任意时长。你完全不必再纠结“如何生成 10 分钟视频”,因为素材已经存在。

RealMaster(Meta / 特拉维夫大学) ​

RealMaster 是专为这种工作流构建的研究系统。它由 Meta Reality Labs 和特拉维夫大学于 2026 年 3 月发布,可将渲染后的 3D 视频转换为逼真视频,同时与源素材保持完整的几何对齐。

该方法从 3D 渲染中提取边缘图,以保留结构和运动,然后应用基于 VACE/Wan 架构构建的视频扩散模型,将其他所有内容转换为逼真输出。轻量级 IC-LoRA 适配器将整个流水线蒸馏为单次推理,无需锚点帧,并且能够处理在序列中途出现的物体。

在 GTA-V 和 CARLA 模拟器序列的测试中,RealMaster 显著优于通用视频编辑基线。它还可以通过文本提示(“让它下雨”“让它下雪”),在写实化转换之上叠加天气效果。该模型无需重新训练即可跨模拟器泛化。使用 GTA-V 数据训练的权重无需额外微调,就能用于 CARLA 输出。

**可用性:**仅供研究。目前尚无公开权重或 API。

规格值
输入渲染后的 3D 视频(任意引擎)
输出保留几何结构和运动的逼真视频
架构基于 VACE/Wan 视频扩散骨干的 IC-LoRA
条件控制源渲染生成的边缘图
测试平台GTA-V、CARLA 模拟器
许可证尚未发布(仅有研究论文)

当前可用的制作级 V2V 工具 ​

支持元素参考的 Kling 3.0 V2V 是目前最完整的制作级方案。fal.ai 上的 Edit Video 和 Reference V2V 端点可接收 3–10 秒的源视频片段、元素参考(@Element1、@Element2,配有正面及多角度照片)以及增强提示词。模型会分析源素材中的运动轨迹和镜头模式,然后使用你指定的角色外观和视觉风格重新生成素材,同时保留原始调度与镜头设计。最多支持 7 个参考输入,输出分辨率为 1080p。你可以将过场动画切成 10–15 秒的分块,并在所有分块中使用相同的元素参考,以维持角色一致性。

Lucy Restyle 2 可在一次 API 调用中处理最长 30 分钟的源视频,价格为每秒输入 $0.01。它支持文本提示词,并可选择提供一张参考图像作为风格指导。它不像 Kling 那样支持逐角色元素参考,但如果要对完整长度的 3D 渲染进行整体电影风格迁移,这是最简单、最便宜的途径。只需提供完整渲染和描述目标观感的提示词即可。输出分辨率为 720p,并可在数千帧中保持时间一致性。

ComfyUI 中的 Wan 2.1 VACE 是开源方案。14B VACE 模型支持参考驱动的 V2V:输入源视频和一张风格参考图像,输出保留结构与运动的重风格化版本。边缘图条件控制可以提高结构保真度。你可以构建一个处理循环,使用一致的风格参考分块处理任意时长的视频。它可免费使用,并能在你自己的硬件上本地运行。

Grok Imagine V2V 在参考模式下接受源视频和 1–7 张参考图像。720p 的价格为每秒 $0.05。参考模式与首帧模式被明确区分,这意味着参考图像可以指导角色外观,而不会覆盖源视频的结构。

你的 3D 渲染需要满足什么条件 ​

渲染质量的下限很重要。只有裸线框无法为 V2V 模型提供足够的信息,但你也不需要制作级的材质或光照。

正确的比例与几何结构。 角色模型需要具备大致正确的身体比例和面部结构,参考图像才能正确映射。只要比例正确,基础人形几何体就足够了。火柴人无法生成可辨认的角色。

基础光照方向。 使用一盏平行光确定场景的整体照明,有助于模型理解预期氛围。AI 会增强画面并添加细节,但它需要知道场景是明亮的白天还是昏暗的室内。

平滑的镜头运动。 稳定且有意图的镜头运动转换效果更好。无规律或极快的运动可能会让 V2V 模型产生混乱。让虚拟摄影机像真实摄影机一样运动。

使用平面着色,而不是线框。 简单的平面着色或低多边形几何体,比线框或无纹理模型效果更好。即使只是给表面使用基础纯色,也能帮助模型理解材质边界。

成本与规模 ​

使用不同工具处理一段 10 分钟的过场动画:

工具最大输入时长10 分钟成本分辨率参考图像
Kling O3 V2V10 秒片段约 $50–671080p最多 7 个(元素 + 风格)
Lucy Restyle 230 分钟$6720p1 张(仅风格)
Grok Imagine V2V10 秒片段约 $30720p1–7 张
Wan 2.1 VACE任意(分块)免费(本地 GPU)720p每个分块 1 张

这些数字是我们在 2026 年年中首次进行比较时,根据供应商标价得出的估算。供应商经常调整价格,因此请将其视为相对排名,而不是正式报价。Lucy Restyle 是处理完整长度视频最便宜的选择。Kling 通过元素参考,可以最精准地对特定角色进行增强。如果你拥有相应硬件,Wan 2.1 可免费使用(14B 模型以 720p 运行大约需要 60GB 显存;质量较低的 1.3B 变体需要 8GB)。

对比表 ​

模型最大原生时长扩展后时长参考类型最大参考数分辨率提供 API开源
LongCat Video约 15 分钟不适用仅首帧1720p/30fps是(fal.ai)是(MIT)
Seaweed APT2约 5 分钟不适用I2V + 姿态1720p否否
Helios分钟级不适用首帧(I2V)1720pHF Spaces是(Apache 2.0)
SkyReels V3无限制不适用真正的参考图像1–4720p否是
Kling 3.015 秒约 3 分钟元素 + 风格参考71080p是否
Grok Imagine15 秒可串联真正的参考图像7720p是否
Seedance 2.015 秒不适用多模态参考122K是否
Seedance 2.530 秒多轮扩展多模态参考502K是(BytePlus、Runway)否
Vidu Q316 秒不适用真正的参考图像71080p是否
MiniMax H315 秒不适用多模态参考122K是是(社区许可证)
Runway Gen-4.510 秒约 1 分钟I2V(0–1)11080p是否
Veo 3.18 秒约 2.5 分钟素材(风格)34K是否
Gemini Omni Flash10 秒对话式编辑 + 扩展(1.1)多模态参考图像 + 视频720p是(正式发布)否
Sora 2 Pro ⚠️ 即将停止服务20 秒可串联角色 ID(视频)21080pAPI 将于 2026 年 9 月下线否
Hailuo 0210 秒不适用I2V(首帧)11080p是否
Luma Ray3.220 秒不适用关键帧 + 角色参考16 个关键帧1080p(可放大至 4K)是否
Pika 2.510 秒25 秒Pikascenes101080p是否
Wan 2.1 / 2.2短片段通过续写I2V / FLF2V1–2720p通过 fal.ai是(Apache 2.0)
Wan 3.030 秒不适用多模态参考图像、视频、音频1080p是(Alibaba Cloud)否
HunyuanVideo短片段通过续写I2V(首帧)1720p通过 fal.ai是
LTX-2.320 秒通过续写I2V + 关键帧多关键帧4K是(LTX、fal.ai)权重开放(受 ARR 限制)
CogVideoX6–10 秒通过续写I2V(首帧)1720x480通过 fal.ai是

即将到来的发展 ​

贯穿 2026 年的发展轨迹已经很清晰。LongCat Video 证明,开源模型可以实现分钟级且保持一致性的生成。Helios 表明这可以实时完成。Seaweed APT2 展示了交互式长视频生成。而真正支持参考图像的模型(Kling、Grok、Seedance)则证明,角色身份可以跨任意场景持续保持。

下一步是将这些能力结合起来:原生长视频生成,同时真正支持角色参考。现在你只能二选一。当一个模型能够生成 5 分钟视频,并在数十次场景切换中持续保持参考图像中的角色时,串联片段的工作流就会过时。Seedance 2.5(原生 30 秒片段、最多 50 个参考文件,于 2026 年 7 月 31 日发布)和 Wan 3.0(根据多模态参考生成 30 秒单镜头,于 2026 年 8 月发布)是朝这一方向迈出的第一批真正步伐。

截至 2026 年 9 月上旬,Artificial Analysis 文生视频竞技场(含音频)中,Google 的 Gemini Omni Flash 与阿里巴巴仅提供 API 的 Wan 3.0 并列榜首(约 1,239 Elo);MiniMax H3 Max 和 H3 仅落后几分,之后依次是 Seedance 2.0、Wan 2.7、HappyHorse 系列模型、Sand.ai 的 MAGI-2 预览版和 Kling 3.0 Pro,共同构成前十名。排行榜经常变化,因此任何一次排名都应被视为阶段性快照,而不是固定顺序。

3D 脚手架方案提供了另一条并行的发展路线。随着 V2V 模型在结构保留和写实效果方面不断提升,增强低保真 3D 渲染正日益成为完整制作流程中的可行方案。Meta 的 RealMaster 已经能对游戏引擎输出实现研究级的仿真到现实转换。当这项能力进入制作级 API,并支持参考图像后,任何具备基础 3D 技能的人都可以制作任意时长的逼真长视频,同时完整控制镜头、场面调度和角色位置。

目前,实际答案取决于你的使用场景:

**最适合多角色参考:**Kling 3.0(最多 7 个参考,采用独立的元素 + 风格系统)、Seedance 2.5(一个 30 秒镜头中最多支持 50 个多模态输入),或 Vidu Q3(7 个带标签的参考,支持片段内镜头切换)。

**最适合参考图生视频的 API:**Grok Imagine(简洁的 API、明确的参考模式,原始模型价格为每秒 $0.05)、Vidu Q3(@ 标签、7 个参考),或通过 fal.ai 使用 Kling。

**最适合在大量片段中保持角色一致:**Kling 3.0 的元素参考,或 SkyReels V3 的参考并扩展功能。(Sora 2 Pro 的角色 ID 系统曾是最简洁的方案,但它将在 2026 年停止服务,因此不要用它启动新项目。)

**最佳开源方案:**SkyReels V3(1–4 张真正的参考图像、时长无限制)、MiniMax H3(9 张参考图像以及视频和音频,社区许可证需要按地区申请),或 Helios(实时生成、Apache 2.0)。

**最长原生时长:**LongCat Video(约 15 分钟,但仅支持首帧)。

**最适合增强 3D 渲染:**Kling 3.0 V2V(逐角色元素参考、1080p)或 Lucy Restyle 2(30 分钟输入、每秒 $0.01)。


常见问题 ​

哪款 AI 视频模型最适合长视频? ​

单看原生时长,LongCat Video 可以生成约 15 分钟的视频,但它只支持首帧。要制作角色一致的长视频,2026 年的实际答案是采用“参考并扩展”工作流:使用参考支持较强的模型(Kling 3.0、Runway Gen-4.5 或开源的 SkyReels V3)生成片段,然后将它们串联起来。目前没有任何单一模型既能生成长视频,又能完美保持角色身份,因此大多数制作流程都会组合使用这些能力。

哪些 AI 视频模型支持参考图像? ​

在商业选项中,Kling 3.0 Omni、Runway Gen-4.5、Seedance 2.0 和 2.5、Vidu Q3、MiniMax H3、Google Veo 3.1 以及 Gemini Omni Flash 都支持参考图像。在开源方面,SkyReels V2/V3、Wan 2.1 和 2.2、LTX-2.5,以及 MiniMax H3 的开放权重都接受参考输入,可自行运行。不同模型的支持质量差异很大,因此上面的指南将它们划分成了不同级别。

AI 能否在长视频中生成一致的角色? ​

可以,但无法一次完成。可靠的方法是使用一张或多张参考图像锁定角色,生成短片段,然后在扩展或拼接时反复输入相同的参考图像。在这里,真正的参考图像支持(模型能在新的生成结果中保持身份)远比首帧条件控制更重要,后者只能为开场帧设定初始状态。

首帧支持与真正的参考图像支持有什么区别? ​

首帧条件控制会将你的图像作为视频片段的实际开场帧,随后画面会随着视频推进逐渐偏离。真正的参考图支持会将图像作为身份锚点,模型会在整个生成过程中遵循它,因此角色或风格能在整段视频以及不同视频片段之间保持一致。上一节详细说明了各模型分别支持哪些方式。

Kling AI 图生视频如何使用多张参考图? ​

Kling 的多图参考是独立于普通图生视频的另一种模式。它不会将单张图片作为首帧进行动画化,而是允许你上传最多 7 张图像和元素(如果同时附加参考视频,则最多为 4 个),在提示词中使用 @Image1 或 @Element1 标记它们,然后描述镜头。元素是根据最多 4 张不同角度的照片或一段短视频创建的锁定角色或物体,还可选择绑定声音,并能在 Kling 的多镜头故事板中持续保持一致。完整规则见上方的 Kling 章节,内容直接来自快手官方指南。

Wan 2.2 怎么样?Wan 2.5 或 Wan 3.0 是开源的吗? ​

Wan 2.2(2025 年 7 月)是目前可下载的最新 Wan 版本。它采用 Apache 2.0 许可证发布,是一个混合专家模型,包含可在单张 RTX 4090 上运行的 5B 版本,以及 14B 文生视频和图生视频模型。Wan 2.5、2.6、2.7 和 Wan 3.0(2026 年 8 月发布,支持最长 30 秒、最高 1080p 的单镜头视频)只能通过阿里云 API 使用,并未公开权重,不管那些联盟营销博客怎么说。如果你想使用基于开放权重的参考图工作流,可以选择 Wan 2.2 的图生视频和首尾帧模型,或考虑 SkyReels V3 和 MiniMax H3。

图生视频和参考图生视频有什么区别? ​

图生视频会让你提供的图片动起来,因此该图像会成为开场帧,模型从那里继续生成。参考图生视频则将你的图像用作身份和风格锚点,并根据提示词生成新的镜头,因此在摄影棚中拍摄的角色可以出现在森林中行走。图生视频适合让完成的静态图动起来。参考图生视频适合制作角色保持一致的多场景故事。Kling、Vidu Q3、Seedance、Grok Imagine 和 MiniMax H3 均提供这两种模式,而 Vidu 和 Grok 还在各自的 API 中明确标注了它们。

哪些 AI 视频模型能让同一主体在不同片段中保持一致(主体参考)? ​

截至 2026 年 9 月,在多个视频片段中保持主体或角色一致的最佳选择包括 Kling 3.0 Omni(支持多角度照片和声音的元素库)、Seedance 2.5(最多支持 50 个参考素材和 30 秒镜头)、Vidu Q3(7 个带标签的主体)以及 MiniMax H3(9 张参考图,另支持视频和音频)。Luma Ray3 新增了角色参考功能,而 Sora 2 Pro 的角色 ID 曾是最简洁易用的系统,但 Sora 的 API 将于 2026 年 9 月 24 日停止服务。在开放权重模型中,真正支持主体参考的是 SkyReels V3 和 MiniMax H3。


相关内容 ​

现在就试试让场景可玩,而不只是渲染成片

无需等待渲染队列,立即驾车探索。

免费生成 →免费,直接在浏览器里运行,无需安装。