字节跳动 Seedance 2.5 让 AI 视频变得可控:30 秒原生 4K、50 个参考、原位编辑
字节跳动在 6 月 23 日北京的火山引擎 FORCE 大会上发布了 Seedance 2.5。从规格看这是一次大跨越:一次生成一段连续的 30 秒原生 4K 片段,带 10 位色彩和同步音频。但真正重要的规格不是分辨率,也不是时长,而是你现在可以导演它了。Seedance 2.5 每次生成最多可接受 50 个多模态参考,让你对一段成片做原位编辑而不必重新生成,并且在正式渲染之前先用 3D 把一场戏搭好。
实地体验 Seedance 2.5 带来的改变
先说数字
相比 Seedance 2.0 的跨越是实打实的。单段片段从几秒延长到连续 30 秒。输出从 1080p 的上限提升到原生 4K 加 10 位色彩,不是放大出来的。音频与视频在同一个隐空间过程里一起生成,而不是事后拼接,所以它是真的同步。参考额度也从大约十来个输入提升到 50 个多模态参考,混合图像、片段、音频和风格。在这一切之上,字节跳动还称提示遵循度提升了约 20%。
这些是能力上的增益。它们令人印象深刻,放在一年前,随便哪一项都足以成为整篇报道的主角。现在不再是了。
可控性是新的前沿
有两年时间,AI 视频的竞赛都围绕能力展开。谁的模型能做 4K,谁能同步音频,谁能跨镜头保持角色一致。这场竞赛基本已经尘埃落定。可灵 3.0 在 3 月推出了带音频的 4K,LTX 2.3 以开源方式做到了同样的事,前沿模型之间已经接近到差异只是口舌之争,而非鸿沟。接着话题转向了成本,蒸馏模型把每秒视频的价格砍掉了 10 倍。
Seedance 2.5 指向了下一个坐标轴:控制。三个功能说明了这一点。第一,定向编辑。如果一段 30 秒镜头里某个角色的发色不对,你只修那一块区域,而不是重新生成整段片段、丢掉你原本喜欢的表演、表情和光照。第二,50 个参考。这足以同时锁定一个角色的脸、一处场景的观感、一件道具和一种动作风格,这正是让你跨镜头保持一致、而不是每次都像拉老虎机的办法。第三,一个 3D 白模预演步骤,让你在花掉哪怕一次完整渲染之前,先把场景布局、镜头取景和运动搭出来。
合起来,这就是一个你可以导演、而不只是提示的模型。从"它能不能生成好看的东西"转向"你能不能在第二次尝试时拿到你真正想要的那个东西",正是这个转变把这些工具从演示机器变成了生产工具。
这对开发者意味着什么
如果你在产品里生成视频,这次发布会带来三个结果。
重跑成本一直是每个生成式视频功能背后那笔无声的税。当修正一个错误细节的唯一办法是重新生成整段片段、再赌一把其余部分这次都对,用户烧掉的额度和耐心一样多。原位编辑正面解决了这个问题。你为一次修改所付出的单位,从一整段片段缩小到一块区域。
参考是你交付一致性的方式。一个在十个镜头里都长得一样的角色,一处保持观感的场景,一件始终是同一件的道具。50 个参考槽足以真正把这些钉住,而一致性正是可用的素材流水线与新奇玩具之间的分野。
先预演再渲染,是成本那条线教给我们的同一课,只是换了个方向。在投入昂贵的 4K 渲染之前,先用便宜的 3D 把一场戏搭好,意味着你把昂贵的算力花在你已经框好的镜头上,而不是彩票上。
对 Cinevva 来说,这就是我们一直押注的模式。平台里的生成工具只有在创作者能又快又省地拿到他们想要的结果、不必为修一个东西重跑十几次时,才能成为一门生意。能力很快就被商品化了。成本在下降。控制,也就是有意识地拿到确切的结果,正是下一轮好用产品会决出胜负的地方。
Seedance 2.5 现在处于全球企业版测试阶段,更大范围的公开发布定在 7 月初。美国区上线时间尚未公布。
参考资料
- The Next Web: ByteDance unveils Seedance 2.5, a 30-second native 4K AI video model that accepts 50 reference inputs
- Digital Applied: Seedance 2.5, ByteDance's 30-second AI video model
- MindStudio: Seedance 2.5, 30-second video, 4K, and 50 multimodal references explained
- Kie.ai: Seedance 2.5 release, what ByteDance just shipped