FLUX 3 将图像、视频、音频和机器人动作整合进一个模型
Black Forest Labs 于 7 月 23 日发布了 FLUX 3,而这次跨越远比版本号所暗示的更大。这家位于弗赖堡的实验室凭借 FLUX 打响了名号,其图像模型可在 Photoshop、Canva、Picsart 中生成美术素材;更贴近我们的是,在 Cinevva 中,所有选择 Flux 提供商的用户也都能使用它。FLUX 3 是该公司首次推出视频功能,而且并没有单独发布一个视频模型。它用同一组权重同时训练图像、视频和音频,再将同一个骨干网络扩展到机器人动作预测。一个模型,四种输出。
抢先一览 FLUX 3 Video 的生成效果
一个骨干网络,而不是拼凑起来的四款产品
这套理念建立在 BFL 称为 Self-Flow 的研究思路之上:不再把图像生成、视频生成和音频生成视为彼此独立的问题,而是学习一种关于世界如何运作的统一表征。图像是某一时刻的空间切片;视频加入了时间和运动;音频则承载着撞击与其所发出声音之间的因果联系。将这些内容放在一起训练,各种约束便会相互强化,因此声音必须与运动匹配,而运动必须遵循物理规律。此次发布的意外之处在于,动作预测也能从同一个骨干网络中自然产生,同时不破坏视频质量。这正是 FLUX 3 可以用同一组权重既驱动机械臂,又生成音乐视频的原因。
具体说说视频能力
FLUX 3 Video 可一次生成最长 20 秒的视频片段,并在生成画面的同时生成原生音频,包括对白、音效和环境噪声。这个时长与 OpenAI 现已关闭的 Sora 相当,并在时长方面超过了当前市场上的大多数模型。它支持文生视频、图生视频、视频转视频、关键帧过渡、多语言对白,以及通过智能体式串联将多个片段组合成多镜头序列。在 BFL 自己针对 10 秒 720p 视频片段开展的早期测试中,评审者在 93% 的对比中更偏好它而非 Luma Ray 3.2,在 77% 的对比中更偏好它而非 Runway Gen-4.5。面对最强劲的竞争对手时,优势则缩小到近乎抛硬币的程度:与字节跳动的 Seedance 2.0和谷歌的 Gemini Omni Flash相比,胜率都为 52%。这些是该实验室自己的初步数据,因此应把它们视为一种主张,而非最终定论。
问题在于访问权限。FLUX 3 Video 目前通过 API 和私有权重提供受限的抢先体验,你必须提交申请并获得批准。FLUX 3 Action 仅向合作伙伴开放,机器人初创公司 mimic 已经在奥迪的真实生产线上对其进行测试。大多数设计师真正想要的 FLUX 3 Image 版本将在未来几周内推出。而本地推理用户最关心的开放权重 FLUX 3 Dev 骨干模型,要到 2026 年晚些时候才会发布。
为什么一家图像实验室转向多模态对我们很重要
我们密切关注 BFL,因为 Cinevva 已经在使用他们的技术。当全球最大创意工具所采用的两家图像模型实验室之一认定,自己的未来在于统一的视频、音频和动作模型时,这不仅意味着又多了一个新玩具,更释放出了整个创作技术栈将走向何方的信号。“生成一张图片”“生成一个片段”和“模拟一个可供你行动的世界”之间的界线,正在一个模型中逐渐消融。这与我们从另一个方向观察到的 MIRA 世界模型趋势相同。
对创作者而言,实际结论并没有改变。更出色、时长更长且原生支持音频的视频模型,再次降低了制作初稿的成本,就像此前的 Seedance、Kling 和 Gemini 一样。但它没有触及始终最困难的部分:判断什么值得创作,然后反复打磨生成的视频片段,把它变成人们真正想观看或游玩的作品。这正是我们持续围绕其构建的创作闭环——从提示词开始,再到分享、再创作,以及在开放网络上发布。FLUX 3 让原材料变得更便宜、更优质。把这些材料变成人们真正在意的游戏或故事,依然需要创作者付出努力。