Skip to content

World Labs 的 Atlas:一个可生成、重建和模拟 3D 世界的模型

李飞飞创办的 World Labs 于 9 月 1 日发布了 Atlas,并称其为“面向空间智能的世界模型”。抛开宣传语,它提出的技术主张十分具体:Atlas 是一个从零开始预训练的统一多模态自回归扩散 Transformer,原生支持以文本、图像、视频、相机位姿和深度作为输入,并输出图像、视频、点云和 3D 高斯泼溅。它不是在视频模型上外接一个 3D 模块,也不是在重建模型前面加一个生成器,而是一个统一的网络。

World Labs 表示,Atlas“将为未来版本的 Marble 提供支持”。Marble 是该公司于去年 11 月推出的场景生成产品。该公司还称,Atlas 会像语言模型一样,随训练算力的增加而提升。目前只有获选合作伙伴可以申请访问,没有定价,也没有公共 API。

三项任务,一个模型

第一项任务是相机可控生成。向 Atlas 提供一张图像和一条相机路径,它就能沿该路径渲染最长一分钟、分辨率达 1440p 的视频。由于相机路径是明确的几何输入,而不是文本提示中的暗示,因此模型不会随意偏离。World Labs 将 Atlas 与五款当前的视频模型进行了相机可控生成的人类偏好测试。据其报告,评估者有 75% 的情况会选择 Atlas 而非 MiniMax H3,81% 的情况选择 Atlas 而非 Gemini Omni Flash,86% 的情况选择 Atlas 而非 Happy Horse 1.1,93% 的情况选择 Atlas 而非 FLUX 3,94% 的情况选择 Atlas 而非 Seedance 2.5。

评估者选择 Atlas 的频率相机可控生成,人类偏好。厂商自行测试,由 World Labs 报告。对比 MiniMax H375%对比 Gemini Omni Flash81%对比 Happy Horse 1.186%对比 FLUX 393%对比 Seedance 2.594%

第二项任务是重建,而这也是我今天就愿意付费使用的部分。向 Atlas 输入一张到一百多张真实地点的照片,它就能生成点云或高斯泼溅场景,同时还原相机位置。World Labs 声称,在 DTU、ETH3D、KITTI 和 ScanNet 等标准基准测试的平均绝对相对误差指标上,Atlas 优于 Pi3X 和 VGGT 等专为 3D 重建设计的模型;而且只需两三张图像,它就能“生成忠实的结果,并超越专用 3D 模型”。由于重建与生成存在于同一个网络中,它还可以进行外推:给它一张街道视角的照片,它就能生成输入中并不存在的该街区鸟瞰图。

第三项任务是模拟。Atlas 可以从三到五个新相机角度重新呈现拍摄的视频,模拟刚性、关节式和可变形物体的交互,并从机器人的视角渲染 RGB 与深度图像。World Labs 在 Atlas 生成的环境中运行了五种机器人平台,每个平台连续运行一小时,全程无需人工干预。文章称:“世界,以及机器人对这个世界的观察,都来自同一个模型。”这句话也解释了这家公司为何能够筹集到如此规模的资金。

Atlas 机器人演示:机械臂位于生成的场景中,模型同时渲染机器人自身的相机视图

Atlas 作为从现实到模拟的工具:环境和机器人的传感器视图均来自同一个模型。图片:World Labs。

惯例性的保留意见

这些数据来自厂商选择的测试,而 World Labs 也承认这一点,并表示“没有任何一个基准测试能够完整体现 Atlas 的能力”。偏好测试比较的是各视频模型在相机控制这项任务上的表现,而 Atlas 正是围绕这项任务设计的,其他模型却并非如此。重建方面的比较更有意义,因为它们使用了公开数据集和已发布的指标,但目前还没有抢先体验名单之外的人独立复现这些测试。

解读这次发布时,背景同样重要。World Labs 于 2 月从 Autodesk、Andreessen Horowitz、Nvidia 和 AMD 获得 10 亿美元 B 轮融资,据报道估值达到 50 亿美元。机器人方向则源于该公司在 7 月收购的 SceniX。Atlas 是这笔资金和这次收购的成果,而它面向合作伙伴和未来投资者进行展示的意味,并不亚于面向用户。

这对游戏创作者意味着什么

我们一整年都在关注世界模型,因为它们是对现有游戏制作方式最具可信度的挑战。MIRA 在 7 月无需引擎便运行了一场可玩的《火箭联盟》比赛,Google 的 Genie 系列也在不断延长可持续生成的时长。Atlas 则从不同方向切入这个问题。它并不试图成为游戏循环本身,而是试图生成承载游戏循环运行的世界。

短期来看,这对我们更有用,对你可能也是如此。高斯泼溅和点云并不自带碰撞、导航或玩法逻辑,因此在有人解决将其转换为网格和碰撞体的问题之前,“生成 3D 世界”仍然只是“生成背景”。但只用两三张手机照片,就能重建出一个可供相机自由穿行的场景,这正是每个小型团队都想要的环境美术捷径。如果 Atlas 真能达到基准测试所展示的水平,那么值得关注的工程问题就会变成:如何从高斯泼溅中提取出可用于玩法的几何体。比起我们现在面对的问题,我们更愿意解决这个问题。

实话实说,目前它的状态是:一篇实力不俗的论文,外加一张申请表。等 World Labs 之外的人实际运行过它之后,我们会继续报道。

参考资料