Skip to content

Odyssey-3 从两小时《GTA V》画面中学会操作,随后在《荒野大镖客 2》中骑上了马

由 Oliver Cameron 和 Jeff Hawke 于 2023 年创立的世界模型公司 Odyssey,在 9 月 15 日发布了 Odyssey-3。它的核心构想是:用一个预训练模型理解物理世界如何运作,再为其接入小型“动作解码器”,以驱动特定载体,例如机械臂、人形机器人、汽车、无人机或电子游戏角色。其中最令我们震撼的是游戏方面的成果。一个基于约两小时《GTA V》画面训练的移动策略,无需针对另外两款游戏进行任何训练,就能在《荒野大镖客 2》中骑马,并在《热血无赖》中骑摩托车。Odyssey 的公告

Odyssey-3 策略在《荒野大镖客 2》的开阔乡野中骑马,叠加层显示其正在按下的 WASD 键

Odyssey-3 使用仅在《GTA V》上训练的策略,在《荒野大镖客 2》中骑马。叠加层显示了它正在按下的按键。图片:Odyssey。

一个模型,多种载体

Odyssey-3 是一种自回归扩散 Transformer,使用该公司所称的海量视觉观察数据进行训练,目标是学习一个关于世界如何运作的通用因果模型。这个模型会保持冻结。针对每一种具身载体,Odyssey 都会基于观察与动作数据对训练一个小型动作解码器;解码器的任务是将世界模型的内部状态转化为相应载体所需的控制指令。

该公司的说法是,冻结模型承载了大部分理解能力,因此解码器只需要极少的数据。机械臂可从几十小时的演示中学习,公告还展示了一台机械臂在抓取失败后恢复,并拾取一个以异常朝向落下的物体。与 Flexion 合作开发的人形机器人可从几十小时的遥操作数据中学习。无人机则可通过几十小时的模拟飞行数据,学会飞向航点。自动驾驶方面的数据最为具体:一个使用 20 小时模拟驾驶数据训练的策略,在印度繁忙道路上两次安全驾驶员干预之间的行驶距离,约为真实画面训练策略的 77%。这些全都是厂商演示中的厂商说法,尚未有任何一项在 Odyssey 之外得到复现。

每个动作解码器需要多少数据数据由 Odyssey 公布。世界模型本身由各载体共享并保持冻结。机械臂几十小时演示数据人形机器人几十小时遥操作数据汽车20 小时模拟数据达真实数据结果的 77%无人机几十小时模拟飞行数据游戏约 2 小时《GTA V》画面《GTA V》策略迁移至《荒野大镖客 2》和《热血无赖》角色、载具和世界均不同。未针对这两款游戏进行额外策略训练。

游戏智能体看像素画面并按下按键

游戏解码器使用游戏录像,以及产生这些录像的键盘和鼠标输入配对训练。运行时,策略会观察最近的画面帧,输出按键和鼠标移动指令,再观察接下来发生的事情。它不通过 API 接入游戏,也无法访问游戏状态。它就像一个使用笔记本电脑的人一样游玩,这也是演示画面角落里会显示一个小型 WASD 叠加层的原因:那里展示的正是它正在按下的按键。

Odyssey 报告称,该策略可以在《GTA V》中进行长时间游玩,包括驾驶、射击和近身格斗。真正引人注目的是迁移效果。一个基于约两小时《GTA》画面训练的移动策略,可以在《荒野大镖客 2》中控制角色骑马移动;这是一款拥有不同角色、载具和世界的游戏。它还可以在《热血无赖》中骑摩托车。两小时几乎算不上什么数据量。这意味着解码器学习的并不是“《GTA》”本身,而是如何把世界模型中“在一个场所内移动”的概念映射到四个按键和一个鼠标上。

Odyssey-3 策略在黄昏时分沿着《GTA V》中雾气笼罩的洛圣都街道奔跑,WASD 叠加层显示 W 键正被按下

同一个策略在其实际训练所用的游戏《GTA V》中运行。图片:Odyssey。

公告还展示了该模型生成环境并让智能体在其中探索,并提出一种观点:足够优秀的模拟器可以训练在其中运行的智能体,而智能体的失败则会暴露模拟器对哪些方面理解有误。这个闭环才是真正的产品。机器人、汽车和游戏只是为了证明这个闭环确实能够成立。Odyssey 表示将在未来几周内公开发布该模型,但没有说明会以何种形式发布。

一台双臂机器人伸手探入木桌上装有杂货的蓝色周转箱,这是 Odyssey 的机器人操控演示之一

同一个冻结模型驱动双臂机器人完成杂货箱任务。图片:Odyssey。

为什么这与我们息息相关

今年我们报道了三个世界模型项目,它们分别指向不同的方向。MIRA 取代了游戏引擎,直接通过模型渲染出可玩的对局。World Labs 的 Atlas 则生成、重建并模拟世界本身。Odyssey-3 不改变引擎,而是在引擎中游玩。在这三者中,只有它能够直接触及你已经做好的游戏。

通过我们的游戏创作器构建的每一款游戏都在浏览器中运行,并接收键盘和鼠标输入,这恰好就是该策略使用的接口。一个仅凭两小时画面就能在《GTA V》中移动的智能体,很可能只需更少数据,就能在创作者制作的小型游戏中行动。它会成为一个永不厌倦、不需要操作说明的试玩测试员,并能在一分钟内告诉你控制方式是否合理。我们已经为这个问题投入了大量精力,因为反向镜头和无响应的跳跃,是玩家放弃一款新游戏最常见的原因。如果有一个低成本智能体,能在人类看到游戏之前就标记出“我连第一扇门都过不去”,那将改变我们的测试方式。

反过来看也是如此。如果在 3D 世界中移动的能力可以如此轻松地跨游戏迁移,那么游戏智能体中的世界模型部分就已接近商品化,真正重要的将是解码器:游戏如何开放控制、反馈是否清晰易懂,以及智能体能否判断自己是否做对了。这些特性同样决定了一款游戏对人类玩家而言是否好玩。为智能体而构建和为玩家而构建,最终可能会成为同一件事。

参考资料