现在能试的是研究预览

加州公司 Odyssey 开放了世界模型 Odyssey-3 的公开研究预览。用户可以用文字提示生成可交互环境,并实时在里面移动。免费在线演示跑的是 Odyssey-3 Flash,可以在第一人称和第三人称之间切换,移动、触发事件,看模型当场怎么接下去。开发者可以申请接口。

基础模型有 140 亿参数。按官方基准提交材料,它生成 832×480 的视频。Odyssey-3 Pro 支持 1280×720。创始人 Oliver Cameron 和 Jeff Hawke 在 9 月 15 日第一次公开这个模型,当时的重点是机器人、自动驾驶和游戏。这次新的部分是公开访问、更多技术细节,以及基准结果。

[1]
一架没有标志的四旋翼无人机,旋翼停着
一架没有标志的四旋翼无人机,旋翼停着。, AI 生成插画,不是新闻照片

下一帧跟着上一帧和动作走

Odyssey-3 建立在自回归扩散 transformer 上。它根据已经生成的画面和用户的动作,连续产出新的视频帧。公司说,训练时模型从视觉观察里学习物理关系和因果。

训练数据有三类:带事件描述的互联网视频,配有键盘和鼠标输入的游戏录像,以及模拟出来的物理交互。另一项训练技术把所需的计算步数降下来,生成才赶得上实时。

[1]

66.1 分还不是按纪录规则测出来的

公司称,更强的 Odyssey-3 Pro 在 Physics-IQ Verified 的视频续写基准上得到 66.1 分。测试覆盖流体、光学、固体力学、磁和热力学。模型要续写真实实验的视频,输出再和实际结果比较。

这个最高分有一条明确的限制。它来自单次测试:挑选方法为每项任务从八条生成视频里选出一条。基准规则写明,要宣称纪录,就得做四次测试并报告标准差。这次上报的纪录不满足这一条。不用挑选时,Odyssey-3 Pro 四次运行的平均分是 63.37。两个数字都在官方排行榜上,提交者是 Odyssey 自己。

WorldMark 看的是另一件事:模型听不听控制、画面如何、模拟世界能否随时间保持一致。按公司自己的评测,Odyssey-3 在四个类别里的三个排第一,第一人称风格化 77.2,第三人称写实 79.0,第三人称风格化 76.3。第一人称写实是 80.6 分,排第三。

[1]

机械臂、无人机和游戏还不在预览里

公司希望同一个世界模型配上专门控制器,再用于机械臂、无人机和游戏角色。控制器负责把模型的预测变成具体指令。这些是公司描述的测试和计划,不是免费演示里已经开放的功能。

公司称,测试里基于 Odyssey-3 的系统控制了多条机械臂,几十个小时的示范数据就够训练。机器人还能自己从抓取失败里恢复,尽管那些情况不在训练数据里。人形机器人方面,Odyssey 在和瑞士公司 Flexion 合作。文章写,Flexion 基于 Odyssey-3 做的控制器,据说在条件变化时比对照模型更稳。这是转述,不是独立复测。

无人机控制器用模拟飞行数据训练。公司称,在虚拟室内环境里,它可以躲开障碍,并按指令飞向指定目标。

公司还展示了系统自主玩 GTA V,包括开车和与敌人交战。一个用大约两小时 GTA 录像训练的控制器,没有再训练,就把一部分技能迁到了 Red Dead Redemption 2,让角色骑马移动。公司也计划用这个世界模型训练智能体:演示里,智能体收到自然语言任务,在生成的环境里用自己的动作去完成。那是计划。

公开研究预览目前提供的是可交互环境生成。机器人和自主系统还要继续做。

[1]

公司和这笔融资

Odyssey 由 Oliver Cameron 和 Jeff Hawke 在 2023 年创立。2026 年 6 月,公司融资 3.1 亿美元,投资方包括 Amazon 和 AMD Ventures。

[1]