概念图:透视网格上的点云球体与三只虚拟相机视锥,隐喻从稀疏照片重建可控三维世界。
世界模型要把相机位姿写进输入,而不是靠一段文字猜镜头。, AI 生成配图

备选标题

  1. 两张照片也能建世界:Fei-Fei Li 的 World Labs 放出 Atlas
  2. 像素级控镜 + 稀疏重建:Atlas 把 world model 压进一条 omni 栈
  3. 从 Marble 到 Atlas:空间智能实验室押注「相机几何原生输入」

导语

斯坦福视觉先驱 Fei-Fei Li 联合创办的 World Labs 于 2026 年 9 月 1 日发布下一代世界模型 Atlas:从零预训练的 多模态自回归扩散 Transformer,原生处理文本、图像、视频与 3D,并把 相机位姿 写成一等公民输入。公司称其可在少量参考图上生成最长约 1 分钟、1440p 的相机可控视频,并输出点云与 3D Gaussian splat;目前向精选伙伴开放 early access,尚无公开定价与全面开源。

发生了什么

据 World Labs 官方博客与 SiliconANGLE 等公开报道:

  • 产品定位:Atlas 自称 omni world model,覆盖 相机可控生成、稀疏视角空间重建、时空仿真、文生图/全景 等任务,并将驱动未来版本的 Marble 等产品。
  • 架构:多模态自回归扩散 Transformer;输入在三维空间里落地形成 spatial context,再按序列条件生成下一帧/几何。
  • 相机控制:与依赖粗文本描述镜头的视频模型不同,Atlas 把精确相机几何当作原生输入,官方盲测中相机路径跟随偏好显著高于 Gemini Omni Flash、FLUX 等对照。
  • 稀疏重建:公司称两到三张图即可忠实重建多数场景,并在 DTU、ETH3D、ScanNet 等点图误差基准上优于多个专用开源重建模型;也可吞入上百张输入做更忠实复现。
  • 机器人 Real-to-Sim:用手机视频捕获真实空间后,Atlas 可重建环境并沿机器人路径生成 RGB/深度观测,支持导航与操作类仿真与可控扰动。
  • 资金背景:SiliconANGLE 称 World Labs 已累计融资约 12 亿美元,投资方包括 Nvidia、AMD、Autodesk 等;Atlas 是该轮后首个被描述为「从零预训练」的模型。
  • 可用性:early access 申请开放;权重与代码未公开发布。
Atlas is an omni model that we pretrained from scratch to natively operate on text, images, video, and 3D. It is a multimodal autoregressive diffusion transformer: all inputs are combined into a shared spatial context.
World Labs Team(官方博客)

为什么重要

本周模型圈仍在吵 agent 与网络安全门槛,Atlas 把叙事拉回 空间智能:若 AGI/机器人要在物理世界里规划动作,仅靠「看视频猜下一帧」不够,还需要 几何一致、可导出 3D、可进仿真 的世界表征。

把相机轨迹写成原生输入,等于把导演椅从提示词彩票挪回可控摄影;把稀疏重建与 Real-to-Sim 绑在同一底座上,则直接对准机器人数据饥渴——手机扫一圈房间,就能扩成可扰动的训练世界。竞争侧有 Odyssey、AMI Labs、Niantic Spatial 等分拆路线;World Labs 的赌注是 一条 omni 基座通吃生成与重建

展望

接下来两到三个季度值得盯:Atlas 何时走出伙伴墙、在真实机器人闭环里的 sim-to-real 落差、以及「omni 通吃」是否会被专用重建/视频模型在单点任务上反超。空间智能热钱已到位,裁判仍是产线与片场里少翻车几次的相机路径。