Sakana AI 和东京大学的页面介绍了 SAIL。工作在 Makoto Sato 于 Sakana 实习期间完成,合作者还有东京大学的 Yusuke Iwasawa,以及 Sakana 的 Yujin Tang 和 So Kuroki。论文被 IROS 2026 接收。

页面要回答的是:不更新模型权重,能不能把已经学过图像、视频和语言的视觉语言模型用来生成机器人轨迹。页面把 GPT-6 Astra 写在更早的例子里,说它曾在真实机器人上完成多项操作。SAIL 自己的实验用的是 Gemini Robotics-ER 1.5,同时当作生成轨迹的模型和评估任务进度的模型,权重不更新。

[1]
石墨加一支红铅笔:五条淡线停在碗外,一条红线碰到碗沿。
多条淡线没有进碗,一条红线碰到碗沿。它对应仿真里搜到的那条轨迹,不是六次真机试验的计数。, AI 生成插画,不是新闻照片

SAIL 用少量成功示范,让策略模型一次生成整段轨迹,轨迹是末端位姿和夹爪状态。轨迹先在仿真里执行,评估模型看执行视频,按预定子任务估计完成了多少,再把选定路径点上的进度交回生成模型,用蒙特卡洛树搜索继续改。只有选中的那条轨迹送到真机。

仿真用的是 ALOHA,六项操作任务,每项 20 个初始配置。搜索预算从 1 个节点加到 45 个节点,找到一条能通过仿真器真值成功判定的轨迹的平均比率,从 25% 升到 73%。6、15、30、45 个节点对应的平均是 55%、65%、71% 和 73%。同一张表里,15 个节点的广度优先平均是 51,深度优先平均是 37,单次生成仍是 25。这里的成功率是搜索在预算内找到通过真值检查的轨迹的频率。用来引导搜索的,是模型对完成度的估计,两者不是同一个数。

[1]

真机是一台 LeRobot SO-101 机械臂,任务是把方块放进碗。场景由彩色和深度观测重建。物体位置随机,预算是 15 条候选轨迹,六次试验里成功五次。剩下的一次,他们归因于位姿估计误差,以及仿真和实物在接触上的差别。用搜索得到的成功轨迹去训练模仿策略,同样是六次里成功五次,并且比树搜索缩短了报告中的执行时间。页面没有写出缩短了多少。

页面自己列了三条限制。轨迹是开环执行的,运动过程中没有视觉反馈。在仿真里搜索和修改要额外的计算。真机评估只有一项任务,每种方法六次试验,还需要更宽的验证。因此 73% 是这六项仿真任务、在 45 个节点预算下找到成功轨迹的平均比率,不是任意新厨房里的成功率。

[1]

要点

  • SAIL 不更新 Gemini Robotics-ER 1.5 的权重,在仿真里搜索并修改轨迹。
  • 六项仿真任务、每项 20 个初始状态,1 个节点平均 25%,45 个节点平均 73%。
  • 真机 LeRobot SO-101 把方块放进碗,预算 15 条,六次成功五次。
  • 轨迹开环,真机只测了一项任务。Astra 不是这次实验用的模型。