OpenAI 的 GPT-6 Astra 在 Epoch AI 的家具组装评测(Furniture Assembly Benchmark,FAB)里达到 80%。评测拍摄三件宜家家具的组装过程,并故意留下错误。模型对照说明书,指出错误,并说明错在哪里。

The Decoder 报道,2025 年 11 月成绩最好的是 Claude Opus 4.5,为 28%。十个月后,Astra 在每张照片约三分钟的条件下达到 80%。Claude Fable 5.1 为 70%,Claude Opus 5 为 61%。像 Kimi K3 这样的中国开放权重模型,落后领先者至少七个月。

[1]
水粉:一块装歪的木搁板,旁边是没有文字的组装图。
搁板的榫插进了旁边的孔。画面对应评测里对照说明书找出的组装错误,不是现场照片。, AI 生成插画,不是新闻照片

它仍然太慢,做不了边装边指错的实时帮助。研究人员说,这套能力以后有可能协助修车或修家电。报道还提到 Astra 在视觉机器人任务上表现突出,但没有给出该项的分数或任务名称。

三件家具分别是什么、错误如何设置、80% 统计了多少张照片,这篇报道都没有写。Epoch AI 的评测页面这次没有打开,数字只来自 The Decoder 对这项评测的转述。

[1]

要点

  • FAB 拍摄三件宜家家具的组装照片,并故意留下错误。
  • 2025 年 11 月最好成绩是 Claude Opus 4.5 的 28%。
  • GPT-6 Astra 为 80%,每张照片约三分钟;Fable 5.1 为 70%,Opus 5 为 61%。
  • 这个速度仍然做不了实时组装指导。