OpenAI 的 GPT-6 Astra 在 Epoch AI 的家具组装评测(Furniture Assembly Benchmark,FAB)里达到 80%。评测拍摄三件宜家家具的组装过程,并故意留下错误。模型对照说明书,指出错误,并说明错在哪里。
The Decoder 报道,2025 年 11 月成绩最好的是 Claude Opus 4.5,为 28%。十个月后,Astra 在每张照片约三分钟的条件下达到 80%。Claude Fable 5.1 为 70%,Claude Opus 5 为 61%。像 Kimi K3 这样的中国开放权重模型,落后领先者至少七个月。
[1]
它仍然太慢,做不了边装边指错的实时帮助。研究人员说,这套能力以后有可能协助修车或修家电。报道还提到 Astra 在视觉机器人任务上表现突出,但没有给出该项的分数或任务名称。
三件家具分别是什么、错误如何设置、80% 统计了多少张照片,这篇报道都没有写。Epoch AI 的评测页面这次没有打开,数字只来自 The Decoder 对这项评测的转述。
[1]要点
- FAB 拍摄三件宜家家具的组装照片,并故意留下错误。
- 2025 年 11 月最好成绩是 Claude Opus 4.5 的 28%。
- GPT-6 Astra 为 80%,每张照片约三分钟;Fable 5.1 为 70%,Opus 5 为 61%。
- 这个速度仍然做不了实时组装指导。