François Chollet
@fchollet
补充一句:我们在 3 月发布 ARC-AGI-3,当时前沿模型得分不足 1%,一些 Singularitarian 发帖者把这当成人身冒犯,情绪很激动。他们说基准从根本上坏了,连最聪明的人也解不了,实际上最高只能到 40%,等等。
因为我们发布了一个未饱和基准,此后要面对大量辱骂与仇恨帖。
事实证明,这个基准校准得很好。只要比普通人做得更好,人类拿到 100% 并不难——只需比我们的人类基线用更少动作(该基线并不强,因为我们用的是未筛选人类测试者)。
因此,一旦在智能体通用智能上取得真正进展,AI 拿到 100% 也很可行。AI 在 6 个月内从不足 1% 到 100% 的轨迹表明,该基准捕捉到了近期智能体能力的跃升,而且快于包括我们在内多数人的预期。
> 任何认真投入的聪明人类,在 ARC-AGI-3 上应能拿到 >90%