François Chollet

@fchollet

补充一句:我们在 3 月发布 ARC-AGI-3,当时前沿模型得分不足 1%,一些 Singularitarian 发帖者把这当成人身冒犯,情绪很激动。他们说基准从根本上坏了,连最聪明的人也解不了,实际上最高只能到 40%,等等。 因为我们发布了一个未饱和基准,此后要面对大量辱骂与仇恨帖。 事实证明,这个基准校准得很好。只要比普通人做得更好,人类拿到 100% 并不难——只需比我们的人类基线用更少动作(该基线并不强,因为我们用的是未筛选人类测试者)。 因此,一旦在智能体通用智能上取得真正进展,AI 拿到 100% 也很可行。AI 在 6 个月内从不足 1% 到 100% 的轨迹表明,该基准捕捉到了近期智能体能力的跃升,而且快于包括我们在内多数人的预期。 > 任何认真投入的聪明人类,在 ARC-AGI-3 上应能拿到 >90%
打开原帖#728545
  1. 前沿

    10 亿美元给水厂和市政府:OpenAI 的 Daybreak 前线防御计划
  2. 研究

    五百万美元买尺子:Anthropic 把 AI 用户福祉评测交给外部专家
  3. 前沿

    最对齐,却更难盯:Astra 的思维链监视性在下降