François Chollet

@fchollet

GPT-6 Astra 在交互式推理问题上代表模型能力的阶跃变化。使用我们的标准 harness,它在 ARC-AGI-3 上得分 66%;使用持续对话 harness 与定制压缩后接近 100%,成本大约每局 360 美元。 事实上,持续 harness 版本在几乎所有关卡的动作效率上显著超过我们的人类基线。当我们检查推理链以理解模型如何运作时,发现它为每个游戏与关卡进行高效的即时符号世界建模,甚至发展出自用的简写 DSL 来表示局内局面——本质上是一种游戏专用代数记号。 总体而言,Astra 展现出我们此前只在复杂 harness 中见过的符号建模行为——因此 harness 能力正越来越多地转移到模型本身。 我们认为 Astra 是模型智能的重大突破。 阅读我们对 Astra 及这些结果含义的说明:https://arcprize.org/blog/astra
打开原帖#728545
  1. 前沿

    10 亿美元给水厂和市政府:OpenAI 的 Daybreak 前线防御计划
  2. 研究

    五百万美元买尺子:Anthropic 把 AI 用户福祉评测交给外部专家
  3. 前沿

    最对齐,却更难盯:Astra 的思维链监视性在下降