François Chollet
@fchollet
GPT-6 Astra 在交互式推理问题上代表模型能力的阶跃变化。使用我们的标准 harness,它在 ARC-AGI-3 上得分 66%;使用持续对话 harness 与定制压缩后接近 100%,成本大约每局 360 美元。
事实上,持续 harness 版本在几乎所有关卡的动作效率上显著超过我们的人类基线。当我们检查推理链以理解模型如何运作时,发现它为每个游戏与关卡进行高效的即时符号世界建模,甚至发展出自用的简写 DSL 来表示局内局面——本质上是一种游戏专用代数记号。
总体而言,Astra 展现出我们此前只在复杂 harness 中见过的符号建模行为——因此 harness 能力正越来越多地转移到模型本身。
我们认为 Astra 是模型智能的重大突破。
阅读我们对 Astra 及这些结果含义的说明:https://arcprize.org/blog/astra