The Decoder 9 月 26 日转述英伟达研究者的一套系统 SoL-Pi。它不改模型,而改 harness,也就是模型与环境之间的控制层,决定代理如何看到状态、执行动作和处理反馈。报道说,这类控制层被 Codex、Claude Code 或 OpenClaw 这类系统使用。一个研究代理阅读另一个代理的执行轨迹,提出控制层改动,只保留成绩大致保住、成本下降的方案。

搜索规模写在报道里:535 个可执行环境、152 个方向,其中 495 个任务来自 GitHub 的 issue 与 pull request 配对,另有 40 个合成测试。过程产生 3000 次以上运行、6 万次以上代理与环境的交互。作者同时提醒,搜得更广并不自动更好,因为自动优化的控制层容易过拟合训练任务。

[1]
水墨:一条长纸带在中途被折短,右边连着一只合上的小盒,上方大片留白。
一条很长的纸带在中途被折短,右边仍连着同一只小盒。对应文中控制层被收短、词元用量下降,而任务成绩大致还在。, AI 生成插画,不是新闻照片

SoL-Pi 把搜索反馈和最终评测分开。EdgeBench 被整项挡在搜索之外。它的 51 个公开任务里,11 个只用于候选完成后的一次验证,其余 40 个用于最终评测,结果不回流到搜索。

搜索得到四种机制。Action Fusion 把连续两步并成一步,例如改完代码接着跑测试,从而少一次模型调用。Online Context Compact 在每步规划后压缩上下文,前提是不丢掉重要信息。ObservationPack 把很长的工具输出归档,后续步骤只放短摘要。Evidence-Preserving Reducer 把大段错误和测试日志交给更便宜的模型提炼,并用自动核对抓住被漏掉的关键线索。

在 EdgeBench 的 51 个公开任务上,报道说 SoL-Pi 的表现与原来的 Pi 控制层大致相当,省多少取决于配置。四种机制全开的最省版本少用 49% 的词元,分数达到 Pi 的 93.7%。只取最强的单一机制时,分数比 Pi 高 5.3%,同时仍然省词元。两种配置的词元降幅在 44.7% 到 49% 之间。报道配图还写,相对 Codex 省 50%,相对 Claude Code 省 54.3%,基准同为 EdgeBench。作者按当时 API 价格估计,相对原生 Codex 和 Claude Code 每小时省 8.75 到 13.50 美元,相对 Pi 每小时省 4.36 到 5.71 美元。一次测试运行的总费用从 1339 美元降到 894 美元。

系统只用 GPT-5.6 Sol 的轨迹来构建,再原样用到 Opus 5。报道说它保住了 Pi 成绩的 94.3%,节省幅度相近,但机制触发得更少、也更不激进。作者把这归于控制层只在 GPT-5.6 Sol 的轨迹上优化过。

[1]

换一组任务,结果就不再是“分数差不多、词元减半”。Terminal-Bench 4 的 63 个 CPU 任务里,SoL-Pi 解出 15 个,Codex 和 Pi 各解出 18 个;总费用仍比 Pi 低大约四分之一。2026 年数学奥赛的 Lean 4 形式化题目共 6 道,系统解出 3 道,并且是按每道已解题目计算成本最低的一个。20 个 SoL-Pi 工人组成的内核优化群,比同类 Pi 群成本低 26.8%。

更短的上下文会降低提示缓存的复用。作者把“先在很多任务上预训练控制层,再用更瘦的控制层去搜索后一个版本”写成展望,不是这项研究已经做出的结果。本文依据 The Decoder 的转述,没有核对论文 PDF,因此不补充报道里没有的实验条件。

[1]

要点

  • 改的是控制层:合并动作、压缩上下文、归档观察、用便宜模型摘要日志。
  • EdgeBench 上最省版本少用 49% 词元,分数约为 Pi 的 93.7%。
  • Terminal-Bench 4 上解出的题少于 Codex 和 Pi,不能把减半当成通用结果。