开篇摘要

  • 2026 年 8 月 19 日,OpenAI 开源 Codex harness(CLI、app-server、SDK),把 Codex 从一组产品重新定义为平台。开源的不是 Codex 应用,而是其下的执行骨架。
  • 全文信息密度最高的一句是边界声明:"The open-source layer is the harness and integration surface; model access and managed services remain separate." 免费与收费是同一个决定的两面。
  • harness 是一等工程变量的唯一量化证据:ARC-AGI-3 上,保留推理加上下文压缩把 GPT-5.6 Sol 的得分从 13.3% 提到 38.3%,输出 token 降为六分之一。同一个模型,不同 harness,三倍差距。
  • 文档主张的构建范式不是万能聊天框,而是把 agent 嵌进既有界面(看板、队列、任务板),应用持有上下文、工具与审批权。
  • 全部 harness 效应证据来自 OpenAI 自述评测;文档无法确认 harness 是否可运行第三方模型。平台叙事的硬度取决于此。
科技意境插画:一座由冰蓝电路玻璃砌成的服务器教堂内部,一堵巨大的半透明玻璃墙将空间一分为二;墙后是悬浮的神经引擎——暖金与冰蓝光丝纠缠的脉动核心;墙前漂浮着三个全息工作台(世界地图、代码编辑器、安全事件队列),每个工作台的交互光丝都穿过墙上带闸门的发光检查点。
玻璃墙内的引擎——开源的是墙上的门与骨架,收费的是墙内的引擎。, AI-generated conceptual illustration; not a news photograph or product screenshot.

一、一组产品变成一个平台

这篇博文不是功能公告,而是平台宣言:被交出去的不是 Codex 应用,是它脚下的执行系统。

文档开篇先立事实:多数人通过 App、CLI、IDE 扩展认识 Codex,但"they are only a few of the ways the same underlying system can be used"。所谓底层系统即 harness——帮模型"gather context, reason through tasks, use tools, operate within configured boundaries, request approval, and carry work forward"。

平台含义接着出场:"Instead of asking every team to move its work into a general-purpose coding assistant, you can bring the agent into software designed around the actual job"——工程流程、运维看板、安全调查、客服台。

推断(成立条件:harness 被广泛采纳):竞争单元从"谁家应用更好"移到"谁家的 agent loop 住进谁的产品"。该推断回指文档原句:"If you are building software that needs an agent, you can start with Codex instead of inventing a new runtime."

二、唯一的硬证据:13.3% 到 38.3%

"harness 设计实质性改变结果"的最强证据只有一处对比,且系自述。原句在"The reusable part is the agent loop"一章:

"Harness design can materially change results: on ARC-AGI-3, retained reasoning and context compaction raised GPT-5.6 Sol's score from 13.3% to 38.3% while reducing output tokens sixfold."

机制来自文档直接引用的 ARC-AGI-3 技术贴(2026 年 7 月 29 日):官方通用 harness 中,每步动作后私有推理全部丢弃——模型每一回合都要重新理解游戏;滚动截断又让更早的动作随历史增长而不可见。开启的两个设置正打这两点:保留推理(Responses API 传入上一个 response ID,思考跨轮延续)、压缩(长对话被总结续接,而非丢弃)。校准参考:ARC 按官方游玩日志估计人类测试者平均约 48%(RHAE 指标)。

那篇引用材料里的关键句值得整句抄录:"Benchmarks rarely measure AI models in isolation. They also measure less visible choices about API settings, harness design, and prompting." 你以为在给马计时,其实在给马车计时。

边界:这是 OpenAI 自家模型、自家跑分、自家 API 设置下的对比,文档未提供独立复现。该数字支持"harness 敏感性存在"这一方向判断,不支持"特定 harness 普遍提升性能"的幅度判断。

三、边界线:送出去什么,留下什么

全文最重要的句子不是任何功能介绍,而是这句分界:"The open-source layer is the harness and integration surface; model access and managed services remain separate."

开源层交给开发者的控制点有三:界面(保留既有看板、编辑器、队列、审批流,而非塞进通用聊天窗);上下文与工具(应用可暴露自有系统、文档、数据与动作,含应用持有的 MCP 服务);运行边界(agent 在哪运行、能访问哪些文件与工具、哪些动作需审批、结果如何写回记录系统)。

推断(回指事实):开源的恰是集成面,收费的恰是模型访问与托管服务——harness 被嵌入越多产品,模型访问的默认入口越多。这是一次分发决策,不只是工程善意。成立条件:harness 并非模型无关,或即便模型无关、切换成本也不可忽略。文档无法确认 harness 是否支持第三方模型——这是平台叙事最大的事实缺口,也是仓库能裁决的地方。

四、三层集成,与"不写提示词"

集成分三层,分工明确;示例应用 Relay 展示的交互范式是:用户不写提示词,点按钮。

适用文档要点
codex exec脚本、CI、一次性后台任务"run a bounded agent workflow and return structured output"
SDK应用代码需启动、恢复、流式读取"a direct programmatic interface"
app-serveragent 即产品的一部分本地进程、持续会话、流式事件、中断、暴露工具、响应审批

文档自己的定位:"The SDK simplifies common programmatic workflows; app-server gives product teams direct control over the lifecycle and user experience."

Relay 是范式样本:agent 坐在虚构货运看板旁,接应用自有的 MCP 工具,改签货物前必须人工批准。用户动作是选中一票货、点"Compare recovery"。应用供上下文,Codex 取最新样本数据,agent 解释选项,有后果的写操作过审批;工具改动底层记录后,应用刷新业务视图。分工写在原文里:"The harness handles the agent loop, conversation state, streamed activity, and tool interaction; the product continues to own its dashboard, records, and controls."

本章的哲学句:"the interface is an important part of the experience. It tells the agent what the user is looking at, gives it the right tools, and gives the user a place to review what happens next." 界面不是装饰,是上下文本身。

边界:文档明言 Relay 使用虚构种子数据——范式演示,非生产案例。

五、落地战报:三例,仅一例有数字

案例覆盖 IDE、云平台、垂直工作流。GitHub 与 JetBrains 把 Codex 带进既有 IDE 工作流;思科在 Cisco Cloud Control 的 App Builder 里用 SDK;Thrive Holdings 与 Crete 把 Codex 用于融入从业者反馈的报税流程——"Their pilot processed 7,000 returns and reduced preparation time by about a third."

边界:仅报税案例有数字,且是试点;IDE 与云案例只到一句话描述的深度。三例均为 OpenAI 的转述,无第三方数据。

反方与边界

最强反方:开源 harness 是送掉护城河、把 agent loop 商品化——若任何人都可取走这副骨架换上对手的模型,OpenAI 得到的只有维护负担。

回应分两层,且都承认无法完全坐实。第一层:文档自己的边界声明表明 OpenAI 不认为在送护城河——但这是声明,不是证据。第二层:反方成败系于一个未验证点——harness 能否运行第三方模型。若能,反方成立,第三节"分发决策"的推断需收回,降级为中立基础设施判断;若不能,反方失效。这正说明:读这份平台宣言,真正该读的是仓库,不是博文。

次级反方直指证据本身:ARC-AGI-3 对比是 OpenAI 自家设置下的自述评测,且 ARC 用通用 harness 的初衷正是让模型比较公平——厂商优化展示的是能力上限,不是可比成绩。回应:因此第二节只用它支撑"敏感性存在"(方向),不用它支撑"普遍提升"(幅度)。反方收窄了证据的可用范围,未推翻方向。

结论失效条件:

  1. 第三方在其他基准上无法复现 harness 敏感性;
  2. harness 被证实模型无关,且对手模型可经同一 harness 顺畅运行——届时"平台"退化为"捐赠的基础设施";
  3. 三个落地案例被证明是孤立样本而非普遍模式的起点。

结尾

对技术读者,这份文档留下三件可立即执行的事:

  1. 重审每一个 agent 评测——自己跑的或读到的:把"模型分"与"harness 分"拆成两个科目。用哪个 harness、哪些设置(推理是否保留、是否压缩),对结论的影响不小于模型版本号。
  2. 按需选层:CI 与批量任务用 codex exec,程序化调用用 SDK,把 agent 做成产品用 app-server。入口是开源 Codex 仓库。
  3. 两个开放验证问题:开源 harness 能否运行第三方模型(仓库依赖与配置可裁决);13.3% 到 38.3% 与六分之一 token 在其他基准上能否复现。答案落定前,对"平台"一词保持按句收费的谨慎。

证据说明

本文事实均取自《Codex as a platform: build on the open agent harness》(OpenAI Developers Blog,2026 年 8 月 19 日,作者 Nicolas Bonamy、Derrick Choi),锚点包括开篇底层系统定义句、"The reusable part is the agent loop"(ARC-AGI-3 句)、"An open harness developers can inspect and adapt"(三控制点与边界句)、"Choose the right integration layer"、"Build software around the workflow"、"Example: Relay"、"What developers are building"(7,000 份申报与三分之一时间句)各章原文;ARC-AGI-3 机制细节取自文档直接引用的 OpenAI 技术贴《How enabling two settings tripled our scores on the ARC-AGI-3 benchmark》(2026 年 7 月 29 日)。

文档无法确认的事项,本文未作填补:开源组件的具体许可证名称(文档仅称 open-source);harness 是否模型无关;ARC-AGI-3 数字的独立复现;GitHub/JetBrains 与思科案例的外链细节(仅使用文档内一句话描述);Relay 为虚构种子数据,无生产指标。