大模型太贵,小模型太菜——企业级 AI 代理的现实困境,Salesforce AI 团队用一篇 9 月 8 日的论文给出了一个反直觉但极具实操价值的答案:给弱模型配上自动进化的"脚手架"(harness),它能追近前沿模型;但接下来如果让它直接模仿专家模型的完整轨迹,成绩会在全部七个任务上倒退 4 到 30 分。真正的解法不是"抄作业",而是"只在学生自己走错的那一步,请专家改写"。

论文标题点题:《Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails》。

[1]
编辑插画:深蓝背景上左右分屏。左侧,一颗金色大齿轮被强行压入青色晶格脚手架,齿牙不匹配、晶体崩裂;右侧,一束精准的手术光束修复了青色小齿轮上的单个断齿,小齿轮在完好的脚手架中顺畅转动。青金对比色,现代几何风格,电影感打光。
封面插画:左侧是强行模仿导致的"错配崩裂",右侧是"只修错的那一步"的精准手术——harness 与模型一旦锁配,教学粒度决定成败。AI 生成图像。, AI-generated editorial illustration.

实验设定:七项企业任务,两类模型家族

研究采用 Yang 等人(2026)的七项可客观验证的企业代理任务:工资审计、预算审批、股票预警、IoT 异常检测、浏览器自动化、网站管理、代码重构。harness 优化走 GEPA 式搜索(gemini-3.1-pro-preview 元代理提出失败驱动的修改,仅在验证集改善时保留);模型侧用 LoRA-SFT 在 H100/H200 上微调。弱模型用 Qwen3-Coder(30B 总参数/3B 激活)与 Gemma 4(26B/4B)两个家族复现。

[1]

第一层发现:harness 进化是性价比之王

先把弱模型的 harness 围绕它自己进化一轮,平均分从 29.2% → 78.0%(+48.8)——近 50 分的提升,全部来自系统提示、工具集、执行钩子、上下文管理这些"外部脚手架",模型权重一个参数没动。

更妙的是向上迁移:同一个为弱模型定制的 harness,装上更强的 gemini-3.1-pro-preview,从 84.4% → 93.6%(+15.6)。专家模型在 93.6%–100% 的轨迹里都触发了进化出的组件——包括弱模型只用 30.8% 的"领域计算配方",专家用到 94.2%。harness 是通用的,但弱模型还没榨干它。

[1]

第二层发现:全轨迹模仿,全线崩盘

自然的想法是让弱模型模仿专家在这套 harness 下的完整轨迹。这一步出人意料地反噬了:LoRA-SFT 模仿专家轨迹后,弱模型在全部七个任务上倒退 4 到 30 分(Qwen3-Coder 平均 78.0 → 63.1,-14.9),Gemma 4 复现同样结果。而同一套模仿流程在未进化的原始 harness 下反而是有效的(+6.3)——问题不在模仿本身,而在模仿与 harness 进化的相互作用

机制分析排除了两个常见解释:模仿后模型对脚手架的使用率上升了、知识也增加了。真正退化的是"模型与 harness 的契合度"——弱模型照搬了专家的规划策略,却没有执行该策略的能力;而这副 harness 恰恰是围绕它原生规划风格进化出来的。

[1]

第三层发现:在策略修正——只教错的那一步

解法是论文的核心贡献:在策略(on-policy)专家修正流水线,由元级 MLE 代理端到端自动化——在弱模型自己的 rollout 里定位失败的那一轮,请专家只改写那一轮,其余轨迹保持弱模型自己的风格。

结果:Qwen3-Coder 在进化 harness 下从 78.0 → 81.3(比模仿高出 18.2 分),七个任务五项提升。知识学进来了,规划风格没丢,harness 契合度保住了。

[1]
-14.9 分Qwen3-Coder,七任务均值
进化 harness 下全轨迹模仿的平均倒退harness 进化先把弱模型从 29.2% 提到 78.0%,但模仿专家完整轨迹反而使其跌至 63.1%;同一模仿在原始 harness 下是 +6.3。改用"只改写失败轮"的在策略修正后回升到 81.3%。

分析:三个判断

第一,这篇论文把"harness 与模型"从两个独立调参旋钮,变成了一对耦合系统。一旦 harness 围绕某个模型进化完成,它就不再是中立的工具,而是与该模型的行为分布"锁配"的共生体。后续任何权重更新都必须以不破坏这个契合为前提。这对所有做"小模型 + 提示工程 + 工具编排"的团队是直接的警告:你精心调好的脚手架,可能正随着下一次微调悄悄失效。

第二,"专家轨迹蒸馏"这个工业界默认动作,在企业代理场景被证伪了一半。模仿的隐含假设是"专家的轨迹 = 更好的轨迹",但论文证明这个假设只在 harness 中立时成立。一旦 harness 特化,专家轨迹就变成了另一种分布的样本——弱模型学得来形,学不来神,反而丢了自己的神。更经济的推理是:企业不该为"小模型跑不了专家任务"焦虑,而该为"专家轨迹不适合小模型"重新设计教学信号。

第三,"在策略修正"可能是代理时代最实用的训练范式。它同时满足三个苛刻条件:保留学生自己的分布(不破坏 harness 契合)、精准注入专家知识(只在失败点)、全程可由元代理自动化(可嵌入协同进化循环)。这与 RLHF 的"全局偏好打分"、蒸馏的"全局轨迹复制"都不同——它把教学粒度压到了单轮。当代理任务越来越长、越来越领域化,"在哪一步教"会比"教什么"更决定成败。

[1]

附:短帖版(微博 / X 可直接发)

Salesforce 新论文:小模型 + 自动进化 harness,七项企业任务从 29.2% 飙到 78.0%,不动权重。但让弱模型全盘模仿专家轨迹,全线倒退 4–30 分——harness 已和弱模型"锁配",硬套专家策略反而破坏了契合。解法:MLE 元代理只在弱模型走错的那一步请专家改写,回到 81.3%。结论:教学粒度比教学内容更决定成败。#Salesforce #AI代理 #小模型

[1]