Rohan Paul
@rohanpaul_ai
斯坦福新论文发现:改 harness 能修好会循环或卡住的智能体;而交付糟糕计划的智能体,则需要权重训练。
智能体可以通过编辑 harness(模型外围的提示、工具与检查)来改进,也可以通过微调权重来改进。
他们把失败运行分成过程失败(如循环、步数预算用尽)和内容失败(交付了差计划)。在旅行规划基准上,一个由 LLM 驱动的循环改写 harness,其最佳运行再微调模型。
Harness 进化把 Qwen3.5-4B 在留出任务上从 0.16 提到 0.30,计划交付率从 55% 升到 90%。Harness 编辑从未缩小差计划占比,但 LoRA 适配器把 Qwen3.5-9B 留出运行中差计划占比从 28% 降到 5%。
改进智能体之前,先标注失败原因:过程失败改 harness,内容失败改权重。