Rohan Paul

@rohanpaul_ai

斯坦福新论文发现:改 harness 能修好会循环或卡住的智能体;而交付糟糕计划的智能体,则需要权重训练。 智能体可以通过编辑 harness(模型外围的提示、工具与检查)来改进,也可以通过微调权重来改进。 他们把失败运行分成过程失败(如循环、步数预算用尽)和内容失败(交付了差计划)。在旅行规划基准上,一个由 LLM 驱动的循环改写 harness,其最佳运行再微调模型。 Harness 进化把 Qwen3.5-4B 在留出任务上从 0.16 提到 0.30,计划交付率从 55% 升到 90%。Harness 编辑从未缩小差计划占比,但 LoRA 适配器把 Qwen3.5-9B 留出运行中差计划占比从 28% 降到 5%。 改进智能体之前,先标注失败原因:过程失败改 harness,内容失败改权重。
打开原帖#511482
  1. 产业

    Rohan Paul:又一只漂亮的机械手
  2. 产业

    Rohan Paul:FT 刚报道:英伟达正就收购或进一步投资 Reflection AI 展开…
  3. 产业

    Rohan Paul:更强的机器人,并不总是需要更强的基础模型