Rohan Paul

@rohanpaul_ai

微软一篇关于智能体 harness 自动优化的新论文。 大多数 harness 自动调优器关注的是如何修补提示词和工具,但由哪些任务来产生反馈,同样会影响最终 harness 的好坏。 如果根据哪些失败仍未修复来挑选训练任务,就能得到更强的 AI 智能体,所以别再给它们喂一份固定的任务清单。 ActiveSaddler 跟踪失败模式,专攻最值得修复的那一个,或者尝试未见过的任务来发现新的失败。 在相同的优化器上,ActiveSaddler 让 GAIA2 的测试通过率提高 4.4 个百分点,Terminal-Bench 2.0 提高 7.5 个百分点。达到 58.5% 的 GAIA2 开发集准确率只花了 298 美元,而固定顺序需要 1,360 美元。 如果你要自动调优一个智能体,就把运行预算对准那些仍未解决的失败。
打开原帖#511482
  1. 产业

    Clément Delangue:冲啊 https://huggingface.co/reflection
  2. 产业

    Alexandr Wang:顺便说一下,这张照片是我 19 岁生日时拍的
  3. 产业

    Alexandr Wang:muse 触控栏