Rohan Paul
@rohanpaul_ai
谷歌的新论文表明,当 LLM 代理的工作流程存在于可编辑的过程图中(从执行中学习)而不是埋藏在聊天历史记录中时,LLM 代理可以更好地处理长任务。
问题是:随着代理运行时间的延长,他们可能会忘记自己在哪里、重复使用工具或以错误的顺序执行步骤。
程序图为代理提供了下一步可能发生的情况的小地图,同时仍然让法学硕士自由推理。
运行完成后,另一个法学硕士会比较成功和失败并编辑地图,但只有在不损害保留任务的情况下才会保留编辑。
在 24 个模型和基准组合中,该方法在 21 个组合中排名第一或并列第一。
它还修复了一个糟糕的人为设计工作流程:在 MultiChallenge 上,成功率从有缺陷的图表的 58.93% 上升到细化后的 92.86%。
该指南需要额外的代币,因此当长工作流程成为瓶颈时,它最有意义。
总体而言,它建议将关键过程从聊天历史记录中移出,并转移到一个明确的、可编辑的工作流程中,从而改进执行。
– arxiv。组织/abs/2609.09153
标题:“程序图:LLM 代理的自我演化执行结构”