Rohan Paul

@rohanpaul_ai

谷歌的新论文表明,当 LLM 代理的工作流程存在于可编辑的过程图中(从执行中学习)而不是埋藏在聊天历史记录中时,LLM 代理可以更好地处理长任务。 问题是:随着代理运行时间的延长,他们可能会忘记自己在哪里、重复使用工具或以错误的顺序执行步骤。 程序图为代理提供了下一步可能发生的情况的小地图,同时仍然让法学硕士自由推理。 运行完成后,另一个法学硕士会比较成功和失败并编辑地图,但只有在不损害保留任务的情况下才会保留编辑。 在 24 个模型和基准组合中,该方法在 21 个组合中排名第一或并列第一。 它还修复了一个糟糕的人为设计工作流程:在 MultiChallenge 上,成功率从有缺陷的图表的 58.93% 上升到细化后的 92.86%。 该指南需要额外的代币,因此当长工作流程成为瓶颈时,它最有意义。 总体而言,它建议将关键过程从聊天历史记录中移出,并转移到一个明确的、可编辑的工作流程中,从而改进执行。 – arxiv。组织/abs/2609.09153 标题:“程序图:LLM 代理的自我演化执行结构”
打开原帖#511482
  1. 产业

    Sharif Shameem:你对未来的影响力比你想象的更大
  2. 产业

    Charles Frye:将你们的相互静音
  3. 产业

    Rohan Paul:通过将更简单的工具界面与不断适应模型当前可以学习的内容的合成任务相结合,4…