Rohan Paul

@rohanpaul_ai

新的元论文表明,当单独的管理者决定如何使用计算时,长时间运行的代理会随着计算量的增加而变得更好。 更多的计算为代理提供了更多选择:下一步尝试什么、信任什么、何时停止。许多代理商会临时拨打这些电话,因此额外的预算可能会被浪费。 他们的解决办法是将这些电话交给一位单独的经理,由他来考虑,而工人则执行实际任务。 他们构建了一个元推理代理:工作人员执行任务,然后由一个单独的控制器决定接下来会发生什么。它保留简短的进度摘要,根据剩余预算权衡选项,并选择每个工作人员看到的过去结果。 在最大的预算下,这种设置在所有 12 次正面测试中都击败了没有经理的其他相同代理。在编码基准上使用 GPT-5.5 时,预算增加两倍,其得分从 64.1% 提高到 71.5%,而另一个代理则停滞在 64% 附近。 对于长期运行的代理,不要只添加计算:将一些费用花在管理器上,由其决定其余部分的去向。
打开原帖#511482
  1. 产业

    Rohan Paul:这篇谷歌 Deep Mind + 牛津大学 + 芝加哥大学的论文询问了如果…
  2. 产业

    Rohan Paul:SpaceX 预计到 11 月底将实现约 2.3 GW 的计算能力
  3. 产业

    Rohan Paul:Google 发布了 Agent Harnesses 的正则化递归自我改进…