Rohan Paul
@rohanpaul_ai
新的元论文表明,当单独的管理者决定如何使用计算时,长时间运行的代理会随着计算量的增加而变得更好。
更多的计算为代理提供了更多选择:下一步尝试什么、信任什么、何时停止。许多代理商会临时拨打这些电话,因此额外的预算可能会被浪费。
他们的解决办法是将这些电话交给一位单独的经理,由他来考虑,而工人则执行实际任务。
他们构建了一个元推理代理:工作人员执行任务,然后由一个单独的控制器决定接下来会发生什么。它保留简短的进度摘要,根据剩余预算权衡选项,并选择每个工作人员看到的过去结果。
在最大的预算下,这种设置在所有 12 次正面测试中都击败了没有经理的其他相同代理。在编码基准上使用 GPT-5.5 时,预算增加两倍,其得分从 64.1% 提高到 71.5%,而另一个代理则停滞在 64% 附近。
对于长期运行的代理,不要只添加计算:将一些费用花在管理器上,由其决定其余部分的去向。