Rohan Paul

@rohanpaul_ai

斯坦福新论文发现:当每个人的智能体各自单独作用于共享资源时,群体的表现不如由 1 个智能体服务所有人。 在 5 个前沿模型上,共享预算或日历由 1 个服务所有人的智能体处理,效果好于每个用户 1 个智能体。 每个智能体都为自己的用户做了合理的工作。 但合在一起,它们会互相覆盖,随着团队扩大而陷入停滞,在没有沟通渠道的情况下,有 2 个环境直接崩溃。 在一个存在争夺的 token 预算上,Opus 5 团队只获得了可实现价值的 30%,而 1 个协调型智能体获得了 64%。 在团体订购环境中,超过一半的 Claude 团队回合里,智能体编造了关于其他用户的事实。 优先选择 1 个掌握所有人约束条件的智能体;如果你为每个用户运行 1 个智能体,就把读取同伴信息作为提交决定的前提条件。
打开原帖#511482
  1. 产业

    Greg Brockman:迈向加速科学发现、改善每个人的生活质量
  2. 研究

    François Chollet:G 会从数学 + 代码的 RLVR 中「涌现」吗?
  3. 研究

    François Chollet:如果参差不齐的能力前沿主要就是数学 + 代码呢?