Rohan Paul

@rohanpaul_ai

苹果的新论文基本上是说,自动化机器学习工程的进步来自模型和运行环境,而不是围绕它们搭建的脚手架。 论文发现,一个提示词写得好、拥有 shell 和文件访问权限的单个编码智能体,表现追平或超过了 4 个多智能体 ML 系统,所以别搞编排,从单个会话开始。 那些系统加入了搜索树、记忆层和专业智能体团队。 它们是在模型只能写代码、不能运行代码的时代设计的。 这篇论文在同一个代码库上、用相同的模型、硬件和 24 小时预算,重新运行了每一种封装。唯一明显起作用的改变,是给模型一个 shell 而不是聊天框。 使用 GLM 5.2 时,极简智能体在 62.5% 的 Kaggle 任务上拿到奖牌,而已发表的最佳框架为 47.1%。加入并行智能体和消息通道后,其奖牌率反而从 55.7% 降到 33.3%。 – arxiv. org/abs/2609.40303 标题:《How Much of a Harness Does a Strong Agent Need for Autonomous ML Engineering?》(强智能体做自主 ML 工程需要多少框架?)
打开原帖#511482
  1. 产业

    Rohan Paul:– https://arxiv.org/abs/2610.08144 标题…
  2. 产业

    Rohan Paul:一篇新论文表明,当 AI 把一个数学证明翻译成 Lean 时,通过 Lea…
  3. 产业

    Rohan Paul:Emad Mostaque:AI 模型“基本上已经达到了人脑的效率”