Rohan Paul
@rohanpaul_ai
苹果的新论文基本上是说,自动化机器学习工程的进步来自模型和运行环境,而不是围绕它们搭建的脚手架。
论文发现,一个提示词写得好、拥有 shell 和文件访问权限的单个编码智能体,表现追平或超过了 4 个多智能体 ML 系统,所以别搞编排,从单个会话开始。
那些系统加入了搜索树、记忆层和专业智能体团队。
它们是在模型只能写代码、不能运行代码的时代设计的。
这篇论文在同一个代码库上、用相同的模型、硬件和 24 小时预算,重新运行了每一种封装。唯一明显起作用的改变,是给模型一个 shell 而不是聊天框。
使用 GLM 5.2 时,极简智能体在 62.5% 的 Kaggle 任务上拿到奖牌,而已发表的最佳框架为 47.1%。加入并行智能体和消息通道后,其奖牌率反而从 55.7% 降到 33.3%。
– arxiv. org/abs/2609.40303
标题:《How Much of a Harness Does a Strong Agent Need for Autonomous ML Engineering?》(强智能体做自主 ML 工程需要多少框架?)