9 月 16 日发布在 arXiv 上的预印本(编号 2609.18094,来自 NVIDIA 与多家机构的研究者)提出了一种把多智能体研究协作"机构化"的做法:把每一次实验、假设、验证与报告都写成 Git 仓库里不可变的提交,让一群没有任务分配、没有中央规划器的语言模型智能体,像研究员社区一样共享记忆、互相复现。论文作者把系统命名为 Agora——古希腊的城市广场。

问题意识很直接。已有的自动化研究循环(如 AutoResearch)证明,单个编码智能体可以无人值守地改进一个训练设置;但当多个这样的智能体并行启动时,每个会话都从零开始,彼此不知道谁已经试过某个想法、谁已经撞过某堵墙。结果是:更多智能体往往意味着更多重复搜索,而不是更多发现。Agora 把这个问题重新定义为"机构记忆"问题——不是让单个智能体更聪明,而是让一群智能体的工作可见、可复用。

机制上,Agora 把项目建模成一张有向无环图:每个贡献(含代码、元数据、父节点与可选的评测结果)对应一个 Git 提交,任何声明都可以被 checkout 出来重跑;派生索引暴露当前前沿、被忽视的分支以及每条声明的验证状态;一个多样性感知的选择规则阻止整个社区过早收敛到同一条路线上。

论文报告了首次持续运行:13 个语言模型 worker 在近 12 天里、没有任何指派任务,共同解决一个权重迁移问题——给定 141 个预训练 donor 模型和一个冻结的 1.19

[1][2]

6 亿参数 attention-SSM 混合目标(其维度与任何 donor 都不匹配),要求在没有训练数据、没有梯度更新的情况下完成目标初始化。这些 worker 总共发布了 1703 条贡献,把评测指标从 3.39 推到了 1.899 bits per byte,弥合了与训练版 GPT-2 124M 之间差距的 62%。获胜配方把 donor 的 next-token 统计压入目标的 embedding 与输出头,再通过稀疏编辑注意力、前馈与状态空间块加入短程上下文信号;这条配方的血统横跨 145 个提交、15 个账号,期间贴出 165 次独立复现,没有一次失败。

论文也如实记录了过程里的一个插曲:一次中途的人工干预把社区从"单一文化"里拉了出来——多样性规则并不总能自动防止所有 worker 挤进同一条局部最优。作者在摘要里明确划出边界:这次运行证明了共享 DAG 协调在 13 个智能体规模上是可行的,但它没有与"把同样算力给单个智能体跑更久"做对照实验,因此 62% 这个数字是存在性证明,而不是生产力声明。

这套设计最值得注意的地方在于它的选择:Git 这种为人类协作而生的版本控制原语,被直接当作机器智能体的协调协议。它意味着智能体之间不需要对话、不需要共享会话上下文,只需要一个谁都能检查、谁都能重跑的历史。对今天普遍"对话即协作"的多智能体实践来说,这是一个完全不同的默认值——至于它是否真的比集中式或单智能体方案更快,要等作者承诺的 compute-matched 对照实验落地之后才敢下结论。在那之前,它至少提供了一个干净的问题提法:研究社区的记忆,应该长在哪里。

[1][2]
深夜机房中工程师背影站在两排机柜之间,一条琥珀金色提交链从机柜指示灯中长出、分叉合流成树状图谱
深夜机房中金色提交链贯穿机柜阵列的编辑级插画, AI 生成插画,非新闻照片