
9月17日挂出的 arXiv 论文(编号 2609.18996,作者 Joey Xiao 与 Haonan Huang,分属纽约大学与普林斯顿大学)报告了一个语言智能体系统此前没有做到的结果:一个通用编码智能体,在只拿到游戏描述、原始观察/动作接口和一个空策略文件的情况下,用一次自主会话构建出完整的游戏控制器,然后在星际争霸II里击败全部公平的内置 AI、在文明(Freeciv)里通过完全征服赢得完整对局。
论文提出 Gauntlet 框架,流程是“开发—冻结—评估”。智能体与实时游戏互动、自行实验,工程化出一个独立控制器;研究者把结果冻结,在 held-out 实例上评分,游戏过程中零模型调用。论文强调契约的“裸”:没有策略提示、没有算法先验、没有手工架构——控制器完全由模型自己写出来。作者把这种能力称为 compiled agency,即开发经验被编译成持久的可执行智能体,其架构由模型构建。
证据分两层。在未公开的程序化 roguelike 上,held-out 成功率在 0% 到 86% 之间波动,且呈现清晰的代际阈值:新一代系统的每一次会话都超过前代系统的最好会话。在完整游戏规模下,raw-API 控制器击败星际争霸II所有公平内置 AI 与两个作弊变体;单会话程序在 held-out 种子上通过完全征服赢得整局文明。
局限同样需要说清。论文自述对新手 AI 的胜率仍然不高(“at modest rates”);这是预印本,尚未经过同行评审;测试的完整游戏是 Freeciv——文明的自由软件变体——而非商业原版。结果来自作者自报口径,没有第三方复现。benchmark 的通用怀疑在这里同样适用:单一游戏环境、固定地图种子,离“通用智能”还很远。
值得注意的不是“AI 赢了游戏”,而是赢的方式:控制器在游戏过程中不需要每回合调用模型,也没有手工战术层。这意味着编码智能体的能力第一次被证明可以脱离即时推理循环、以编译程序的形式独立存在。对部署者而言,这直接关系到推理成本结构——编译一次、运行无数次,比每步都过模型便宜得多,也更容易审计。
“开发经验→可执行程序”的编译通道是否比即时推理更可扩展,是这篇论文留下的真问题。眼下它仍然是在固定环境里的一次性胜利,但方向值得跟踪:如果前沿编码智能体真的能把自己写的控制器“留下”,智能体形态可能会从对话式推理转向可交付的软件。
[1][2]