Rohan Paul
@rohanpaul_ai
新清华论文发现:靠对战回放改进游戏 bot 的 AI 代理可以冲上人类排行榜,但在规则复杂的游戏上大多会卡住。
让 AI 从有限场次中学出制胜策略仍然很难,尤其对手还在不断变化时。
他们基于清华年度 bot 大赛的 12 款游戏搭了 AAArena,并以 1920 个归档人类程序当对手。编码代理在模型权重不变的情况下,阅读规则、挑选对手、研究回放,并在对战场次预算内重写自己的 bot。
在全部 3 款测试游戏里,详细回放都优于只看胜负的反馈。有了回放,Pacman bot 冲到第 1;没有回放则是第 11。
把对战场次预算扩大到三倍,也没能把 4 个卡住的 bot 推到第 1。
– arxiv.org/abs/2610.12341
标题:"Can AI Agents Learn Their Way to the Top? Evaluating Heuristic Learning in a Long-Running Game Agent Competition"