Rohan Paul

@rohanpaul_ai

新清华论文发现:靠对战回放改进游戏 bot 的 AI 代理可以冲上人类排行榜,但在规则复杂的游戏上大多会卡住。 让 AI 从有限场次中学出制胜策略仍然很难,尤其对手还在不断变化时。 他们基于清华年度 bot 大赛的 12 款游戏搭了 AAArena,并以 1920 个归档人类程序当对手。编码代理在模型权重不变的情况下,阅读规则、挑选对手、研究回放,并在对战场次预算内重写自己的 bot。 在全部 3 款测试游戏里,详细回放都优于只看胜负的反馈。有了回放,Pacman bot 冲到第 1;没有回放则是第 11。 把对战场次预算扩大到三倍,也没能把 4 个卡住的 bot 推到第 1。 – arxiv.org/abs/2610.12341 标题:"Can AI Agents Learn Their Way to the Top? Evaluating Heuristic Learning in a Long-Running Game Agent Competition"
打开原帖#511482
  1. 研究

    Andrej Karpathy:翻出四月份的这条推文,因为关于大型语言模型(LLM)能力的共享认知差距正在…
  2. 产业

    Elon Musk:@Sassafrass_84 到了这一步,我宁愿独处,只把时间花在孩子们身上
  3. 产业

    Cohere:从柏林到不列颠哥伦比亚省,我们正在建立一个全球性的公司,让您更多地欣赏全球…