Rohan Paul
@rohanpaul_ai
谷歌新论文表明:研究型智能体如果维护一张排好序的“想法地图”,并检查代码是否与每个想法相符,就能更快拿到更好的结果,所以两者都应内置。
大多数智能体只是不停地改代码。
当代码偏离了它被打分时所对应的想法,智能体就会学到错误的教训。
AIM 把想法归入排序后的主题,每一轮在强势主题和未经检验的主题之间分配精力。一个审计器会剔除投机取巧得来的结果,并重新标注想法以使其与代码一致。
它在 2 组任务上分别比此前最好的智能体 ScientistOne 高出 1.6 和 4.9 分,并以最多快 3.1 倍的速度达到 ScientistOne 的最佳分数。
预计在可行方法很多、但好方法很少的任务上收益最大。