Rohan Paul

@rohanpaul_ai

谷歌新论文表明:研究型智能体如果维护一张排好序的“想法地图”,并检查代码是否与每个想法相符,就能更快拿到更好的结果,所以两者都应内置。 大多数智能体只是不停地改代码。 当代码偏离了它被打分时所对应的想法,智能体就会学到错误的教训。 AIM 把想法归入排序后的主题,每一轮在强势主题和未经检验的主题之间分配精力。一个审计器会剔除投机取巧得来的结果,并重新标注想法以使其与代码一致。 它在 2 组任务上分别比此前最好的智能体 ScientistOne 高出 1.6 和 4.9 分,并以最多快 3.1 倍的速度达到 ScientistOne 的最佳分数。 预计在可行方法很多、但好方法很少的任务上收益最大。
打开原帖#511482
  1. 产业

    Alexandr Wang:今天清空日程,给 Muse 做媒体培训 😑
  2. 产业

    Clément Delangue:对此超级兴奋,我也知道权重马上就会放出(https://huggingfa…
  3. 产业

    Aravind Srinivas:Perplexity 在 Hugging Face 决策指数(Decisi…