Rohan Paul
@rohanpaul_ai
新亚马逊论文显示,大语言模型可以充当「研究世界模型」,在真正烧掉 GPU 时间之前,先预测某项训练改动是否有帮助。
AI 研究代理提出实验的速度,远快于团队实际跑得起的速度。选哪些实验占用 GPU,本质上就是提前猜结果。
他们用 LLM 当研究世界模型,在实验开跑前预测收益。在 9 套设置、从预训练到推理共 2653 条真实实验记录上做了测试。
同一设置下的历史记录,把与真实结果的平均排序相关从 0.506 提到 0.774(跨 5 套设置)。在 OLMo3-100M 设置上,低推理强度但加上记录时得分 0.892;不加记录、拉满推理强度则只有 0.648。
如果你在跑研究代理:把每一次实验(包括失败)都记下来,再喂给负责挑选下一轮实验的模型。