Rohan Paul

@rohanpaul_ai

新亚马逊论文显示,大语言模型可以充当「研究世界模型」,在真正烧掉 GPU 时间之前,先预测某项训练改动是否有帮助。 AI 研究代理提出实验的速度,远快于团队实际跑得起的速度。选哪些实验占用 GPU,本质上就是提前猜结果。 他们用 LLM 当研究世界模型,在实验开跑前预测收益。在 9 套设置、从预训练到推理共 2653 条真实实验记录上做了测试。 同一设置下的历史记录,把与真实结果的平均排序相关从 0.506 提到 0.774(跨 5 套设置)。在 OLMo3-100M 设置上,低推理强度但加上记录时得分 0.892;不加记录、拉满推理强度则只有 0.648。 如果你在跑研究代理:把每一次实验(包括失败)都记下来,再喂给负责挑选下一轮实验的模型。
打开原帖#511482
  1. 研究

    Andrej Karpathy:翻出四月份的这条推文,因为关于大型语言模型(LLM)能力的共享认知差距正在…
  2. 产业

    Elon Musk:@Sassafrass_84 到了这一步,我宁愿独处,只把时间花在孩子们身上
  3. 产业

    Cohere:从柏林到不列颠哥伦比亚省,我们正在建立一个全球性的公司,让您更多地欣赏全球…