Nathan Lambert

@natolambert

在扩展强化学习中的一个基本想法:我们能否将更多计算资源分配给更难的问题? 我们是这么做的:如果你的 GRPO 小组所有的完成都错误,那么以概率 P(约 0.9)进行更多采样——以寻找更多梯度非零的 GRPO 批次。这是有效的! 称之为“永不放弃”
打开原帖#511482
  1. 产业

    Alexandr Wang:我们坚信有必要投资对齐
  2. 产业

    Mark Zuckerberg:上个月我写过,我们如何能为所有人建设一个积极且安全的未来:http://m…
  3. 产业

    Elon Musk:我们会着手处理这件事