Nathan Lambert@natolambert2026年9月16日 02:52在扩展强化学习中的一个基本想法:我们能否将更多计算资源分配给更难的问题? 我们是这么做的:如果你的 GRPO 小组所有的完成都错误,那么以概率 P(约 0.9)进行更多采样——以寻找更多梯度非零的 GRPO 批次。这是有效的! 称之为“永不放弃”打开原帖#511482