Sasha Rush@srush_nlp2026年9月09日 02:52这是@preston_fu 等人的一个有趣的话题——我们应该如何以一种能够扩展到更长、更困难的任务的方式奖励强化学习策略?我们的答案介于强化学习和模仿学习之间,并提供了一种简单的方法来将密集的每个令牌信用分配给长轨迹。打开原帖#511482