Sasha Rush

@srush_nlp

这是@preston_fu 等人的一个有趣的话题——我们应该如何以一种能够扩展到更长、更困难的任务的方式奖励强化学习策略?我们的答案介于强化学习和模仿学习之间,并提供了一种简单的方法来将密集的每个令牌信用分配给长轨迹。
打开原帖#511482
  1. 研究

    OpenAI 首席科学家罕见警告:我们造出了“外星智能”,而监控它的能力正在消失
  2. 产业

    Alexandr Wang:如果这是一场 MMA 比赛,只会有一个人站着留下 (提示:是 Muse)
  3. 产业

    Alexandr Wang:3/Muse以最小权限原则运行,因此您可以决定连接的内容和不连接的内容