Sebastian Raschka

@rasbt

从零开始推理:强化学习与可验证奖励( RLVR )第2轮。 涵盖短期保单比率、吉隆坡损失条款、格式奖励和其他GRPO提示和技巧。 00:00介绍和回顾 01:52解释基本的GRPO培训指标 06:34 GRPO计划改进 08:58使用Python脚本运行更长的培训任务 13:39运行基线GRPO培训脚本 17:29加载和绘制培训日志 19:29诊断g不稳定的训练 23:55评估MATH-500上的检查站 26:26下载现有检查点 30:09跟踪优势统计 34:53了解熵 40:32 PyTorch中的计算熵 44:17解读熵值 48:58将熵跟踪添加到GRPO 53:36分析优势和熵指标 56:18通过削减政策比率稳定GRPO 1:03:27实施限定策略损失 1:09:39分析剪辑的政策培训ing results 1:11:25 KL发散和奖励黑客 1:15:12添加吉隆坡损失条款 1:20:34简化吉隆坡损失的局限性 1:23:04设置奖励和思考标签的形式 1:25:47向令牌生成器添加特殊令牌 1:30:29实施格式奖励 1:35:56分析格式奖励培训 1:38:25奖励形式仅适用于正确答案 1:40:48通过研究进一步提高GRPO 1:45:43接下来的步骤和蒸馏
打开原帖#511482
  1. 研究

    Yann LeCun:@ Helios_Hua做得好
  2. 产业

    Mustafa Suleyman:超级智能必须被约束……今天,这是一个工程与治理挑战。而且并不新鲜。我们曾对…
  3. 产业

    Databricks:管理员现在可以配置编码代理在一个地方与统一网关