Sebastian Raschka
@rasbt
从零开始推理:强化学习与可验证奖励( RLVR )第2轮。
涵盖短期保单比率、吉隆坡损失条款、格式奖励和其他GRPO提示和技巧。
00:00介绍和回顾
01:52解释基本的GRPO培训指标
06:34 GRPO计划改进
08:58使用Python脚本运行更长的培训任务
13:39运行基线GRPO培训脚本
17:29加载和绘制培训日志
19:29诊断g不稳定的训练
23:55评估MATH-500上的检查站
26:26下载现有检查点
30:09跟踪优势统计
34:53了解熵
40:32 PyTorch中的计算熵
44:17解读熵值
48:58将熵跟踪添加到GRPO
53:36分析优势和熵指标
56:18通过削减政策比率稳定GRPO
1:03:27实施限定策略损失
1:09:39分析剪辑的政策培训ing results
1:11:25 KL发散和奖励黑客
1:15:12添加吉隆坡损失条款
1:20:34简化吉隆坡损失的局限性
1:23:04设置奖励和思考标签的形式
1:25:47向令牌生成器添加特殊令牌
1:30:29实施格式奖励
1:35:56分析格式奖励培训
1:38:25奖励形式仅适用于正确答案
1:40:48通过研究进一步提高GRPO
1:45:43接下来的步骤和蒸馏