Sebastian Raschka
@rasbt
从零开始推理,第6轮!
引入(和实施)具有可验证奖励的强化学习( RLVR )和组相对策略优化( GRPO )。
00:00简介
01:54是什么让推理模型与众不同?
04:25推理痕迹和模型能力
08:29命中率和格式奖励
11:34 AHA时刻和DeepSeek-R1培训
14:41推理工作和答案长度
18:38 RLHF和RLVR
23:04 GRPO与PPO26:40 GRPO用烹饪类比解释
31:43吉隆坡术语和简化的GRPO
35:04加载预训练模型
36:07加载数学训练数据
39:26抽样模型响应
46:30计算可验证奖励
49:55计算优势
51:54令牌和序列日志概率
55:29实现序列日志概率
57:37修正推理模式错误
1:02:24计算GRPO损失
1:04:37将GRPO步骤放在一起1:09:19 GRPO培训循环
1:12:57培训设置、日志记录和检查点
1:17:24运行培训和检查输出
1:19:28加载和评估检查点
1:22:33 MATH-500成绩和训练稳定性
1:24:05内存要求和后续步骤