Sebastian Raschka

@rasbt

从零开始推理,第6轮! 引入(和实施)具有可验证奖励的强化学习( RLVR )和组相对策略优化( GRPO )。 00:00简介 01:54是什么让推理模型与众不同? 04:25推理痕迹和模型能力 08:29命中率和格式奖励 11:34 AHA时刻和DeepSeek-R1培训 14:41推理工作和答案长度 18:38 RLHF和RLVR 23:04 GRPO与PPO26:40 GRPO用烹饪类比解释 31:43吉隆坡术语和简化的GRPO 35:04加载预训练模型 36:07加载数学训练数据 39:26抽样模型响应 46:30计算可验证奖励 49:55计算优势 51:54令牌和序列日志概率 55:29实现序列日志概率 57:37修正推理模式错误 1:02:24计算GRPO损失 1:04:37将GRPO步骤放在一起1:09:19 GRPO培训循环 1:12:57培训设置、日志记录和检查点 1:17:24运行培训和检查输出 1:19:28加载和评估检查点 1:22:33 MATH-500成绩和训练稳定性 1:24:05内存要求和后续步骤
打开原帖#511482
  1. 产业

    Alexandr Wang:哦
  2. 产业

    Alexandr Wang:Omarchy 手机上的 Muse 小工具 Muse 🤝 @dhh
  3. 产业

    Alexandr Wang:Muse 真的很擅长计时 我知道,你没想到吧