Sebastian Raschka
@rasbt
从头开始推理第 3 轮:这一次,我将介绍如何生成一个验证器......
a) ...评估(基础模型与任何未来模型改进)
b) ...稍后进行具有可验证奖励的强化学习(RLVR)训练
00:00 简介
01:21 LLM评估的四种方法
07:20 具有可验证奖励的验证者和强化学习
10:52 笔记本设置和依赖项
13:43 第 3.1 节 构建数学验证器
18:57 3.2 节加载预训练模型以生成文本
24:34 生成并显示模型答案
29:23 第 3.3 节 实现包装器以更轻松地生成文本
34:00 第 3.4 节 提取最终答案框
37:29 处理没有框的答案
43:17 第 3.5 节 标准化提取的答案
46:56 第 3.6 节验证数学等价性
53:32 实施平等检查
57:48 第 3.7 节对答案评分
59:20 构建并测试答案评分器
1:03:18 第 3.8 节加载评估数据集 (MATH-500)
1:07:51 第 3.9 节 评估模型
1:08:34 评估提示模板
1:10:47 及时的敏感性和记忆力
1:13:55 一个最小的评估示例
1:15:32 构建评估循环
1:20:27 比较 CPU、MPS 和 CUDA 结果
1:21:54 再现性和浮点数学
1:23:37 基础模型与推理模型
1:25:30 摘要和后续步骤