Sebastian Raschka

@rasbt

从头开始推理第 3 轮:这一次,我将介绍如何生成一个验证器...... a) ...评估(基础模型与任何未来模型改进) b) ...稍后进行具有可验证奖励的强化学习(RLVR)训练 00:00 简介 01:21 LLM评估的四种方法 07:20 具有可验证奖励的验证者和强化学习 10:52 笔记本设置和依赖项 13:43 第 3.1 节 构建数学验证器 18:57 3.2 节加载预训练模型以生成文本 24:34 生成并显示模型答案 29:23 第 3.3 节 实现包装器以更轻松地生成文本 34:00 第 3.4 节 提取最终答案框 37:29 处理没有框的答案 43:17 第 3.5 节 标准化提取的答案 46:56 第 3.6 节验证数学等价性 53:32 实施平等检查 57:48 第 3.7 节对答案评分 59:20 构建并测试答案评分器 1:03:18 第 3.8 节加载评估数据集 (MATH-500) 1:07:51 第 3.9 节 评估模型 1:08:34 评估提示模板 1:10:47 及时的敏感性和记忆力 1:13:55 一个最小的评估示例 1:15:32 构建评估循环 1:20:27 比较 CPU、MPS 和 CUDA 结果 1:21:54 再现性和浮点数学 1:23:37 基础模型与推理模型 1:25:30 摘要和后续步骤
打开原帖#511482
  1. 研究

    Andrew Ng:过去两周,引发对人工智能危险担忧的最响亮的声音取得了巨大进展
  2. 研究

    Jeff Dean:很自豪能与许多其他人在其中很多事情上合作
  3. 研究

    Jeff Dean:Waymo的安全数据越来越好