Sebastian Raschka
@rasbt
推理缩放第 1 部分。
从修改后的文本生成函数(温度缩放、top-p 过滤、多项式采样)开始,生成不同的输出,以实现自我一致性和最佳 N 值(将答案准确性提高 2 倍以上)
00:00 介绍和回顾
00:31 训练时间和推理时间缩放
07:52 我们将实施什么
11:47 笔记本设置和模型加载
17:43 构建灵活的文本生成函数
24:40 思路提示
28:26 采样和输出多样性
33:43 下一个令牌逻辑和贪婪解码
38:20 逐步升温
42:46 Softmax 和令牌概率
47:42 多项式采样
54:51 将温度采样添加到文本生成中
59:31 一步一步的Top-p过滤
1:10:23 在文本生成中添加 top-p 过滤
1:13:43 采样和 LLM 水印
1:16:01 自我一致性和多数表决
1:20:36 实现自我一致性
1:29:02 MATH-500 结果
1:35:01 准确性和计算权衡
1:36:50 下一步和自我完善