Sebastian Raschka
@rasbt
从头开始推理,第五轮!这次,讨论对数概率评分(也是预训练和蒸馏中交叉熵等损失函数的一个重要基本概念)和自我精炼。
00:00 介绍和推理时间缩放回顾
05:02 加载预训练的法学硕士
08:00 比较和评分模型答案
10:18 构建基于规则的记分器
17:53 标记概率和序列似然
26:47 在 PyTorch 中计算代币概率
30:12 代币索引和目标转移
37:27 对数概率和数值稳定性
45:57 用平均对数概率对答案进行评分
56:24 自我精炼如何发挥作用
59:07 提出批评并修改答案
1:01:00 实现自我优化循环
1:05:57 MATH-500评估结果
1:07:35 要点和后续步骤