Sebastian Raschka

@rasbt

从头开始推理,第五轮!这次,讨论对数概率评分(也是预训练和蒸馏中交叉熵等损失函数的一个重要基本概念)和自我精炼。 00:00 介绍和推理时间缩放回顾 05:02 加载预训练的法学硕士 08:00 比较和评分模型答案 10:18 构建基于规则的记分器 17:53 标记概率和序列似然 26:47 在 PyTorch 中计算代币概率 30:12 代币索引和目标转移 37:27 对数概率和数值稳定性 45:57 用平均对数概率对答案进行评分 56:24 自我精炼如何发挥作用 59:07 提出批评并修改答案 1:01:00 实现自我优化循环 1:05:57 MATH-500评估结果 1:07:35 要点和后续步骤
打开原帖#511482
  1. 研究

    Andrew Ng:过去两周,引发对人工智能危险担忧的最响亮的声音取得了巨大进展
  2. 研究

    Jeff Dean:很自豪能与许多其他人在其中很多事情上合作
  3. 研究

    Jeff Dean:Waymo的安全数据越来越好