Sebastian Raschka
@rasbt
《Reasoning from Scratch》第二期:本视频讲解大语言模型的文本生成流程与 KV 缓存(在后续加入推理技巧前,先打好基座模型基础)。
00:00 引言与推理模型演示
01:55 如何使用本书
05:00 第 2 章概览
08:25 检查 PyTorch 与硬件支持
10:26 Apple silicon 与 MPS 注意事项
15:00 云端 GPU 选项
16:08 Token 与分词
18:20 Qwen3 与 Reasoning From Scratch 包
23:05 文本编码与解码
26:24 下载权重并选择设备
31:01 加载预训练 Qwen3 模型
34:32 大语言模型如何生成文本
36:47 输入张量与 batch 维度
41:48 推理模式下运行模型
44:11 Logits 与下一 token 预测
49:21 用 argmax 做贪心解码
52:28 构建流式文本生成器
01:01:28 生成文本并处理结束符
01:06:00 文本生成基准测试
01:14:34 KV 缓存原理
01:17:22 加入 KV 缓存并测量加速
01:24:31 用 torch.compile 做模型编译
01:30:33 编译与 KV 缓存结合
01:32:53 CPU 与 GPU 性能对比
01:35:32 回顾与下一步