Sebastian Raschka

@rasbt

《Reasoning from Scratch》第二期:本视频讲解大语言模型的文本生成流程与 KV 缓存(在后续加入推理技巧前,先打好基座模型基础)。 00:00 引言与推理模型演示 01:55 如何使用本书 05:00 第 2 章概览 08:25 检查 PyTorch 与硬件支持 10:26 Apple silicon 与 MPS 注意事项 15:00 云端 GPU 选项 16:08 Token 与分词 18:20 Qwen3 与 Reasoning From Scratch 包 23:05 文本编码与解码 26:24 下载权重并选择设备 31:01 加载预训练 Qwen3 模型 34:32 大语言模型如何生成文本 36:47 输入张量与 batch 维度 41:48 推理模式下运行模型 44:11 Logits 与下一 token 预测 49:21 用 argmax 做贪心解码 52:28 构建流式文本生成器 01:01:28 生成文本并处理结束符 01:06:00 文本生成基准测试 01:14:34 KV 缓存原理 01:17:22 加入 KV 缓存并测量加速 01:24:31 用 torch.compile 做模型编译 01:30:33 编译与 KV 缓存结合 01:32:53 CPU 与 GPU 性能对比 01:35:32 回顾与下一步
打开原帖#511482
  1. 产品

    病历页变成入口:OpenAI 把 Epic 授权上下文接进 ChatGPT for Healthcare
  2. 研究

    安全剧本留给 Hugging Face,维基只配研究标签:OpenAI 的分类学就是政策
  3. 基础模型

    OpenAI:GPT-6 Astra 已向 Pro、Enterprise、Business Premium 与 API 开放