Sebastian Raschka 发布了“从零构建推理模型”系列的第二期。本期先搭建推理方法所需的基础模型能力,重点拆解 LLM 文本生成流程、KV 缓存,以及它们与 torch.compile 组合时的性能表现。
这是 2026 年 8 月 30 日第一期视频的后续内容:上一期主要解释传统 LLM、推理模型与 Agent 的关系并准备 Python/PyTorch 环境;本期进入模型加载、逐 token 生成和推理加速,因此不是对已搬运内容的重复。
英文原帖关键句
In this video, I cover the text generation process in LLMs and KV caching.
中文翻译:本期视频讲解 LLM 的文本生成过程和 KV 缓存。
视频内容与时间点
- 00:00:介绍与推理模型演示
- 01:55:如何配合书籍学习
- 05:00:第 2 章概览
- 08:25:检查 PyTorch 与硬件支持
- 10:26:Apple Silicon 与 MPS 注意事项
- 15:00:云端 GPU 选择
- 16:08:token 与分词
- 18:20:Qwen3 及 Reasoning From Scratch 软件包
- 23:05:文本编码与解码
- 26:24:下载权重并选择运行设备
- 31:01:加载预训练 Qwen3 模型
- 34:32:LLM 如何生成文本
- 36:47:输入张量与 batch 维度
- 41:48:以推理模式运行模型
- 44:11:logits 与下一 token 预测
- 49:21:使用 argmax 进行贪心解码
- 52:28:构建流式文本生成器
- 01:01:28:生成文本并处理序列结束 token
- 01:06:00:文本生成基准测试
- 01:14:34:KV 缓存工作原理
- 01:17:22:加入 KV 缓存并测量加速效果
- 01:24:31:使用
torch.compile编译模型 - 01:30:33:组合模型编译与 KV 缓存
- 01:32:53:比较 CPU 与 GPU 性能
- 01:35:32:总结与后续内容
适用范围与验证方式
适合已经具备 Python、PyTorch 基础,并希望理解“预训练模型如何逐 token 生成文本”的读者。原作者使用 Qwen3 展示从权重加载到流式生成的过程,并通过运行时间对比验证 KV 缓存及模型编译的加速效果。
硬件方面,视频单独讨论了 Apple Silicon/MPS、云端 GPU、CPU 与 GPU 的差异。实际速度会受设备、PyTorch 版本、模型大小、上下文长度和编译开销影响;原帖没有给出可直接推广到所有硬件的统一加速倍数。
Codex 归纳:这期的工程价值在于把文本生成、KV 缓存和编译优化放进同一条可观察流程。先确认输出正确,再分别测量基础生成、加入缓存、加入编译后的耗时,能够避免只看最终速度却无法判断收益来自哪一步。
视频:https://www.youtube.com/watch?v=BJua0yjO5dk&feature=youtu.be
原作者:Sebastian Raschka(@rasbt),2026 年 9 月 6 日
原帖:Sebastian Raschka on X: "Reasoning from scratch round 2: In this video, I cover the text generation process in LLMs and KV caching (to prepare the base model before adding reasoning techniques in the upcoming ones). 00:00 Introduction and reasoning model demo 01:55 How to work through the book 05:… / X