共 8 篇 · 已完成 1 篇 · 持续更新
AI Infra 自学教材
从「访存比计算贵」讲到训练与推理系统,按依赖顺序排好的一条主干路线。 先把每一层需要的直觉和判断依据讲清楚,再把你带到论文面前。
为什么要有这套教材
AI Infra 的新论文很多,但底层的判断依据其实很少。
如果先建立了判断依据,再去看新论文,会发现绝大多数工作只是同一套思想在不同场景下的变形; 反过来,如果直接从论文开始,就只能记住一堆名词。所以这套教材的组织原则是:先给判断依据,再给实现手段,最后才给前沿。
按依赖顺序,不跳章
八篇之间有硬依赖。后面每一篇讨论「优化了什么」时,用的都是第一篇建立的语言。章节目录的顺序就是阅读顺序。
先给判断依据,再给实现手段
不先讲 FlashAttention 怎么做,而是先讲清「这是算力受限还是带宽受限」。判断依据会了,新论文只是同一套思想的变形。
每一章都配动手实验
性能这件事,测过一次和读过十遍是两种理解。第一篇直接给了三个可运行的 C 程序,并逐行解释。
学习路径
顺序不能打乱——每一篇都建立在前一篇之上。先从 ✅ 的开始。
01性能与存储层次已完成访存的代价、局部性、Cache、优化方法论、CPU 到 GPU、动手实验02框架与自动微分待补充动态图与静态图、autodiff 的三种模式、显存里的激活值03GPU 与算子优化待补充FlashAttention、Triton、online softmax04训练系统与并行策略待补充GPipe、PipeDream、Megatron、ZeRO、FSDP05推理系统与 Serving待补充Orca、vLLM、量化、投机解码、PD 分离06编译器与图优化待补充TVM、MLIR、Ansor、TorchInductor07集群调度与容错待补充Ray、调度、checkpoint 与故障恢复08前沿专题待补充长上下文、MoE 系统、RLHF Infra、低精度
三块内容,互补使用
教材正文建立判断依据,讲清「为什么」。每节都带自测问题,每章都配动手实验。论文清单该读什么。25 篇 P0 必读 + 约 93 个条目,按模块组织,含 12 周计划。论文导读读到了什么。与教材独立的模块,每篇一页:论文简介、链接与完整导读。
正确的顺序是:先读完一篇教材正文,再去读那一篇对应的论文。反过来做,论文会变成名词记忆。
这套教材的定位
面向:会写模型、但系统与体系结构底子薄的人。
不假设:不需要 CUDA、体系结构或分布式系统的基础,也不需要会写 C 语言——动手实验提供可直接运行的完整代码并逐行解释。
不做的事:不复制任何教材或论文的原文。讲解、例子、图示、实验代码都是重新写的;经典教材与论文作为延伸阅读被引用,告诉你去读哪一章。