AI Infra 自学教材

第八篇 · 前沿专题

带着前七篇的地基,学会自己判断新论文

⏳ 本章待补充

这一章要回答的问题

带着前七篇的地基,怎么判断一篇新论文值不值得读?

这一章不打算给你一份"最新论文清单"——那会很快过时。它要给你的是六条演进链,每条的前半部分你已经在前面读过了,后半部分是"今天正在发生的事"。

六条演进链

专题从哪里来现在在哪
长上下文FlashAttention(第三篇)、Ring Attention(第四篇)Striped Attention、架构层面消除 KV Cache
MoE 系统GShard / Switch(第四篇)DeepSeek-V3 的节点受限路由与 FP8
后训练与 RLHF Infra第四篇 + 第五篇HybridFlow / verl:训练与推理模式反复切换
低精度训练推理侧量化(第五篇)FP8 训练的误差累积问题
扩散模型并行推理第三、四篇的分块与依赖处理DistriFusion:用历史结果填补时序依赖
KV Cache 为中心的架构PagedAttention、SGLang(第五篇)Mooncake:集群级分层 KV Cache 池

如何自己跟踪前沿(比读完任何清单都重要)

  1. 盯会议:MLSys、OSDI、SOSP、NSDI、ASPLOS、ISCA,以及 ICML / NeurIPS 的系统相关 track。
  2. 盯开源项目的 release note:vLLM、SGLang、DeepSpeed、Megatron-LM、TensorRT-LLM 的更新日志里,绝大多数新技术都能找到对应论文。
  3. 盯技术报告:各大模型的技术报告都有大段 Infra 章节,是工业界真实做法的第一手材料。
  4. 用前七篇的框架判断一篇新论文
    • 它属于哪一层?
    • 它优化的是哪个指标(吞吐 / 延迟 / 显存 / 通信 / 恢复时间)?
    • 它把什么换成了什么?代价是什么?
    • 它的假设在你的场景里成立吗?

能快速回答这四个问题,你就不再需要别人给你推荐论文了。这也是整套教材的最终目标。


← 返回 首页 | 上一章:第七篇 · 集群调度与容错

On this page