第八篇 · 前沿专题
带着前七篇的地基,学会自己判断新论文
⏳ 本章待补充
这一章要回答的问题
带着前七篇的地基,怎么判断一篇新论文值不值得读?
这一章不打算给你一份"最新论文清单"——那会很快过时。它要给你的是六条演进链,每条的前半部分你已经在前面读过了,后半部分是"今天正在发生的事"。
六条演进链
| 专题 | 从哪里来 | 现在在哪 |
|---|---|---|
| 长上下文 | FlashAttention(第三篇)、Ring Attention(第四篇) | Striped Attention、架构层面消除 KV Cache |
| MoE 系统 | GShard / Switch(第四篇) | DeepSeek-V3 的节点受限路由与 FP8 |
| 后训练与 RLHF Infra | 第四篇 + 第五篇 | HybridFlow / verl:训练与推理模式反复切换 |
| 低精度训练 | 推理侧量化(第五篇) | FP8 训练的误差累积问题 |
| 扩散模型并行推理 | 第三、四篇的分块与依赖处理 | DistriFusion:用历史结果填补时序依赖 |
| KV Cache 为中心的架构 | PagedAttention、SGLang(第五篇) | Mooncake:集群级分层 KV Cache 池 |
如何自己跟踪前沿(比读完任何清单都重要)
- 盯会议:MLSys、OSDI、SOSP、NSDI、ASPLOS、ISCA,以及 ICML / NeurIPS 的系统相关 track。
- 盯开源项目的 release note:vLLM、SGLang、DeepSpeed、Megatron-LM、TensorRT-LLM 的更新日志里,绝大多数新技术都能找到对应论文。
- 盯技术报告:各大模型的技术报告都有大段 Infra 章节,是工业界真实做法的第一手材料。
- 用前七篇的框架判断一篇新论文:
- 它属于哪一层?
- 它优化的是哪个指标(吞吐 / 延迟 / 显存 / 通信 / 恢复时间)?
- 它把什么换成了什么?代价是什么?
- 它的假设在你的场景里成立吗?
能快速回答这四个问题,你就不再需要别人给你推荐论文了。这也是整套教材的最终目标。
← 返回 首页 | 上一章:第七篇 · 集群调度与容错