MoE 推理优化综述
ACM Computing Surveys 2026 · 把 MoE 模型推理优化这个方向的技术梳理成一张地图
论文信息
| 项 | 内容 |
|---|---|
| 标题 | A Survey on Inference Optimization Techniques for Mixture of Experts Models |
| 发表 | ACM Computing Surveys, Vol. 58, Issue 10, pp. 1–37(2026 年 3 月在线发表,2026 年 7 月印刷) |
| 期刊等级 | 中科院 计算机科学 大类 1 区 TOP;CCF A 类(交叉/综合);Impact Factor 30+ |
| 链接 | arXiv 免费全文 | DOI(出版版本) |
| 规模 | 8 位作者 / 242 篇参考文献 |
| 类型 | 综述(Survey),不是研究论文——它不提出新方法,而是系统梳理整个方向 |
| 预计用时 | 泛读通读约 3 小时;按专题精读建议分 3–4 次 |
⚠️ 一个容易误会的细节:arXiv 页面上仍显示 "Under Review",那是作者没有更新元数据。这篇已于 2026 年 3 月正式发表在 ACM Computing Surveys,DOI 是
10.1145/3794845。
论文简介
MoE(混合专家)现在是前沿大模型的主流架构:它让参数量与计算量解耦——总参数可以做到几百 B,但每个 token 只激活其中一小部分。
但这个好处是有代价的,而且代价几乎全部压在推理侧:
第一,专家要全部装得下。 激活参数少只省了计算,没有省显存——全部专家必须驻留,否则就得从更慢的存储里搬。云端是显存墙,手机上是容量墙。
第二,通信从"规约"变成"全交换"。 稠密模型用 all-reduce,MoE 要让 token 去找它被路由到的专家,于是变成 all-to-all。通信量和专家并行度直接挂钩,而专家并行度又不能无限放大。
第三,量化变难了。 稠密模型可以假设权重/激活的分布比较统一;MoE 里不同专家看到的 token 分布完全不同,异常值的位置和幅度都不一样。一套统一的量化缩放因子,要么溢出要么把精度削光。
第四,负载天然不均。 路由是按 token 决定的,热门专家会被挤爆、冷门专家空转,这正是训练时要用辅助损失去压制的那个问题——推理时它又回来了,而且直接影响延迟的长尾。
这篇综述做的,就是把散落在算法层、系统层、硬件层的这些解法收拢到一张地图上。242 篇参考文献意味着它的覆盖面相当全——这是它最大的价值,也是它最大的阅读障碍:细节多到读不完。
论文导读
为什么读它
如果你要做 MoE 相关的方向(压缩、端侧部署、推理加速),这是最省时间的入口。
理由很直接:这个方向的论文在 2024 年之后爆发式增长,逐篇读会淹没在细节里。一篇好综述能让你在 3 小时内知道"这个方向有哪几块、每块的难点是什么、代表性工作有哪些",之后再去读具体论文时,你知道它挂在哪个格子里、在跟谁竞争。
240 多篇参考文献还有一个隐藏用法:它的参考文献列表本身就是一份经过筛选的必读清单。
建议的读法
不要从第一节顺序读到最后一节。 综述的正确读法是"三遍法":
| 遍数 | 读什么 | 目标 | 用时 |
|---|---|---|---|
| 第一遍 | 摘要、引言、以及所有小节标题和架构图 | 建立目录:这个方向分成几大块 | 30 分钟 |
| 第二遍 | 每小节的"问题定义"部分,跳过方法细节 | 搞清每块在解决什么矛盾 | 1 小时 |
| 第三遍 | 只挑和你方向直接相关的 1–2 节精读 | 拿到可用的技术细节 | 1.5 小时 |
第一遍一定要做。 大多数人读综述失败的原因是:一上来就逐字读,读到第二节就累垮了,然后从此再没打开过。
读完要能回答
用这套问题自测。答不上来的,就是你需要回去补的格子:
- MoE 推理相比稠密模型,多出了哪几类开销?分别在什么阶段发生(prefill 还是 decode)?
- 同样是"延迟",MoE 的长尾问题和稠密模型有什么不同?
- 专家卸载(offloading)和专家量化,分别在解决哪个约束?两者的代价有什么不同?
- 为什么不同专家的激活分布差异会让常规量化方法失效?有哪些应对思路?
- 综述里提到的技术,哪些是算法层的、哪些是系统层的、哪些是硬件层的?同一层内的技术之间冲突吗?
- 综述最后一般会列"开放问题"。它列出的和你自己觉得没解决的,对得上吗?
💡 第 6 个问题最重要。如果你读完发现"它认为的开放问题"和你看到的不一样——那个差异就是你研究选题的起点。
读的时候顺手做一件事
准备一个表格,边读边填:
| 技术 | 层次(算法/系统/硬件) | 解决哪个约束 | 代价转嫁到哪 | 代表性工作 |
|---|
填满这张表,你就真正拥有这个方向的地图了——它比"读完了一篇综述"有价值得多。
与本教材的对应
| 教材章节 | 和这篇综述的关系 |
|---|---|
| 1.1 一次访存到底有多贵 | 判断"某个 MoE 优化在省什么"的依据:算力受限还是带宽受限 |
| 1.2 存储层次与局部性 | 专家卸载与缓存的全部理论基础——专家访问有没有局部性,直接决定卸载方案可不可行 |
| 1.3 Cache 是怎么工作的 | 专家缓存就是一个缓存问题:容量、命中率、淘汰策略 |
| 第五篇 · 推理系统与 Serving | 本综述是这一章在 MoE 方向上的展开 |
读完之后
如果你读完想做 MoE 方向,建议接着读:
- DeepSeekMoE(2024)—— 理解"细粒度专家 + 共享专家"这个架构基础,本综述里的很多技术都建立在它之上
- DeepSeek-V3 技术报告(2024)—— 看工业界真实的 MoE 训练与推理工程细节
- MobileMoE(2026)—— 端侧约束下重新设计 MoE 的缩放律
完整顺序见论文清单的模块 05。