AI Infra 自学教材

MoE 推理优化综述

ACM Computing Surveys 2026 · 把 MoE 模型推理优化这个方向的技术梳理成一张地图

论文信息

内容
标题A Survey on Inference Optimization Techniques for Mixture of Experts Models
发表ACM Computing Surveys, Vol. 58, Issue 10, pp. 1–37(2026 年 3 月在线发表,2026 年 7 月印刷)
期刊等级中科院 计算机科学 大类 1 区 TOP;CCF A 类(交叉/综合);Impact Factor 30+
链接arXiv 免费全文DOI(出版版本)
规模8 位作者 / 242 篇参考文献
类型综述(Survey),不是研究论文——它不提出新方法,而是系统梳理整个方向
预计用时泛读通读约 3 小时;按专题精读建议分 3–4 次

⚠️ 一个容易误会的细节:arXiv 页面上仍显示 "Under Review",那是作者没有更新元数据。这篇已于 2026 年 3 月正式发表在 ACM Computing Surveys,DOI 是 10.1145/3794845


论文简介

MoE(混合专家)现在是前沿大模型的主流架构:它让参数量计算量解耦——总参数可以做到几百 B,但每个 token 只激活其中一小部分。

但这个好处是有代价的,而且代价几乎全部压在推理侧:

第一,专家要全部装得下。 激活参数少只省了计算,没有省显存——全部专家必须驻留,否则就得从更慢的存储里搬。云端是显存墙,手机上是容量墙。

第二,通信从"规约"变成"全交换"。 稠密模型用 all-reduce,MoE 要让 token 去找它被路由到的专家,于是变成 all-to-all。通信量和专家并行度直接挂钩,而专家并行度又不能无限放大。

第三,量化变难了。 稠密模型可以假设权重/激活的分布比较统一;MoE 里不同专家看到的 token 分布完全不同,异常值的位置和幅度都不一样。一套统一的量化缩放因子,要么溢出要么把精度削光。

第四,负载天然不均。 路由是按 token 决定的,热门专家会被挤爆、冷门专家空转,这正是训练时要用辅助损失去压制的那个问题——推理时它又回来了,而且直接影响延迟的长尾。

这篇综述做的,就是把散落在算法层、系统层、硬件层的这些解法收拢到一张地图上。242 篇参考文献意味着它的覆盖面相当全——这是它最大的价值,也是它最大的阅读障碍:细节多到读不完。


论文导读

为什么读它

如果你要做 MoE 相关的方向(压缩、端侧部署、推理加速),这是最省时间的入口。

理由很直接:这个方向的论文在 2024 年之后爆发式增长,逐篇读会淹没在细节里。一篇好综述能让你在 3 小时内知道"这个方向有哪几块、每块的难点是什么、代表性工作有哪些",之后再去读具体论文时,你知道它挂在哪个格子里、在跟谁竞争

240 多篇参考文献还有一个隐藏用法:它的参考文献列表本身就是一份经过筛选的必读清单

建议的读法

不要从第一节顺序读到最后一节。 综述的正确读法是"三遍法":

遍数读什么目标用时
第一遍摘要、引言、以及所有小节标题和架构图建立目录:这个方向分成几大块30 分钟
第二遍每小节的"问题定义"部分,跳过方法细节搞清每块在解决什么矛盾1 小时
第三遍只挑和你方向直接相关的 1–2 节精读拿到可用的技术细节1.5 小时

第一遍一定要做。 大多数人读综述失败的原因是:一上来就逐字读,读到第二节就累垮了,然后从此再没打开过。

读完要能回答

用这套问题自测。答不上来的,就是你需要回去补的格子:

  1. MoE 推理相比稠密模型,多出了哪几类开销?分别在什么阶段发生(prefill 还是 decode)?
  2. 同样是"延迟",MoE 的长尾问题和稠密模型有什么不同?
  3. 专家卸载(offloading)和专家量化,分别在解决哪个约束?两者的代价有什么不同?
  4. 为什么不同专家的激活分布差异会让常规量化方法失效?有哪些应对思路?
  5. 综述里提到的技术,哪些是算法层的、哪些是系统层的、哪些是硬件层的?同一层内的技术之间冲突吗?
  6. 综述最后一般会列"开放问题"。它列出的和你自己觉得没解决的,对得上吗?

💡 第 6 个问题最重要。如果你读完发现"它认为的开放问题"和你看到的不一样——那个差异就是你研究选题的起点

读的时候顺手做一件事

准备一个表格,边读边填:

技术层次(算法/系统/硬件)解决哪个约束代价转嫁到哪代表性工作

填满这张表,你就真正拥有这个方向的地图了——它比"读完了一篇综述"有价值得多


与本教材的对应

教材章节和这篇综述的关系
1.1 一次访存到底有多贵判断"某个 MoE 优化在省什么"的依据:算力受限还是带宽受限
1.2 存储层次与局部性专家卸载与缓存的全部理论基础——专家访问有没有局部性,直接决定卸载方案可不可行
1.3 Cache 是怎么工作的专家缓存就是一个缓存问题:容量、命中率、淘汰策略
第五篇 · 推理系统与 Serving本综述是这一章在 MoE 方向上的展开

读完之后

如果你读完想做 MoE 方向,建议接着读:

  • DeepSeekMoE(2024)—— 理解"细粒度专家 + 共享专家"这个架构基础,本综述里的很多技术都建立在它之上
  • DeepSeek-V3 技术报告(2024)—— 看工业界真实的 MoE 训练与推理工程细节
  • MobileMoE(2026)—— 端侧约束下重新设计 MoE 的缩放律

完整顺序见论文清单的模块 05

On this page