#AI
SemiAnalysis 拆解 MoE 推理的算力与数据搬运
SemiAnalysis 长文把 MoE 推理从服务整体拆到加速器节点与机架,主张 MoE 改变的是每个 token 激活哪些张量及其网络邻近要求。
它把推理分为 prefill、midfill、decode attention、decode experts 四种状态,四者对算力、内存、网络压力不同:prefill 算术强度高,midfill 更温和,后两者普遍偏低。文章认为把四者当同一种负载会丢掉 MoE 在算术强度与张量共享上的优势。
💡 为什么值得看MoE 各阶段负载不同,需分开调度。
查证
来源档案
SemiAnalysis
半导体与 AI 基础设施方向的付费订阅研究通讯,本条目为一个 newsletter 摘要页。
作者方长期做算力与推理架构的一手分析,框架可信;但本文是综述性质的概念梳理,文中给出的量化结论与数据集细节只在原文可见,摘要素材不覆盖这些数字。
延伸阅读
想评估自家推理栈的团队,可顺着 prefill / midfill / decode 的分野重新看调度与批处理策略。