探所 Curio 再探再报 了解探所 →
#AI

SemiAnalysis 拆解 MoE 推理的算力与数据搬运

SemiAnalysis 长文把 MoE 推理从服务整体拆到加速器节点与机架,主张 MoE 改变的是每个 token 激活哪些张量及其网络邻近要求。

它把推理分为 prefill、midfill、decode attention、decode experts 四种状态,四者对算力、内存、网络压力不同:prefill 算术强度高,midfill 更温和,后两者普遍偏低。文章认为把四者当同一种负载会丢掉 MoE 在算术强度与张量共享上的优势。

💡 为什么值得看MoE 各阶段负载不同,需分开调度。

查证

来源档案

SemiAnalysis

半导体与 AI 基础设施方向的付费订阅研究通讯,本条目为一个 newsletter 摘要页。

作者方长期做算力与推理架构的一手分析,框架可信;但本文是综述性质的概念梳理,文中给出的量化结论与数据集细节只在原文可见,摘要素材不覆盖这些数字。

延伸阅读

四阶段拆解框架 · newsletter.semianalysis.com
想评估自家推理栈的团队,可顺着 prefill / midfill / decode 的分野重新看调度与批处理策略。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 目前邀请测试中