#AI
SemiAnalysis 拆解 GLM-5.3 稀疏注意力与 HBM 账
SemiAnalysis 拆解 GLM-5.3 的结论与直觉相反:稀疏注意力降低 KV cache 的内存与带宽需求,但不降低整体内存容量占用,因为 top-k 选择要求完整上下文驻留 HBM。
绕路方案是 SGLang 的 HiSparse:把 KV cache 从 HBM 卸到 host DRAM,按 LRU 在 top-k cache miss 时回填,并重叠第 N 层加载与第 N-1 层执行。文章还提到 GLM-5 系列为 744B 总参数、40B 激活的 MoE,每 token 路由 8/256 个专家,采用 DeepSeek Sparse Attention,GLM-5.2 起 IndexShare 让每 4 层共享一个 indexer。
💡 为什么值得看稀疏注意力省带宽而非容量,决定 agent 长上下文成本归属。
查证
来源档案
SemiAnalysis
半导体与 AI 基础设施方向的付费研究机构,文章由其 newsletter 发布,含 InferenceX 自建 benchmark 数据。
机构一手测算,稀疏注意力与 MLA 的机制解释可信度高;但 GB200 / GB300 / MI355X 的成本对比来自自家建模曲线而非同参数实测,且对 GLM-5 硬件优化目标的判断是作者推测。
延伸阅读
文章把「省带宽」与「省容量」分开算,并给出 HiSparse 的层级卸载设计,是理解长上下文推理成本结构的入口。
文中给出 MHA 显存开销高 42 倍、MQA 算力开销高 3.4 倍的具体权衡,以及 vLLM 按串行长度切换的配置区间。