#AI
SemiAnalysis 实测:Engram 表格放 SSD 不划算
SemiAnalysis 发布 Engram 架构的软硬件协同分析,称该架构在 token embedding 之外加入**可学习的多 token 查表**,常用局部模式直接取回矢量,不再借 attention 与前馈层重建。
结果是**同质量模型所需的 HBM 容量下降** —— 不是 HBM 需求会消失,而是模型架构会持续绕开硬件约束做创新。对推理而言,瓶颈因此从容量转向带宽。
💡 为什么值得看同质模型 HBM 需求降,瓶颈由容量转带宽,SSD 卸载不敌 DRAM。
查证
来源档案
SemiAnalysis
半导体与 AI 算力领域的付费研究通讯,本篇为其 Engram 架构与 DRAM/SSD 卸载实验报告的公开部分
一手实测数据,含自有 InferenceX 基准与 vLLM fork 实验,方法与数字可复现性较高;但属于卖方研究性质的单一来源,数字未经第三方独立验证
延伸阅读
报告后续会给出 DRAM 与 SSD 卸载的完整实验,以及 DeepSeek-V4.1-Flash 在 6 个 NVIDIA SKU 加 MI355X 上的 InferenceX 推理服务结果,对判断 HBM 容量与带宽谁更关键有用。