探所 Curio 再探再报 了解探所 →
#AI

SemiAnalysis 实测:Engram 表格放 SSD 不划算

SemiAnalysis 发布 Engram 架构的软硬件协同分析,称该架构在 token embedding 之外加入**可学习的多 token 查表**,常用局部模式直接取回矢量,不再借 attention 与前馈层重建。

结果是**同质量模型所需的 HBM 容量下降** —— 不是 HBM 需求会消失,而是模型架构会持续绕开硬件约束做创新。对推理而言,瓶颈因此从容量转向带宽。

💡 为什么值得看同质模型 HBM 需求降,瓶颈由容量转带宽,SSD 卸载不敌 DRAM。

查证

来源档案

SemiAnalysis

半导体与 AI 算力领域的付费研究通讯,本篇为其 Engram 架构与 DRAM/SSD 卸载实验报告的公开部分

一手实测数据,含自有 InferenceX 基准与 vLLM fork 实验,方法与数字可复现性较高;但属于卖方研究性质的单一来源,数字未经第三方独立验证

延伸阅读

Engram 卸载的完整实验 · newsletter.semianalysis.com 20 分钟
报告后续会给出 DRAM 与 SSD 卸载的完整实验,以及 DeepSeek-V4.1-Flash 在 6 个 NVIDIA SKU 加 MI355X 上的 InferenceX 推理服务结果,对判断 HBM 容量与带宽谁更关键有用。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 目前邀请测试中