#AI
DeepSeek 发 V4.1-Flash,KV cache 显存压到四分之一
DeepSeek 发布多模态模型 **V4.1-Flash**,语言主干 552B 参数、单 token 只激活 16B,上下文上限 100 万 token。
据其技术报告,最大改进在显存:GPU 内的 KV cache 占用降到前代 V4-Flash 的约四分之一,常驻 SSD 或主机内存的那部分降到约八分之一;相对 V1,每 token 的全局 KV cache 规模缩小了 437 倍。
💡 为什么值得看长上下文 agent 成本瓶颈在显存,DeepSeek 意在压低部署成本。
查证
来源档案
The Decoder
英文 AI 行业媒体,此文为 DeepSeek 技术报告的转述与整理,非一手发布。
转述了 552B / 16B / 100 万 token / KV cache 四分之一等具体数字与 benchmark 名次,量级与口径需以 DeepSeek 官方技术报告原文为准;单源,不构成独立验证。
延伸阅读
编码器 / 解码器拆分与 FP4 存储是这次降本的两根支柱,想判断能否复用到其他 agent 栈的读者应看报告原文的这部分。