#AI
DeepSeek 发 V4.1-Flash:KV cache 砍到四分之一
DeepSeek 发布 V4.1-Flash,一个面向 AI agent 的多模态模型。语言主干 552B 参数、支持 100 万 token 上下文,但每个 token 只激活 16B 参数(读入输入时 8B),模型文档以 MIT 许可放上 Hugging Face,API 定价与 V4-Flash 持平。
这次的重点不是跑分而是内存。据技术报告,快速 GPU 内存里的 KV cache 只需前代 V4-Flash 约四分之一空间,常驻 SSD / 主机内存的那部分降到约八分之一;相比 V1,单位 token 的全局 KV cache 缩小了 437 倍。做法包括把语言主干拆成 encoder / decoder 两半、KV cache 从 FP8 改存 FP4。
💡 为什么值得看552B 参数、单 token 只激活 16B,MIT 许可、API 与 V4-Flash 同价 —— 直接压低长上下文 agent 的部署成本。
查证
来源档案
The Decoder
聚焦 AI 的英文科技媒体,本篇为对 DeepSeek V4.1-Flash 技术报告的解读,含模型结构、基准与定价转述。
二手转述官方技术报告,数字与基准均来自 DeepSeek 自报,未见第三方独立复现;属单源二线媒体,结论应按「待官方与第三方确认」看待。
延伸阅读
encoder / decoder 拆分、FP4 存储 KV cache、永久 offload 到 SSD / 主机内存 —— 想理解长上下文 agent 成本结构的人值得细看这几项如何叠加出 437 倍压缩。