#AI
DeepSeek 发 V4.1-Flash:新架构 + 视觉,只挂 0.1 版本号
DeepSeek 在 2026 年 9 月 10 日放出 **DeepSeek-V4.1-Flash**,但这个名字严重低估了它做的事:这是一套全新的因果 Encoder-Decoder 架构、原生带视觉、100 万 token 上下文,按 8B 输入 + 16B 输出分离激活,稀疏度只有 1-2%。Sebastian Raschka 的原话是这「应该叫 DeepSeek V5」。
💡 为什么值得看KV cache 降到 1/4、Off-peak 输出 $0.60/M,便宜一个量级;但 9 月 14 日起 V4 Pro API 被强制切过去。
查证
来源与可信度
延伸阅读
这篇拆了 CSA2 的三层模式(Full / Reindex / Reuse)如何把 KV cache 从 V4-Flash 的约 3560 bytes/token 压到 890,以及 8x 只属于 SSD 持久化那一层、常规部署该看的是 HBM 侧 4x。要判断自己的长上下文 agent 工作负载能省多少,该从它的容量计算开始,而不是从营销口径开始。
同一篇汇总里保留了 Stochastic Chasm 关于「局部滑窗 + 稀疏检索混合正成为通用范式」、QAT for KV cache、以及视觉前端 3x3 pixel unshuffle 与 Kimi K3 差异的判断,还有 nrehiew 从技术报告里扒出的推理基建细节(长尾 stall、router replay、40+ 教师模型的 OPD)。想看这套设计到底新在哪,这些片段比基准表有用。
几个独立账号报告在消费级或准消费级硬件上跑全精度 V4.1 Flash:4 张 Max-Q 加 64GB 系统内存到 200 TPS、4 张 RTX Pro 到 300+ TPS 且系统内存峰值 <32GB、Antirez 在 128GB 的 M5 Max 上靠 SSD streaming 跑起来。均为个人自测,看趋势而非当基准。