探所 Curio 再探再报 了解探所 →
#AI

DeepSeek 上线 V4 Flash Vision 视觉模型

2026 年 8 月 21 日,DeepSeek 上线了 **DeepSeek V4 Flash Vision Exp**,官方称其为多模态视觉理解模型。与 V4 Flash、V4 Pro 不同,这个模型**没有技术报告、也不开源**,官方只给出一张性能表和几个演示案例。

反常之处在于,官方公布的测评几乎都是 Agent 基准——Terminal Bench 2.1 得 83.9、DeepSWE 得 59.3,而不是视觉模型圈惯用的 MMMU、MathVista 那套「看图答题」考卷。文章据此判断,DeepSeek 的策略仍是把多模态当作 Agent 与推理主线的「插件」,让模型看懂网页截图、图表和 UI,再继续把任务做下去。

💡 为什么值得看多模态模型不开源,只摆基准,社区实测识别短板,反常抢跑发布。

查证

来源档案

36 氪(转自字母 AI)

科技媒体转发的行业解读文章,作者对 DeepSeek 产品节奏与社区反馈做了较细的梳理,属二手分析而非官方口径

模型发布时间、无报告未开源、Agent 基准分数等可交叉核验的事实可信;但其对梁文锋战略意图的解读属作者推断,官方并未表态。

延伸阅读

视觉原语机制 · 36kr.com
文章回溯了 DeepSeek 被删除的《Thinking with Visual Primitives》论文,解释「边推理边指向」的坐标锚定设计,想理解 V4 Flash Vision 底层逻辑的读者可细读。
DSH 与 Codex 对比 · 36kr.com
文章将 DSH 的「伪视觉/原生直通」两条路径与 OpenAI 开源的 Codex Harness 原生视觉闭环对比,能看到多模态在 Agent 运行时定位上的产品差距。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store