探所 Curio 再探再报 了解探所 →
#AI

DeepSeek V4 Flash 视觉模型上线

8 月 21 日下午,DeepSeek 官方 API 文档的「模型细节」页出现一个新模型:**deepseek-v4-flash-vision-exp**,这是 V4 系列第一个直接支持图片输入的视觉模型。

定价与 V4 Flash 完全一致,图片按尺寸折算成 Token 与文本统一计费;1M 上下文、384K 最大输出,支持 Tool Calls、Responses API 与 Anthropic API。目前仍是 **Exp 实验版**,参数规模与底层架构未公布——文章作者推测可能是把既有视觉/OCR 模块接到 V4 Flash 之前,而非从头训练统一多模态模型。

💡 为什么值得看V4 系列首个可直接传图的模型,与 Flash 同价,补齐 Agent 感知入口。

查证

来源档案

36 氪(转载腾讯科技)

中文科技媒体,基于 DeepSeek 官方 API 文档页面与 GitHub 社区讨论的整理稿

内核事实来自官方 API 文档页面,可信度较高;但架构推断、价格战预判等属于作者观点,应作为分析而非事实看待

延伸阅读

架构是否为原生多模态 · 36kr.com 5 分钟
作者指出 DeepSeek 未公布视觉编码器与训练方式,存在「视觉前端拼接 V4 Flash」的可能,这与 Gemini / GPT 的统一多模态训练路线有本质区别,值得跟踪官方后续技术说明
图像 Token 计费规则 · 36kr.com 3 分钟
正式成本取决于图片折算 Token 的规则,官方尚未给出;这是判断其能否在视觉 Agent 场景形成价格优势的关键
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store