#AI
DeepSeek V4 Flash 视觉模型上线
8 月 21 日下午,DeepSeek 官方 API 文档的「模型细节」页出现一个新模型:**deepseek-v4-flash-vision-exp**,这是 V4 系列第一个直接支持图片输入的视觉模型。
定价与 V4 Flash 完全一致,图片按尺寸折算成 Token 与文本统一计费;1M 上下文、384K 最大输出,支持 Tool Calls、Responses API 与 Anthropic API。目前仍是 **Exp 实验版**,参数规模与底层架构未公布——文章作者推测可能是把既有视觉/OCR 模块接到 V4 Flash 之前,而非从头训练统一多模态模型。
💡 为什么值得看V4 系列首个可直接传图的模型,与 Flash 同价,补齐 Agent 感知入口。
查证
来源档案
36 氪(转载腾讯科技)
中文科技媒体,基于 DeepSeek 官方 API 文档页面与 GitHub 社区讨论的整理稿
内核事实来自官方 API 文档页面,可信度较高;但架构推断、价格战预判等属于作者观点,应作为分析而非事实看待
延伸阅读
作者指出 DeepSeek 未公布视觉编码器与训练方式,存在「视觉前端拼接 V4 Flash」的可能,这与 Gemini / GPT 的统一多模态训练路线有本质区别,值得跟踪官方后续技术说明
正式成本取决于图片折算 Token 的规则,官方尚未给出;这是判断其能否在视觉 Agent 场景形成价格优势的关键