探所 Curio 再探再报 了解探所 →
#AI

DeepSeek V4 Pro 正式版发布,Agent 评测登顶

DeepSeek 旗舰模型 V4 Pro 0813 于 2026 年 8 月 12 日以 GA 正式版发布,目前仅通过 API 提供,OpenRouter 已上线。模型为 1.6T 总参数、49B 激活的 MoE 架构,上下文窗口 100 万 token,最大输出 384K token。

Agent 能力是本次发布内核卖点。据 36 氪评测数据,V4 Pro 0813 在网络安全智能体测试 CyberGym 获 83.3 分,AutomationBench 获 31.8 分,均超过 Fable 5;软件工程智能体 DeepSWE 从预览版 12.8 分升至 62.7 分,超过 Opus 4.8 的 58.0 分。

💡 为什么值得看多项 Agent 评测超越 Fable 5 与 Opus 4.8,输出单价仅其 1/57,性能与价格双优。

关键评测得分速览

  • **CyberGym(网络安全 Agent)**:83.3 分,超过 Fable 5 的 83.1 分、Opus 4.8 的 78.3 分
  • **AutomationBench(自动化任务)**:31.8 分,超过 Fable 5 的 29.1 分、Opus 4.8 的 27.2 分
  • **Terminal-Bench 2.1**:87.9 分,仅落后 Fable 5 的 88.0 分 0.1 分
  • **DeepSWE(软件工程 Agent)**:62.7 分,此前预览版仅 12.8 分(约 4.9 倍涨幅)
  • **带工具「人类最后考试」**:60.0 分,反超 Opus 4.8 的 57.9 分

查证

来源与可信度

· V4 Pro 0813 已 GA 发布,价格及 1M 上下文获 OpenRouter 与 DeepSeek 官方文档双重确认。 [3]
· 官方定价为 $0.435 输入、$0.87 输出、$0.003625 缓存读取,与媒体报道口径一致 [3]
· 评测数据源自第三方社区,非 DeepSeek 官方发布,准确性存疑。 [2]
· 开源权重发布暂无官方消息,Simon Willison 依历史先例推断「大概率会」,属合理推测。 [1]

延伸阅读

只看一手试用 · simonwillison.net
原文含三档推理强度下图像风格对比图,直观展示模型多模态一致性变化,约 5 分钟。
中文读者 · 36kr.com
36 氪一文含 Grok 4.6 实测与价格对比,为理解前沿模型竞争格局最快中文入口,约 10 分钟。
要精确数据 · openrouter.ai
OpenRouter 模型页含延迟、吞吐、缓存命中率及工具调用错误率等实测指标,适合 API 接入开发者,约 15 分钟。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store