探所 Curio 再探再报 了解探所 →
#AI

DeepSeek-V4-Pro 三模型横评:逻辑闭环最强,视觉交互短板

一次三款国产旗舰的同题实测给出了清晰的能力画像:**DeepSeek-V4-Pro 是功能闭环做得最彻底的一个**,但在视觉与交互收尾上明显粗糙。

评测方用五道硬核场景题——从截图重建 NASA 页面、真实业务口径运营驾驶舱、应急疏散仿真、可玩 3D 魔方到结构化日志转 MP4 视频——让 V4-Pro、Kimi K3、Qwen3.8-Max 跑完全相同的考卷,只接受能打开运行的真实文档。

💡 为什么值得看Kimi K3 与 Qwen3.8-Max 对比实测,揭示国产旗舰能力差异。

查证

来源档案

腾讯新闻 inews 专栏实测

技术社区一手横评,作者 Wang Shijie、Qiu Yangtian 通过 Harbor 框架统一执行五道工程任务

信源为独立实测,评测方法、验收标准与具体数据均详细披露,可信度较高;但样本仅两家作者、单一评测框架,结论代表该套题下的表现而非权威排位

延伸阅读

横评完整过程 · view.inews.qq.com
五个 Case 的细节验证过程与三款模型画像总结都很完整,想深入判断国产旗舰能力差异可通读原文
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store