#AI
Fireworks 测出 DeepSeek V4.1 Flash 编码追平 Astra,成本差 15 倍
Fireworks AI 放出一组 DeepSeek-V4.1-Flash 的 Agent 编码评测。
DeepSWE 的 pass@1 上,DeepSeek-V4.1-Flash 拿 74.34%,GPT-6 Astra 74.12%,Gemini 3.8 Flash 73.83%,Claude Opus 5 73.65% —— 四个模型挤在 0.69 个百分点里,排名已经没有分辨意义。
💡 为什么值得看卖方自测的评测,数字好看但要打折看:编码同档、HLE 落后 15.88 个百分点。
查证
来源档案
CocoLoop(转述 Fireworks AI 技术博客)
中文科技聚合站的转述稿,逐项核对 Fireworks AI 技术博客原文后汇编,非一手发布
所有分数、成本、架构数字都标了出处是 Fireworks AI 自家博客。但 Fireworks 同时是 DeepSeek-V4.1-Flash 的售卖方,评测方与销售方同体;DeepSeek 官方未确认、无第三方复现。数字可当卖方的选型参考,不能当独立结论。
延伸阅读
同一篇里给了四家的单任务成本和 KV cache 用量对比,想看这个 15 倍站不站得住,得先看它的硬件假设。