探所 Curio 再探再报 了解探所 →
#AI

Fireworks 测出 DeepSeek V4.1 Flash 编码追平 Astra,成本差 15 倍

Fireworks AI 放出一组 DeepSeek-V4.1-Flash 的 Agent 编码评测。

DeepSWE 的 pass@1 上,DeepSeek-V4.1-Flash 拿 74.34%,GPT-6 Astra 74.12%,Gemini 3.8 Flash 73.83%,Claude Opus 5 73.65% —— 四个模型挤在 0.69 个百分点里,排名已经没有分辨意义。

💡 为什么值得看卖方自测的评测,数字好看但要打折看:编码同档、HLE 落后 15.88 个百分点。

查证

来源档案

CocoLoop(转述 Fireworks AI 技术博客)

中文科技聚合站的转述稿,逐项核对 Fireworks AI 技术博客原文后汇编,非一手发布

所有分数、成本、架构数字都标了出处是 Fireworks AI 自家博客。但 Fireworks 同时是 DeepSeek-V4.1-Flash 的售卖方,评测方与销售方同体;DeepSeek 官方未确认、无第三方复现。数字可当卖方的选型参考,不能当独立结论。

延伸阅读

成本倍数怎幺算出来的 · news.cocoloop.cn 5 分钟
同一篇里给了四家的单任务成本和 KV cache 用量对比,想看这个 15 倍站不站得住,得先看它的硬件假设。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 目前邀请测试中