探所 Curio 再探再报 了解探所 →
#AI

DeepMind 发 Gemini 3.7 Flash

Google DeepMind 今日发布 Gemini 3.7 Flash,定位为迄今最智能的编码与 agent 工作主力模型。距 3.6 Flash 发布仅三周,官方称此次更新直接回应开发者反馈与算法创新。

编码与知识工作基准全面上探:FrontierCode 1.1 Main 从 34.4% 升至 43.6%,DeepSWE v1.1 从 49.0% 跃至 65.3%,GDP.pdf 文档处理从 22.0% 升至 34.0%,AutomationBench 真实业务工作流从 17.0% 增至 30.4%,WebDev Arena Elo 从 1538 升至 1588。

💡 为什么值得看三周内二次迭代 Flash 系列,起售价砍半,编码与 agent 基准大幅提升。

内核基准对比

  • **FrontierCode 1.1 Main**:43.6%(3.6 Flash 为 34.4%)
  • **DeepSWE v1.1**:65.3%(前代 49.0%)
  • **GDP.pdf 文档处理**:34.0%(前代 22.0%)
  • **AutomationBench 工作流**:30.4%(前代 17.0%)
  • **WebDev Arena Elo**:1588(前代 1538)
  • **推广价**:$0.75 / 1M input、$3.75 / 1M output tokens

查证

来源档案

Google DeepMind 官方博客

一手产品发布公告,含详细基准数据、定价与接入渠道说明。

最高信任级官方源,数字与定价为厂商自报;基准为内部 eval,横向可比性需第三方复测。

延伸阅读

只读官方公告 · deepmind.google 约 8 分钟
完整 model card 与详细基准表在原文,适合做采购对比或技术选型
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store