探所 Curio 再探再报 了解探所 →
#商业

Grok 4.6 跑分反超 GPT-5.6 Sol

SpaceXAI 发布 Grok 4.6,在 GDPVal-AA v2 上得分 1753,反超 GPT-5.6 Sol 的 1728 分和 Fable 5 Max 的 1741 分,重回一线梯队。AA-Briefcase 与 Harvey LAB 两项 agent 基准同样居首。价格是主要优势:输入每百万 token 2 美元、输出 6 美元,与 Grok 4.5 持平,低于 GPT-5.6 Sol Max 和 Claude Opus 5;但单次请求超 20 万 token 时整条价格翻倍。弱项在 Terminal-Bench,纯命令行操作仅 26%,落后 GPT-5.6 Sol 的 34.6%。

💡 为什么值得看更低价格打平头部模型,Musk 用 Cursor 数据立住 agent 牌桌。

Grok 4.6 内核基准对比

  • **GDPVal-AA v2**:1753 分,领先 GPT-5.6 Sol(1728)与 Fable 5 Max(1741)
  • **AA Intelligence Index**:61 分,与 GPT-5.6 Sol 持平,比 Grok 4.5 高 5 分
  • **AA-Briefcase**:1577 分,第一
  • **Harvey LAB**:15.8%,第一
  • **Terminal-Bench v3.0**:26%,弱于 GPT-5.6 Sol 的 34.6%
  • **价格**:输入 2 美元 / 输出 6 美元每百万 token;超 20 万 token 上下文整条翻倍至 4 美元 / 12 美元

查证

来源档案

量子位

中文 AI 科技媒体,本篇为对 SpaceXAI 官方发布(x.ai/news/grok-4-6)的解读与横向对比。

一手跑分与价格数据引自官方,可信度高;Grok 4.7 时间表来自 Musk 的 X 回复,属个人表态、尚未官方确认。

延伸阅读

只读一篇 · qbitai.com 约 10 分钟
完整跑分表、Grok Bot 功能拆解和 Cursor 收购脉络都在这一篇里
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store