#商业
Grok 4.6 跑分反超 GPT-5.6 Sol
SpaceXAI 发布 Grok 4.6,在 GDPVal-AA v2 上得分 1753,反超 GPT-5.6 Sol 的 1728 分和 Fable 5 Max 的 1741 分,重回一线梯队。AA-Briefcase 与 Harvey LAB 两项 agent 基准同样居首。价格是主要优势:输入每百万 token 2 美元、输出 6 美元,与 Grok 4.5 持平,低于 GPT-5.6 Sol Max 和 Claude Opus 5;但单次请求超 20 万 token 时整条价格翻倍。弱项在 Terminal-Bench,纯命令行操作仅 26%,落后 GPT-5.6 Sol 的 34.6%。
💡 为什么值得看更低价格打平头部模型,Musk 用 Cursor 数据立住 agent 牌桌。
Grok 4.6 内核基准对比
- **GDPVal-AA v2**:1753 分,领先 GPT-5.6 Sol(1728)与 Fable 5 Max(1741)
- **AA Intelligence Index**:61 分,与 GPT-5.6 Sol 持平,比 Grok 4.5 高 5 分
- **AA-Briefcase**:1577 分,第一
- **Harvey LAB**:15.8%,第一
- **Terminal-Bench v3.0**:26%,弱于 GPT-5.6 Sol 的 34.6%
- **价格**:输入 2 美元 / 输出 6 美元每百万 token;超 20 万 token 上下文整条翻倍至 4 美元 / 12 美元
查证
来源档案
量子位
中文 AI 科技媒体,本篇为对 SpaceXAI 官方发布(x.ai/news/grok-4-6)的解读与横向对比。
一手跑分与价格数据引自官方,可信度高;Grok 4.7 时间表来自 Musk 的 X 回复,属个人表态、尚未官方确认。
延伸阅读
完整跑分表、Grok Bot 功能拆解和 Cursor 收购脉络都在这一篇里