#AI
Grok 4.5 发布,$2 定价直击对手,Opus 级性能下水
SpaceXAI 发布 Grok 4.5,系公司上市并收购 Cursor 后的首个模型,主打 coding、agent 和知识工作。官方定位为“最强模型”,在数万块 NVIDIA GB300 GPU 上训练,强化学习覆盖数十万任务,主要来自软件工程。
Musk 称其为“Opus-class”模型,比 Opus 4.8 更快、token 效率更高、更便宜。定价为输入 $2/百万 token,输出 $6/百万 token,远低于 Opus 4.8 的 $5/$25 和 GPT-5.5/5.6 的 $5/$30。完成同一 SWE 任务所需 token 数比 Opus 4.8 少 4.2 倍,任务级成本极低。
💡 为什么值得看xAI 上市后首秀,2/6 美元定价砍掉前沿模型成本一截,与 Cursor 整合,价格战打到新烈度。
定价与关键基准对比
**API 定价**
- Grok 4.5: $2/$6(输入/输出,每百万 token)
- Opus 4.8: $5/$25
- GPT-5.5/5.6: $5/$30
- Fable 5: $10/$50
**代码基准**
- **Terminal Bench 2.1**: Grok 4.5 83.3% vs Fable 5 84.3% vs GPT-5.5 83.4%
- **DeepSWE 1.1**: Grok 4.5 53% vs Fable 5 70% vs GPT-5.5 67%
- **SWE Bench Pro**: Grok 4.5 64.7% vs Fable 5 80.4% vs Opus 4.8 69.2%
Grok 4.5 的确没摘下性能桂冠,但它把前沿模型的“入场券价格”打到对手的几分之一,而且和 Cursor 编辑器是联合训练的,这对 Cursor 的用户是天然加成。
查证
来源与可信度
强
· SpaceXAI 官方博客与 Musk 推文确认,多家媒体印证,信息确凿。
[1]
强
· 定价对比与 token 效率(4.2x)经 The Decoder 基于官方数据核算,与官方披露一致。
[2]
弱
· 实际推理成本下的性能差距仍需用户自行验证,尤其在 SWE 长任务上落后较多。
[2]
孤证
· “与 Cursor 联合训练” 细节仅官方提及,未见第三方披露具体训练耦合方式。
[1]
延伸阅读
提供 Musk 原推、内部评估和上市背景,比单看官方博客更有叙事纵深
把 benchmark 差距和定价摆在一起,直观说明为何“差距可能不那么重要”