Claude Sonnet 5 按任务成本比 Opus 4.8 还贵 15%
Claude Sonnet 5 在 Artificial Analysis 智能指数评测中拿到 53 分,与 GPT-5.5(高推理档)并列第五,甚至在 AA-Briefcase 和 GDPval-AA 这类代理知识工作基准上跑赢了更贵的 Opus 4.8。但同款评测暴露了一个尖锐的成本问题:**Sonnet 5 单任务均价 $2.29,比 Opus 4.8 的 $1.97 高出约 15%,较前代 Sonnet 4.6(约 $1.20)近乎翻倍。** 涨价并非来自令牌单价——标价维持 $3/$15 每百万输入/输出令牌——而是模型完成任务时烧掉的令牌量激增,平均每个任务多输出约 40% 的令牌,代理循环次数是上代的约 3 倍。Anthropic 目前提供至 9 月 1 日的促销价 $2/$10,但 Artificial Analysis 的数据已按标准价计算,意味着促销期过后企业账单还会更难看。这不是偶然:此前 Opus 4.7 就因更换分词器致同一段文本多切出约 30% 令牌,实际费用隐性上涨 37% 以上,Anthropic 的“标价不涨、用量暗涨”套路从那时就已成型。
①
代理能力提升但推理短板仍在
Sonnet 5 比 Sonnet 4.6 提升 6 分,Terminal-Bench v2.1 上涨 9 点、Humanity's Last Exam 上涨 10 点、SciCode 上涨 7 点;但在 CritPt 前沿物理推理测试仅得 17%,落后于 GLM-5.2、Opus 系列、Fable 5 和 GPT-5.5 高配版,复杂推理任务仍然依赖更大模型。
②
成本结构驱动而非标价驱动
标价未变,但代理商行为(更多轮次、更长输出)使实际单任务令牌消耗急剧膨胀,Sonnet 5 在 GDPval-AA 上最高努力档的代理循环数约是最低档的 6 倍,这种“努力工作”的模式直接把有效成本推到了家族最高一档。
③
中国竞品的成本对照
文章指出 DeepSeek V4 Pro 和 GLM-5.2 在中端市场以远低价格提供竞争力性能,Anthropic 的隐性提价在中端区间更难向客户解释,对预算敏感的企业采购决策者构成压力。