Claude Sonnet 5 发布:性能逼近 Opus,但新分词器实际涨价 30%
[🔁 续报] 经过数周预热,Anthropic 于 6 月 30 日正式发布 Claude Sonnet 5,并立即成为 Free 和 Pro 套餐默认模型。官方将 Sonnet 5 定位为“最具代理能力的 Sonnet”,性能接近旗舰 Opus 4.8,但价格更低——标牌价格与 Sonnet 4.6 持平($3/$15 每百万 token,9 月前推广价 $2/$10)。 然而,Simon Willison 实测发现,Sonnet 5 启用了新 tokenizer,导致同样文本生成的 token 数比 Sonnet 4.6 多约 30%(英文约 1.4 倍,Python 代码约 1.27 倍)。这意味着尽管单价未变,实际 API 调用成本上涨约 30%,并非官方宣称的“成本中性”。从代理编码基准看,Sonnet 5 在 SWE-bench Verified 上达 63.2%,较前代大幅提升;Anthropic 称其能自主完成复杂 PR、调试并修复根因,早鸟用户反馈“在不被要求时会自行验证输出”。
💡 为什么值得看看似同价升级,实则新 tokenizer 让输入成本增约 30%,开发者需立刻重估 API 预算。
Sonnet 5 的发布标志 Agentic 能力正式成为中端模型标配——与 OpenAI GPT-5.6 Sol、Google Gemini 3.5 Flash 的叙事一致。Anthropic 借 Sonnet 5 将代理性能从旗舰 Opus 下放至更具性价比的层级,直接冲击 GPT-5.5 与 Gemini 3.1 Pro 的市场定价。但 tokenizer 变更带来的隐性成本上涨将考验开发者接受度,尤其是预算敏感的中小团队。Simon Willison 用 Claude Token Counter 测得多语种文档 token 膨胀比:中文简化体几乎无影响(1.01x),英文 1.42x,西班牙语 1.33x——提示中文开发者可能成为少数不受涨价影响的群体。Anthropic 在发布后火速更正了 BrowseComp 评测图(原版因方法学错误低估了 Sonnet 5 性能),显示对评测精准度的高度敏感。