Anthropic 发布 Claude Sonnet 5,性能逼近 Opus 4.8
Anthropic 于 2026 年 6 月 30 日正式发布 Claude Sonnet 5,这是 Sonnet 系列迄今最 agentic 的模型。官方称其能自主制定计划、调用浏览器和终端等工具,独立完成多步骤任务,能力已接近更大更贵的 Opus 4.8。在 SWE-bench Pro 编程基准上,Sonnet 5 达到 63.2%,较 Sonnet 4.6(58.1%)明显提升,Opus 4.8 为 69.2%。在 Terminal-Bench 2.1、Humanity's Last Exam、OSWorld-Verified 等多个评测中,Sonnet 5 全面超越前代,并在知识工作基准 GDPval-AA v2 上以 1618 分首次反超 Opus 4.8(1615 分)。模型即日起在所有 Claude 计划上线,Free 和 Pro 用户默认使用,也面向 Max、Team、Enterprise 用户及 API 开放。API 定价执行至 2026 年 8 月 31 日的促销价:输入每百万 token 2 美元,输出每百万 token 10 美元;之后回调至 3 美元 / 15 美元。值得留意的是,Sonnet 5 采用了更新的分词器,同一输入可能产生 1.0–1.35 倍 token 数,官方称促销定价已基本抵消这一影响。安全方面,Anthropic 默认开启网络安全防护,模型在漏洞利用测试中未能生成完整 exploit,整体安全表现优于前代,但部分安全指标不及 Opus 4.8 和 Mythos 5。此次发布正值 Anthropic 筹备 IPO 之际,公司正加速中档模型的商业化落地。
①
性能:逼近旗舰,知识工作反超
Sonnet 5 在各主要基准上较 Sonnet 4.6 有明显提升,尤其在知识工作评估 GDPval-AA v2 上以 1618 分超越 Opus 4.8(1615 分)。在编程、多学科推理、计算机使用等多个维度上,该模型与 Opus 4.8 的差距显著缩小。
②
Agent 能力:自主规划、自检、工具使用
模型被描述为“最 agentic 的 Sonnet”,能制定计划、中途自检输出、调用浏览器和终端等工具完成多步骤任务。早期测试者反馈其在实际工作流中能端到端完成任务,无需人工干预。
③
定价与可及性:促销价两个月,注意 token 膨胀
API 促销价为输入 $2/M token、输出 $10/M token,截至 2026 年 8 月 31 日;此后调至 $3/$15。因新分词器可能增加 1.0–1.35 倍 token 消耗,实际单次任务成本或有上浮。模型同时在 Amazon Bedrock 和 Claude Platform on AWS 上线。