探所 Curio 再探再报 了解探所 →
🔭AI 日报 #AI · @wheam.me 培育 · 1 个来源

Anthropic 推出 Claude Sonnet 5,逼近旗舰

Anthropic 于 6 月 30 日正式发布 Claude Sonnet 5,取代 Sonnet 4.6 成为 Free 与 Pro 计划的默认模型,并同步上线 Claude Code、API 及 Managed Agents。Anthropic 称其为「最具 agent 能力的 Sonnet」,能自主制定计划、使用浏览器与终端工具,执行此前需要 Opus 级别大模型才能完成的任务。在 CursorBench 上,Sonnet 5 得分 57%(vs 4.6 的 49%);Cognition 的 FrontierCode Extended 测试中,它拿下 53.8%,超越 Opus 4.8。官方标准定价与上代持平($3/$15 每百万 token),但推出到 8 月底的促销价 $2/$10;然而第三方机构 Artificial Analysis 发现,由于生成 token 量更大,Sonnet 5 单任务实际成本可能高于 Opus 4.8,引发社区关于「命名与性价比」的争论。伴随 Sonnet 5 的发布,Anthropic 还推出了 Claude Desktop 的 Linux 测试版、Managed Agents 多项更新,并暗示此前因安全原因受限的 Fable 5 可能很快「再次开放」。关于 Fable 5 的具体开放时间和计费模式尚未得到官方确认。

It can make plans, use tools like browsers and terminals, and run autonomously at a level that, just a few months ago, required larger and more expensive models.
Anthropic 官方博客,《Introducing Claude Sonnet 5》
性能逼近 Opus 4.8
Sonnet 5 在人工智能分析综合指数中得分 53,比 Sonnet 4.6 提升 6 分,与 GPT‑5.5 高推理模式持平;CursorBench 57%(+8pp)、FrontierCode Extended 53.8%(超越 Opus 4.8)、Humanity’s Last Exam +10 分等多维度进步显著。
定价与成本效率争议
标价维持 $3/$15,促销 $2/$10,但实际任务成本因输出 token 量增加 40%(约 69k output tokens/任务)而比 Opus 4.8 贵约 15%;Simon Willison 指出新分词器让英文成本上浮约 1.4 倍。这令不少用户批评「代号 5 的名不副实」。
Fable 5 与平台升级
Anthropic 同时扩展了 Agent 工具链:Claude Desktop 登陆 Linux(不包含 Computer Use)、Managed Agents 新增流式会话增量与可观测面板;此前泄露的应用字符串显示 Fable 5 可能采用独立使用额度计费及身份验证,官方暂未披露具体开放时间。

来源

  1. [1] latent.space 7月2日
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store