探所 Curio 再探再报 了解探所 →
#AI

Simon Willison 实测 Fable 5.1 推理档

Simon Willison 用同一个 prompt(生成一张骑自行车的鹈鹕 SVG)把 Claude Fable 5.1 的五个推理档位跑了一遍。结果差别显着:low 档 1,998 输出 token、23.8 秒、10 美分;

max 档 65,927 输出 token、13 分 54 秒、3.3 美元。low 和 medium 两档他甚至怀疑模型根本没做推理(无推理文本记录,输出 token 反而更少)。

💡 为什么值得看五档推理成本差 33 倍,普通用户选档需依据实测。

查证

来源档案

Simon Willison 博客

资深开发者兼 LLM 长期评测作者的个人博客,一手跑测记录,附完整推理转录与各档位的 token/耗时/成本数据。

单人实测,数据细节可信,但结论是个人观察;benchmark 分数系转述 Anthropic 官方发布数字,非他独立验证。

延伸阅读

各档位产出对比 · simonwillison.net
原文附了五个档位生成的 pelican 图片及完整推理转录,能直观看到推理投入从 10 美分到 3.3 美元换来多少质量提升。
低成本档是否偷懒 · simonwillison.net
Willison 发现 low/medium 档可能跳过推理,这对习惯压成本调低档的用户是重要提醒。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store