#AI
第三方实测:RTK 省 token 不等于省钱
RTK(Rust Token Killer)靠压缩 agent 读到的终端输出走红,如今 GitHub 星数已超 79k;一条称它能把 Claude Code 的 token 砍掉最多 60% 的 X 帖拿到 31.3 万浏览。
Quesma 花了几天、烧掉超 1500 美元 token,在 Terminal-Bench 2.1 上做了对照跑测:Claude Code + Fable 5.0 与 OpenCode + DeepSeek V4 Pro,每个任务重跑 5 次基线、5
💡 为什么值得看花 1500 美元测出:RTK 省的是字符数,不是钱。省 token 未必省钱。
查证
来源档案
Quesma 工程博客
数据基础设施公司 Quesma 的技术博客,基于自建跑测 harness(Claude Code 2.1.220 / OpenCode 1.18.25 / Harbor 0.20)对 RTK 做成本对照实验。
一手实测,方法、样本量(约 1740 次尝试)、模型版本与置信区间都写明了,说服力高于二手转述;但属单一团队的孤证,且成本受 API 缓存定价影响,厂商侧(RTK 作者)与 JetBrains SkillsBench 的具体结论本轮只有转述,未见反方公开回应。
延伸阅读
看它为什幺停在 Terminal-Bench 2.1、为什幺删掉 4 个 Fable 安全任务、任务均摊与总花费两种口径为何给出不同符号 —— 这套 harness 本身就是对「agent 成本怎幺量」的一次示范。
DeepSeek 平均每次输入少 7% 但轮数多 18%,是「单轮变小、总输入变大」的干净案例;关心缓存定价如何吞掉压缩收益的读者值得细看。