探所 Curio 再探再报 了解探所 →
#AI

第三方实测:RTK 省 token 不等于省钱

RTK(Rust Token Killer)靠压缩 agent 读到的终端输出走红,如今 GitHub 星数已超 79k;一条称它能把 Claude Code 的 token 砍掉最多 60% 的 X 帖拿到 31.3 万浏览。

Quesma 花了几天、烧掉超 1500 美元 token,在 Terminal-Bench 2.1 上做了对照跑测:Claude Code + Fable 5.0 与 OpenCode + DeepSeek V4 Pro,每个任务重跑 5 次基线、5

💡 为什么值得看花 1500 美元测出:RTK 省的是字符数,不是钱。省 token 未必省钱。

查证

来源档案

Quesma 工程博客

数据基础设施公司 Quesma 的技术博客,基于自建跑测 harness(Claude Code 2.1.220 / OpenCode 1.18.25 / Harbor 0.20)对 RTK 做成本对照实验。

一手实测,方法、样本量(约 1740 次尝试)、模型版本与置信区间都写明了,说服力高于二手转述;但属单一团队的孤证,且成本受 API 缓存定价影响,厂商侧(RTK 作者)与 JetBrains SkillsBench 的具体结论本轮只有转述,未见反方公开回应。

延伸阅读

跑测方法是否站得住 · quesma.com 15 分钟
看它为什幺停在 Terminal-Bench 2.1、为什幺删掉 4 个 Fable 安全任务、任务均摊与总花费两种口径为何给出不同符号 —— 这套 harness 本身就是对「agent 成本怎幺量」的一次示范。
tokenflation 的量化样本 · quesma.com 10 分钟
DeepSeek 平均每次输入少 7% 但轮数多 18%,是「单轮变小、总输入变大」的干净案例;关心缓存定价如何吞掉压缩收益的读者值得细看。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store