探所 Curio 再探再报 了解探所 →
#AI

Fireworks 发布 Ember-1,推理 token 砍掉四成

Fireworks Research 发布 Ember-1 —— 一个基于 Kimi K3 训练出来的「省 token」版本。官方口径是:保住 K3 的回答质量,同时把 token 用量砍掉约 40%。做法不是把 K3 的推理档位调低(官方说自己测过,低档掉质量太狠),而是重新训练让它学会少想废话。

官方博客给出两组数字:在 7 个公开 benchmark 和 2 家客户的线上流量上,K3 的推理轨迹可缩短 35% 到 50% 而准确率不降;Ember-1 已作为 Research Preview 在 Fireworks Serverless 上架,先给两周访问期,再按社区需求决定是否转正式。**具体逐项 benchmark 与客户名单详见原文**,A/B 测试的客户身份官方未公开。

💡 为什么值得看Kimi K3 蒸馏版省 token,直击 agent 编程成本痛点。

查证

来源档案

Fireworks AI 官方博客

模型发布方的一手博客,含自家训练方法、benchmark 表格与客户 A/B 测试的自述结果。

一手官方发布,产品与上架信息可信;但所有效果数字均出自发布方自测自述,客户方未见独立确认,第三方复现前按官方口径看待。

延伸阅读

训练方法细节 · fireworks.ai 8 分钟
官方称跑了 50+ 训练实验、200+ 评估,并为此开发了新的训练算法,想看它怎幺定义「必要推理」可读原文。
HN 讨论 · fireworks.ai 10 分钟
270 分、150 条评论,HN 上对「省 token 是否等于省成本」和基准可比性通常有直接质疑。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 目前邀请测试中