#AI
Fireworks 发布 Ember-1,推理 token 砍掉四成
Fireworks Research 发布 Ember-1 —— 一个基于 Kimi K3 训练出来的「省 token」版本。官方口径是:保住 K3 的回答质量,同时把 token 用量砍掉约 40%。做法不是把 K3 的推理档位调低(官方说自己测过,低档掉质量太狠),而是重新训练让它学会少想废话。
官方博客给出两组数字:在 7 个公开 benchmark 和 2 家客户的线上流量上,K3 的推理轨迹可缩短 35% 到 50% 而准确率不降;Ember-1 已作为 Research Preview 在 Fireworks Serverless 上架,先给两周访问期,再按社区需求决定是否转正式。**具体逐项 benchmark 与客户名单详见原文**,A/B 测试的客户身份官方未公开。
💡 为什么值得看Kimi K3 蒸馏版省 token,直击 agent 编程成本痛点。
查证
来源档案
Fireworks AI 官方博客
模型发布方的一手博客,含自家训练方法、benchmark 表格与客户 A/B 测试的自述结果。
一手官方发布,产品与上架信息可信;但所有效果数字均出自发布方自测自述,客户方未见独立确认,第三方复现前按官方口径看待。
延伸阅读
官方称跑了 50+ 训练实验、200+ 评估,并为此开发了新的训练算法,想看它怎幺定义「必要推理」可读原文。
270 分、150 条评论,HN 上对「省 token 是否等于省成本」和基准可比性通常有直接质疑。