Fireworks Research 发布专用模型 Ember-1,基于 Kimi K3 训练而成,公开基准与两家客户线上 A/B 测试显示推理 token 可减少 35%~50%,质量不打折扣。
Fireworks Research 9 月发布专用模型 Ember-1,基于 Kimi K3 训练而成,主打"同样的答案,更少的 token"——在公开基准与两家客户的线上 A/B 测试中,推理 token 可减少 35%~50%,质量基本不受影响。
Fireworks 称,用户需要 Kimi K3 的编程能力,但它冗长的推理轨迹让大规模自动化编程变得昂贵。直接调低 K3 的推理强度(reasoning effort)没能解决问题,效果和质量跟着下降。推理模型的通病是把大部分生成 token(Fireworks 称"有时超过 90%")花在内部推理而非最终答案上,多轮 Agent 场景更糟:每一轮都要把此前全部推理重新喂给模型,上下文随轮次大致呈平方级增长,早期推理会在后续调用里被反复重读、重复计费。
要保住质量又省 token,只能重新训练模型学会"更高效地想"。Fireworks 团队为此跑了 50 多次训练实验、200 多次评测,在自家 Serverless Training 平台上完成,无需自己置备 GPU;训练数据覆盖数学、编程、指令遵循、对话、搜索、工具调用与软件工程,全部用自有数据,不含客户数据。
测试显示,Kimi K3 的推理长度可在不牺牲准确率的前提下缩短 35%~50%。在 Doximity 面向医生、涵盖 10 个专科的 500 个临床病例基准 Bedside Bench 上,Ember-1 拿下新的成本/质量帕累托前沿,横向对比包括 GPT-5.6 Sol、GPT-6 Astra 与 Claude Opus 5。

图:横轴为每任务成本(美元),纵轴为得分,标出 Ember-1 与 Kimi K3、Claude Opus 5、GPT-6 Astra 等模型的位置。来源:fireworks.ai
按 Kimi K3 官方 API 价格折算,Ember-1 在样本量超过 50 的每个基准上都位于或接近帕累托前沿,质量追平 K3 满推理强度档位。两家客户线上 A/B 测试显示,Ember-1 平均节省约 35% 的 token,完成率、成功率等指标同步持平或改善,其中一家已把它用于生产环境,计划全面替换基础模型。Fireworks 内部编程流量也已切到 Ember-1,团队称"没有动静就是最好的消息"——开发者没察觉切换,token 消耗却明显下降。
Ember-1 以"Research Preview"形式上线 Serverless,两周免费试用、视社区需求决定是否转正;Fireworks 同时开放了基于 Ember-1 的定制训练服务,供企业用自有数据训练专属省 token 版本,团队表示后续还会有更多针对推理效率的专用模型发布。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断