Ember-1

发布时间 2026-09-28 3 天前
来源 Hacker首页帖子
字数 3,245 字
查看原文

AI智能总结

Fireworks Research 推出专用模型 Ember-1,基于 Kimi K3 构建,可在保持原有质量的前提下将 token 消耗减少 40%。该模型通过专门训练学会削减冗余推理,针对数学、编码、指令遵循、对话、搜索、工具使用及软件工程等任务进行优化,训练和评估在 Fireworks 无服务器训练平台上完成,未使用任何客户数据。

发布日期:2026/9/23

目录

Graph showing 40% fewer tokens than Kimi K3

Ember-1:减半的令牌,同样的答案

Ember-1 是 Fireworks Research 推出的全新专用模型,它在保持 Kimi K3 质量的同时,将令牌(token)消耗减少了 40%。Ember-1 基于 Kimi K3 构建,学会了削减不必要的推理过程,同时保留真正有价值的思考。我们在外部基准测试、真实客户 A/B 测试以及我们自己的编码和智能体(agent)工作负载上进行了验证,结果表明它在所有场景下都保持了原有质量。Ember-1 即日起可用,它开启了 Fireworks 持续推出专用模型的新篇章,方向由开发者下一步的需求决定。Ember 只是 Fireworks 训练(Fireworks Training)平台能够构建的众多模型中的开端。

Fireworks Research 如何构建 Ember-1

我们从用户那里了解到,他们需要以更低的成本获得 K3 的编码能力,因为其冗长的推理过程使得大规模自动化编码的成本十分高昂。调低 K3 的推理强度并不能解决这一问题——较低的强度设置会牺牲太多质量。要在保持质量的同时削减令牌,就必须让模型学会更高效地推理,而这意味着需要进行专门的训练。

为了达成这一目标,我们进行了深入的研究。团队开展了超过 50 次训练实验和 200 余次评估,并在过程中开发了新的训练算法,以在保证准确性的前提下缩短推理过程。所有这些工作都是在 Fireworks 无服务器训练(Serverless Training) 平台上完成的。我们无需自行配置或管理 GPU,因此只要有想法就能立即启动实验,只需为实际运行的资源付费,并以远低于通常的时间和成本从研究阶段推进到上线发布。

我们在多种任务上进行了训练,以确保节省的令牌能泛化到各种工作负载。训练使用的是我们自己的数据,没有使用任何客户数据。随后我们在统一的 Specialized Intelligence Index(专用智能指数)、公开基准以及真实生产流量上对 Ember-1 进行了评估,确认它在使用更少令牌的同时,质量没有任何下降。Ember-1 是 Fireworks 自主研发的模型,也是 Fireworks Research 系列模型的开山之作。

问题所在:思考模型过度思考

像 Kimi K3 这样的推理模型,其生成的大部分令牌——有时超过 90%——都花在了内部推理上,而非真正的答案。这种思考结构在单次请求上成本已经很高,而在多轮智能体工作负载中情况会更糟:每一轮都会将此前所有的推理重新送回模型,因此上下文长度会随着轮次增加而大致呈二次增长。早先轮次中冗长的推理会在后续每次调用时被重新读取(并重新计费)。

如此大量的推理真的有必要吗?我们的实验给出了否定的答案。Kimi K3 输出的推理远远超出任务所需,而多余的部分可以在不影响答案的前提下被去除。这正是我们创建 Ember-1 的方式——一个由专用智能打造的、更经济的 Kimi K3 版本。

从观察到精品模型

K3 的推理并非全部是浪费的。其中一部分属于自我反思:重新审视假设、回应反馈、或将结果追溯回先前的决策,这些都有助于模型从错误中恢复。关键在于保留这种能力,同时削减不必要的推理,并跳出低效的循环。我们相信,从任务和环境反馈中学习,可以教会模型更高效地推理,同时保持其原有能力。

对于智能体任务而言,这种学习贯穿整个交互过程。模型探索可能的动作、整合新的观察,并随着推进不断精炼自身的推理。反馈将决策与其后果关联起来,鼓励在整个任务中进行有意义的反思。

我们将这些洞见整合为一个训练集合,覆盖数学、编码、指令遵循、对话、搜索、工具使用以及软件工程等领域,既包含独立问题,也包含长程交互,以强化对观察与结果的适应性。任务反馈引导在策略(on-policy)的规划与学习,重点是在这一系列场景中保持模型能力。

公开基准和真实 A/B 测试的结果支持这一方向:在七个基准和两家客户的生产流量上,Kimi K3 的推理过程可以缩短 35%–50% 而不损失准确率。内化后的行为同样在失败的尝试上表现出克制的令牌使用,减少了漫长且低效的推理。

Specialized Intelligence Index:Ember-1 为 Bedside Bench 树立了新的帕累托前沿

本周早些时候,我们推出了 Specialized Intelligence Index(SII,专用智能指数),用于在由行业专家创建的、贴近真实世界任务的环境中,衡量开源、闭源与专用模型的水平。

我们在 Doximity 的 Bedside Bench 上评估了 Ember-1。该基准由医生验证,包含横跨 10 个专科类别的 500 个临床案例。

评估结果如何?Ember-1 在 Bedside Bench 上为开源与闭源模型——包括 GPT-5.6 Sol、GPT-6 Astra 以及 Claude Opus 5——在「每任务成本」维度上树立了新的帕累托前沿。

Figure of Cost/Task SII

Figure 2: Score vs. Duration Chart on Bedside Bench SII

在更多行业基准上评估帕累托前沿

我们还在其他一些行业基准上评估了 Ember-1 在「质量–成本」前沿上的表现。我们按照 Kimi K3 公开 API 的定价(未缓存输入 3 美元/百万令牌,缓存输入 0.30 美元/百万令牌,输出 15 美元/百万令牌)计算每个基准的成本,并将通过率与三组模型进行对比:低强度推理的 K3、高强度推理的 K3、最高(默认)强度推理的 K3 以及 Ember-1。在每一个样本量超过 50 的基准上,Ember-1 都处于或接近帕累托前沿——以极低的成本匹配 K3-max 的质量,并严格优于 K3-low。我们还分析了 GPT-6 Astra、Claude Opus-5 与 GLM 5.3,结果发现 Ember-1 在帕累托前沿上同样处于领先位置。

Figure 3: Average of 5 Industry Benchmarks on Open and Closed Model Cost/Task

我们进一步直接对比了 Ember-1 与原版 K3,结果如下:

N K3 Low K3 High K3 max Ember-1 Ember-1 vs. K3 Max
Terminal Bench 2.1 89 76.4% 77.6% 80.9% 82.0% -51.9% / -23.1 美元
SWE-bench Verified 500 80.4% 86.0% 93.2% 92.2% -15.5% / -68.1 美元
SWE-Interact 75 6.7% 13.3% 21.3% 20.0% -32.5% / -60.8 美元
DeepSWE 1.1 113 55.8% 62.8% 66.4% 75.2% -23.7% / -126.9 美元
τ-2 Bench Airline 50 64% 64% 64% 66% -5.9% / -0.3 美元

运行 K3 最具性价比的方式,已经不再是让它「少思考」,而是直接使用 Ember-1——一个学会了高效思考的模型。

客户验证:真实 A/B 测试

基准只能告诉你这么多。正如我们在 Specialized Intelligence Index 结果中所发现的,我们希望用更多真实工作负载、利用生产流量来测试模型。真正的考验往往是:模型在用户所依赖的产品、真实的生产流量中能否依然可靠。

我们在两家客户的真实生产编码工作负载上开展了 A/B 测试。在这两个案例中,Ember-1 都带来了令人印象深刻的令牌节省——在质量相当的前提下,每任务的令牌消耗减少了约 35%。绝大多数下游产品指标都得以保持甚至改善,包括任务完成率、成功分数以及失败率,都朝着正确的方向变化,同时令牌成本大幅下降。在 A/B 测试之后,其中一家客户已在线上生产环境中运行 Ember-1,并计划扩大规模以完全替代基础模型。

分数 步骤数 输出令牌 推理令牌削减 总令牌削减
Kimi K3 0.751 23.8 49.3K - -
Ember-1 0.753 21.4 29.9K 71.3% 39%

内部验证:我们的开发者毫无察觉

Fireworks 大量的内部编码与协作流量都由我们自己的推理服务驱动。在任何客户见到 Ember-1 之前,我们先让它在内部投入使用,让开发者将其用于日常编码工作,包括在真实任务上进行大规模「氛围测试(vibe testing)」。

我们最自豪的结果是:没有消息。 没消息就是好消息。开发者在毫无察觉的情况下继续完成他们的编码工作,同时消耗的令牌显著减少。对于一款核心价值主张就是「同样的答案,更少的令牌」的模型而言,在内部流量上完成一次「隐形上线」,就是最有力的信号。