
Kolibri 正式发布:一款主权可控的开源权重模型
在德国统一日,我们正式发布全新模型:Kolibri。
Kolibri 是一款英德双语混合专家(Mixture-of-Experts)Transformer 模型,总参数 780 亿,激活参数 30 亿,支持最长 100 万 token 的上下文长度。模型权重已在 Hugging Face 上以 Apache 2.0 许可证完全开放下载。
Kolibri 是我们模型训练工作持续迭代的成果。我们首先搭建了一套模型训练流水线,并通过训练 Kolibri Origin——一款总参 300 亿、激活参 30 亿、上下文窗口仅 6.5 万 token 的模型——对流水线进行了验证。Kolibri 沿用了同一条流水线:从数据接入与清洗、消融实验、预训练、后训练,一直到最终评测。这套流水线让我们得以运行数百次消融实验,并实现稳定可靠的预训练,即使在硬件故障或数据连接中断时也无需人工介入。我们对训练指标进行了持续监控,并对自定义基准建立了标准化的观测体系。在流水线上投入的时间是极具价值的投资:Kolibri 在能力上大幅超越 Kolibri Origin,而两次发布之间的间隔却非常短。
Kolibri 是一款专为公共行政、工业制造、航空航天等受监管领域的主权关键任务而打造的专业语言模型。我们围绕德语、推理、数学、智能体行为以及客户在生产环境中所需的其他能力对 Kolibri 进行了专项优化,目的是在客户的特定用例上取得最佳表现。通过专项优化,客户可以在其 AI 业务中获得贴合具体场景的上下文相关性能,并能够量化其经济收益,使投入产出比(ROI)保持可衡量且持续增长。
仅有专项优化还不够,主权同样关键。对我们而言,主权包含两个维度:我们如何构建模型,以及模型如何交付给客户。我们提供完整的供应链可追溯性,对从数据接入、预训练、后训练到最终评测的每一个决策负责。我们保持充分透明。客户拥有完全的部署自由度和知识产权安全性,合规性成为模型与生俱来的属性。
完整细节请阅读我们的技术报告。
Kolibri 的能力
我们针对不同行业的特定领域语言、监管要求和业务流程,优化了 Kolibri 在广泛场景下的性能。其小巧高效的体积使客户能够灵活地在本地高效运行,无需将内部数据发送给第三方推理服务。本节重点展示模型的核心能力,更详细的介绍见 我们如何高速构建 Kolibri 一节。
面向企业与政府的基础能力
Kolibri 在模型能力与部署成本之间取得了最佳平衡:总参数 780 亿中激活参数仅 30 亿。在英语和德语场景下,Kolibri 都位于"质量—推理成本"帕累托前沿之上。帕累托前沿是经济学中的概念,指两个目标之间可实现的最优组合边界:在一条边界上,要改善其中一个目标就必须牺牲另一个目标。在被比较的所有模型中,没有一款能在相同推理成本下提供更高质量,也没有任何一款能在更低成本下提供同等质量。
平均基准得分 [%]
英语
德语
- Kolibri
- Kolibri Origin
- 其他经过后训练的模型
- 帕累托前沿
在数学、代码、事实约束(grounding)与长上下文任务上,Kolibri 的表现可媲美激活参数量最多四倍于它的模型,例如 Nemotron 3 Super。
- Kolibri
- Kolibri Origin
- Qwen3.6-35B-A3B
- Nemotron 3 Super 120B-A12B
- Mistral Small 4 119B-A6B
| 基准 | Kolibri | Kolibri Origin | Qwen3.6-35B-A3B | Nemotron 3 Super 120B-A12B | Mistral Small 4 119B-A6B |
|---|---|---|---|---|---|
| AIME 2025 | 96.9 | 81.9 | 84.6 | 91.7 | 79.8 |
| AIME 2025(德语) | 87.5 | 73.5 | 82.9 | 85.6 | 72.3 |
| AIME 2026 | 96.0 | 81.5 | 91.0 | 90.4 | 83.1 |
| AIME 2026(德语) | 90.0 | 75.2 | 84.4 | 87.5 | 78.5 |
| GPQA(diamond) | 84.3 | 68.1 | 83.4 | 78.0 | 74.7 |
| GPQA(diamond,德语) | 81.3 | 58.5 | 80.6 | 76.6 | 72.9 |
| AA-Omniscience Index | -32.8 | -64.0 | -15.3 | -36.5 | -24.0 |
| BrowseComp | 29.4 | 4.4 | 26.9 | 29.1 | – |
| τ³-bench banking | 38.1 | 5.7 | 10.6 | 15.5 | 5.7 |
| τ²-bench retail | 69.9 | 58.5 | 71.6 | 67.5 | 62.9 |
| τ²-bench airline | 76.7 | 58.7 | 70.7 | 72.7 | 40.0 |
| τ²-bench telecom | 94.7 | 67.5 | 99.1 | 68.1 | 41.5 |
| BFCL v4 overall | 61.4 | 36.4 | 67.2 | 61.0 | 58.0 |
| LiveCodeBench v6 | 85.9 | 59.2 | 82.5 | 82.0 | 71.2 |
| HumanEval+ | 92.7 | 76.8 | 92.8 | 94.7 | 92.8 |
| LongBench Pro | 64.5 | – | 70.8 | 62.9 | 56.4 |
| AA-LCR | 68.3 | – | 69.7 | 67.0 | 52.3 |
面向真实应用的场景化性能
公开基准无法覆盖特定行业的差异化需求,因此我们针对客户所在的关键垂直领域——例如德国公共部门、航空、制造和汽车工业——开发了自有内部评测体系。每一套评测都对应行业所需的技能、工作流程和边缘场景,并配有合成训练环境,使我们能够在不接触任何客户数据的前提下,针对这些评测持续改进 Kolibri。更多内容见 场景化性能 一节。
客户代理内部基准上的得分
- 汽车零部件供应商 0.72 → 0.99
- 半导体 0.35 → 0.80
- 德国公共部门 0.54 → 0.75
- 工业驱动技术 0.31 → 0.60
- 航空航天 0.14 → 0.59
- 一次检查点,一次评测
- 当日均值
- Kolibri Origin
- Kolibri
基于您自有文档的可靠回答。 我们使用"拒答"(abstention)数据并结合 Merlin-Arthur 协议训练 Kolibri,使其在上下文中找不到答案时学会主动回答"我不知道"。客户高度看重并明确要求这一能力,因此我们持续追踪并验证拒答准确率。更多细节见 事实约束(Grounding) 一节。
原生德语与英语模型。 我们开发了一套英德双语分词器,并在模型训练全过程中着力纳入原生的德语数据,使预训练 token 中德语占比达到 21.3%。我们仅少量使用翻译数据(整体占比 6%),因为翻译文本通常会保留源语言的文化烙印。最终得到的模型是真正意义上的双语模型,而非一个读过一点德语的英语模型。更多内容见 德语预训练数据 与 专用分词器 两节。
内建控制与合规:捍卫客户的主权
我们自始至终以欧盟《AI 法案》、通用人工智能行为准则 以及《通用数据保护条例》(GDPR)为准则构建 Kolibri,并将版权法作为打造可信赖技术的核心关注点。
我们在模型权重 与训练数据治理 上保持透明,让开发过程中的每一项决策都可被审视。借助其推理轨迹(reasoning traces),模型的可解释性得以体现:它能说明自身是如何得出某一特定答案的。通过 Merlin-Arthur 协议,模型在事实层面实现可信赖性:当上下文不足以支撑答案时,Kolibri 会主动拒答。
我们的团队在德国本土完成模型构建,在德国与芬兰的基础设施上完成训练,全程受欧洲及德国法律约束,不受任何外国控制。我们拥有从数据治理、预训练、后训练到模型工厂(Model Factory)优化的完整端到端流水线所有权。这种对端到端流水线的掌控,是模型主权的根基。同时,这种控制力也会一并传递给客户:Kolibri 体积小巧,使客户享有完全的部署自由度,并支持可调节的推理强度,以便在成本、延迟与答案质量之间灵活取舍。