Aleph Alpha 发布 Kolibri:主权开源大模型

发布时间 2026-10-03 1 天前
来源 Hacker首页帖子
字数 3,038 字
查看原文

智能总结

德国 AI 公司 Aleph Alpha 在德国统一日正式发布主权开源大模型 Kolibri,采用英德双语混合专家(MoE)Transformer 架构,总参数 780 亿、激活参数 30 亿,支持最长 100 万 token 上下文,权重以 Apache 2.0 许可证在 Hugging Face 完全开放。

Green gradient with the white Kolibri hummingbird logo and wordmark in the centre, framed by thin stepped outlines on the left and right

Kolibri 正式发布:一款主权可控的开源权重模型

在德国统一日,我们正式发布全新模型:Kolibri。

Kolibri 是一款英德双语混合专家(Mixture-of-Experts)Transformer 模型,总参数 780 亿,激活参数 30 亿,支持最长 100 万 token 的上下文长度。模型权重已在 Hugging Face 上以 Apache 2.0 许可证完全开放下载。

Kolibri 是我们模型训练工作持续迭代的成果。我们首先搭建了一套模型训练流水线,并通过训练 Kolibri Origin——一款总参 300 亿、激活参 30 亿、上下文窗口仅 6.5 万 token 的模型——对流水线进行了验证。Kolibri 沿用了同一条流水线:从数据接入与清洗、消融实验、预训练、后训练,一直到最终评测。这套流水线让我们得以运行数百次消融实验,并实现稳定可靠的预训练,即使在硬件故障或数据连接中断时也无需人工介入。我们对训练指标进行了持续监控,并对自定义基准建立了标准化的观测体系。在流水线上投入的时间是极具价值的投资:Kolibri 在能力上大幅超越 Kolibri Origin,而两次发布之间的间隔却非常短。

Kolibri 是一款专为公共行政、工业制造、航空航天等受监管领域的主权关键任务而打造的专业语言模型。我们围绕德语、推理、数学、智能体行为以及客户在生产环境中所需的其他能力对 Kolibri 进行了专项优化,目的是在客户的特定用例上取得最佳表现。通过专项优化,客户可以在其 AI 业务中获得贴合具体场景的上下文相关性能,并能够量化其经济收益,使投入产出比(ROI)保持可衡量且持续增长。

仅有专项优化还不够,主权同样关键。对我们而言,主权包含两个维度:我们如何构建模型,以及模型如何交付给客户。我们提供完整的供应链可追溯性,对从数据接入、预训练、后训练到最终评测的每一个决策负责。我们保持充分透明。客户拥有完全的部署自由度和知识产权安全性,合规性成为模型与生俱来的属性。

完整细节请阅读我们的技术报告。

Kolibri 的能力

我们针对不同行业的特定领域语言、监管要求和业务流程,优化了 Kolibri 在广泛场景下的性能。其小巧高效的体积使客户能够灵活地在本地高效运行,无需将内部数据发送给第三方推理服务。本节重点展示模型的核心能力,更详细的介绍见 我们如何高速构建 Kolibri 一节。

面向企业与政府的基础能力

Kolibri 在模型能力与部署成本之间取得了最佳平衡:总参数 780 亿中激活参数仅 30 亿。在英语和德语场景下,Kolibri 都位于"质量—推理成本"帕累托前沿之上。帕累托前沿是经济学中的概念,指两个目标之间可实现的最优组合边界:在一条边界上,要改善其中一个目标就必须牺牲另一个目标。在被比较的所有模型中,没有一款能在相同推理成本下提供更高质量,也没有任何一款能在更低成本下提供同等质量。

平均基准得分 [%]

英语

德语

  • Kolibri
  • Kolibri Origin
  • 其他经过后训练的模型
  • 帕累托前沿

在数学、代码、事实约束(grounding)与长上下文任务上,Kolibri 的表现可媲美激活参数量最多四倍于它的模型,例如 Nemotron 3 Super。

  • Kolibri
  • Kolibri Origin
  • Qwen3.6-35B-A3B
  • Nemotron 3 Super 120B-A12B
  • Mistral Small 4 119B-A6B
基准 Kolibri Kolibri Origin Qwen3.6-35B-A3B Nemotron 3 Super 120B-A12B Mistral Small 4 119B-A6B
AIME 2025 96.9 81.9 84.6 91.7 79.8
AIME 2025(德语) 87.5 73.5 82.9 85.6 72.3
AIME 2026 96.0 81.5 91.0 90.4 83.1
AIME 2026(德语) 90.0 75.2 84.4 87.5 78.5
GPQA(diamond) 84.3 68.1 83.4 78.0 74.7
GPQA(diamond,德语) 81.3 58.5 80.6 76.6 72.9
AA-Omniscience Index -32.8 -64.0 -15.3 -36.5 -24.0
BrowseComp 29.4 4.4 26.9 29.1 –
τ³-bench banking 38.1 5.7 10.6 15.5 5.7
τ²-bench retail 69.9 58.5 71.6 67.5 62.9
τ²-bench airline 76.7 58.7 70.7 72.7 40.0
τ²-bench telecom 94.7 67.5 99.1 68.1 41.5
BFCL v4 overall 61.4 36.4 67.2 61.0 58.0
LiveCodeBench v6 85.9 59.2 82.5 82.0 71.2
HumanEval+ 92.7 76.8 92.8 94.7 92.8
LongBench Pro 64.5 – 70.8 62.9 56.4
AA-LCR 68.3 – 69.7 67.0 52.3

面向真实应用的场景化性能

公开基准无法覆盖特定行业的差异化需求,因此我们针对客户所在的关键垂直领域——例如德国公共部门、航空、制造和汽车工业——开发了自有内部评测体系。每一套评测都对应行业所需的技能、工作流程和边缘场景,并配有合成训练环境,使我们能够在不接触任何客户数据的前提下,针对这些评测持续改进 Kolibri。更多内容见 场景化性能 一节。

客户代理内部基准上的得分

  • 汽车零部件供应商 0.72 → 0.99
  • 半导体 0.35 → 0.80
  • 德国公共部门 0.54 → 0.75
  • 工业驱动技术 0.31 → 0.60
  • 航空航天 0.14 → 0.59
  • 一次检查点,一次评测
  • 当日均值
  • Kolibri Origin
  • Kolibri

基于您自有文档的可靠回答。 我们使用"拒答"(abstention)数据并结合 Merlin-Arthur 协议训练 Kolibri,使其在上下文中找不到答案时学会主动回答"我不知道"。客户高度看重并明确要求这一能力,因此我们持续追踪并验证拒答准确率。更多细节见 事实约束(Grounding) 一节。

原生德语与英语模型。 我们开发了一套英德双语分词器,并在模型训练全过程中着力纳入原生的德语数据,使预训练 token 中德语占比达到 21.3%。我们仅少量使用翻译数据(整体占比 6%),因为翻译文本通常会保留源语言的文化烙印。最终得到的模型是真正意义上的双语模型,而非一个读过一点德语的英语模型。更多内容见 德语预训练数据 与 专用分词器 两节。

内建控制与合规:捍卫客户的主权

我们自始至终以欧盟《AI 法案》、通用人工智能行为准则 以及《通用数据保护条例》(GDPR)为准则构建 Kolibri,并将版权法作为打造可信赖技术的核心关注点。

我们在模型权重 与训练数据治理 上保持透明,让开发过程中的每一项决策都可被审视。借助其推理轨迹(reasoning traces),模型的可解释性得以体现:它能说明自身是如何得出某一特定答案的。通过 Merlin-Arthur 协议,模型在事实层面实现可信赖性:当上下文不足以支撑答案时,Kolibri 会主动拒答。

我们的团队在德国本土完成模型构建,在德国与芬兰的基础设施上完成训练,全程受欧洲及德国法律约束,不受任何外国控制。我们拥有从数据治理、预训练、后训练到模型工厂(Model Factory)优化的完整端到端流水线所有权。这种对端到端流水线的掌控,是模型主权的根基。同时,这种控制力也会一并传递给客户:Kolibri 体积小巧,使客户享有完全的部署自由度,并支持可调节的推理强度,以便在成本、延迟与答案质量之间灵活取舍。

我们如何高速构建 Kolibri