- Published on
Kolibri:主权级开源权重模型发布
- Authors
- Name
- bastitx
- aleph-alpha.com

模型发布与核心特性
Aleph Alpha 于 2026 年 10 月 3 日(德国统一日)正式发布其最新大语言模型 Kolibri。该模型是一款英德双语的混合专家(Mixture-of-Experts)Transformer,总参数量为 780 亿,但每次推理仅激活 30 亿参数,兼顾了性能与部署成本。Kolibri 支持最长 100 万 token 的上下文窗口,其完整权重已在 Hugging Face 上以 Apache 2.0 许可证开放下载。
训练管线与迭代速度
Kolibri 是 Aleph Alpha 持续迭代训练管线的最新成果。团队首先构建了完整的训练管线,并通过训练 Kolibri Origin(300 亿总参数、30 亿活跃参数、65k 上下文窗口)进行了验证。Kolibri 沿用了同一管线,涵盖数据摄取、清洗、消融实验、预训练、后训练及最终评估。该管线实现了高度自动化,在 21 天的预训练过程中仅发生 38 次意外中断(约每万 GPU 小时一次),且无需人工干预硬件故障或网络中断。
从 Kolibri Origin 到 Kolibri,团队在三个月内实现了多项关键升级:总参数从 30B 增至 78B,上下文窗口从 65k 扩展至 1M,训练 token 数从 7.5T 增至 20T。为获得 20T 训练数据,管线处理了超过 200T 的原始数据,经过过滤、去重和精选。架构上,专家数量从 128 增至 384,稀疏度提高,路由算法更换,注意力机制改为滑动窗口与全局注意力混合,并引入了四级推理努力度控制。
主权与合规设计
Kolibri 从设计之初就考虑了欧盟 AI 法案、通用 AI 实践准则和 GDPR 的要求,尤其注重版权合规。模型在德国开发,训练基础设施位于德国和芬兰,完全受欧洲和德国法律管辖,无外国控制。团队拥有从数据筛选到预训练、后训练再到模型工厂优化的完整管线所有权,确保供应链完整性。
客户获得完全的部署自由和知识产权安全,合规性成为模型的继承属性。通过推理轨迹,模型决策过程可解释。Merlin-Arthur 协议使模型在上下文不支持答案时能够主动拒绝回答,增强了可信度。
性能基准测试
在多项基准测试中,Kolibri 展现了与四倍活跃参数量的模型(如 Nemotron 3 Super)相当的性能。具体得分包括:AIME 2025 数学 96.9%(英文)/ 87.5%(德文),AIME 2026 数学 96.0%(英文)/ 90.0%(德文),GPQA 钻石级知识 84.3%(英文)/ 81.3%(德文),LiveCodeBench v6 代码 85.9%,HumanEval+ 92.7%。在智能体能力方面,τ³-bench 银行业务 38.1%,τ²-bench 零售 69.9%,τ²-bench 航空 76.7%,τ²-bench 电信 94.7%。
行业垂直优化
针对公共管理、工业、航空航天等受监管领域,Kolibri 进行了专门优化。团队开发了内部评估套件,涵盖德国公共部门、航空、制造和汽车行业的具体技能、工作流和边缘案例。通过配对合成训练环境,模型在不接触客户数据的前提下持续改进。在内部客户代理基准测试中,汽车供应商得分从 0.72 提升至 0.99,半导体从 0.35 提升至 0.80,德国公共部门从 0.54 提升至 0.75,工业驱动技术从 0.31 提升至 0.60,航空航天从 0.14 提升至 0.59。
双语能力与数据策略
Kolibri 是真正的英德双语模型,而非仅阅读过部分德语文本的英语模型。团队开发了双语 tokenizer,预训练数据中 21.3% 为德语 token,翻译数据仅占 6%,以避免源语言文化印记的传递。知识截止日期为 2026 年 6 月 18 日(英德双语)。
原标题:Kolibri: A Sovereign Open-Weight Model。 HN 原始发布时间:2026年10月3日星期六。当前记录为 545 分、307 条评论。