Aleph Alpha 推出 Kolibri:78 0 亿参数的英德双语 MoE 开源模型
在德国统一日,Aleph Alpha 将 Kolibri 的完整权重以 Apache 2.0 许可证公开,提供 78.1 十亿参数的双语 MoE Transformer,原生上下文 262 k 令牌,最高可扩展至百万令牌。

Aleph Alpha 在 2026 年 10 月 3 日正式宣布,已在 Apache 2.0 许可证下公开其最新模型 Kolibri 的全部权重文件,此举恰逢德国统一日,彰显公司对欧洲人工智能主权的坚定承诺。
Kolibri 属于混合专家(Mixture‑of‑Experts,MoE)架构的 Transformer,原生支持英语和德语两种语言。模型整体规模为 78.1 十亿参数,但在每一次推理时仅激活约 34.6 亿参数,从而在保持大容量模型表达能力的同时显著降低计算开销。
技术规格概览
该模型默认提供约 262 000 令牌的上下文窗口,远超当前主流大语言模型的常规容量。针对极端需求,Aleph Alpha 还提供将上下文扩展至 1 048 576 令牌的选项,但官方建议在常规部署中保持较短上下文,以避免出现延迟峰值和资源争用。
尽管 MoE 设计提升了推理效率,完整权重仍需大量存储空间。MarkTechPost 估算,若将权重量化至 FP8 格式,大约需要 78 GB 的磁盘容量,这一规模可以完整装入单块 Nvidia H200 加速卡,亦可根据实际部署需求分布在多块 80 GB 显存的设备上。
训练数据与方法论
Aleph Alpha 披露,Kolibri 的训练语料约为 20 万亿经过严格筛选的令牌,这些令牌来源于超过 200 万亿原始令牌的更大池子。筛选后,德语占比 21.3%,其中仅有 6% 为翻译材料,显示出对本土语言深度覆盖的明确取向。
训练流水线专为弹性设计:检查点自动保存,评估任务大约每小时执行一次,系统能够在硬件故障或网络中断时自动恢复,无需人工干预,这一点在公司官方声明中被反复强调。
性能声明与合规立场
Aleph Alpha 引用了在专有基准和公开基准上取得的强劲成绩,并将 Kolibri 与使用更多活跃参数的竞争模型进行对比。然而,公司也明确指出,这些评估均来源于供应商报告,仍需独立第三方进行验证。
Kolibri 的研发在德国和芬兰同步进行,严格遵循欧盟 AI 法案、通用 AI 实践守则、GDPR 以及相关版权法规。尽管开源许可证消除了获取壁垒,Aleph Alpha 仍提醒用户,仅凭许可证并不能自动保证每一次下游部署的合法合规。
- 公共部门应用,如税务管理和市民服务
- 工业自动化与预测性维护
- 汽车设计、仿真与合规检查
- 半导体芯片设计验证
- 航空系统工程与安全分析
公司将 Kolibri 定位为面向受监管和关键任务工作负载的主权解决方案,提供本地部署选项,使组织能够全程掌控其 AI 堆栈,这一主张与欧洲日益强化的数据主权政策高度契合。
对于使用中文的企业和研究机构,Kolibri 的英德双语能力直接打开了德语数据的访问通道,无需额外的翻译流水线,从而降低了时延和成本。其超大原生上下文窗口能够一次性处理长篇合同、技术文档或代码库,显著提升合规审查和技术审计的效率。
本地化部署与未来展望
开源权重模型让企业能够在内部进行微调或架构审计,使 AI 行为符合内部治理框架,同时避免对外部云服务商的依赖。Aleph Alpha 计划在未来继续扩展模型的多语言支持,并探索更高效的专家激活机制,以进一步降低算力门槛。
在德国统一日的庆祝氛围中,Kolibri 的发布不仅是一项技术里程碑,也象征着欧洲在人工智能领域追求自主可控的决心。
信息来源
- Kolibri Has Landed: A Sovereign Open-Weight ModelAleph Alpha · 2026年10月3日
- Aleph Alpha Releases Kolibri, a 78.1B Open-Weight English-German MoE ModelMarkTechPost · 2026年10月4日



