10月3日,德国统一日当天,总部位于海德堡的Aleph Alpha正式发布开源权重模型Kolibri,权重以Apache 2.0许可上传至Hugging Face,任何人都能下载、运行甚至商用。这家被视作”欧洲AI国家队”的实验室,用一只蜂鸟的名字(Kolibri在德语中意为蜂鸟)回应了一个老问题:欧洲能不能既守住监管,又不丢掉创新?
78亿参数,每次只”醒来”一小部分
Kolibri最核心的设计是混合专家架构:总共781亿参数,但处理每个Token时只激活约34.6亿,占比不到4.5%。具体来看,模型有50层,每层内置384个专家加1个共享专家,路由器为每个Token只挑选6个专家参与计算。
这意味着它的单Token算力开销接近一个35亿参数的小模型,但记忆体却要按照781亿的规模准备。官方给出的部署门槛是约78GB显存(FP8精度),最少需要两张80GB的A100或H100,或者一张H200/B200。想在本土服务器上完整运行,硬件预算并不低。
为德语而生:分词器与推理都”德国造”
德语喜欢把单词拼成长复合词,英语主导的分词器往往把它们切得七零八落。Aleph Alpha为此自研了UniBPE分词器,词表12.8万,在德语法律文本上比GPT-5的分词器少用约15%的Token,同样一段文本能用更少步骤读完,长文档也能装进更大的上下文。

更特别的是”用德语思考”。团队曾发现,德语推理数据太少反而会拖累模型:德语数学分数从70.2掉到48.3。Kolibri用约80万条德语推理样本补齐了短板,德语AIME 2025得分87.5,超过同档对比中第二名Nemotron 3 Nano的84.4。模型支持四档推理强度(none/low/medium/high),简单查询秒回,难题可以长时间思考。
官方评测的亮点与短板
在Aleph Alpha自己的对比评测中,Kolibri的德语综合分70.8、英语综合分75.5,均高于同档开源MoE模型;英语AIME 2025高达96.9,数学能力甚至反超了12B活跃参数的MoE对手。团队还专门训练了”不知道就弃答”的能力:在Omniscience测试中,面对不知道的答案,它44%的情况会直接承认或给部分回答,而不是编造。
短板同样明显。闭卷知识记忆较弱,多轮工具调用得分39.8低于主流竞品,编码Agent能力一般(Terminal-Bench仅27.7),且只支持德语和英语两种语言。它更适合配合检索增强生成(RAG)处理长文档,而不是当”百科问答机”。
主权模型的意义:数据不出大楼
Kolibri被官方定义为”主权模型”(sovereign),两层含义:一是训练过程,团队在德国、芬兰的自有基础设施上从零训练,全程受欧洲和德国法律管辖,无外部控制;二是客户体验,模型可以在客户自己的服务器上部署,内部数据不出大楼,没有谁能远程修改或关停模型。模型从设计之初就考虑了欧盟AI法案、通用AI行为准则和GDPR的要求。

官方将其目标客户锁定在公共管理、工业制造和航空航天等受监管行业。对政府部门、银行、车企来说,能自持模型、文档不出境、还能用母语思考,正是它们等了很多年的选项。
市场与行业的反应
Kolibri发布之际,Aleph Alpha正处于被加拿大Cohere收购的进程中。双方9月16日签约,Lidl母公司Schwarz Group承诺投入5亿欧元(约6亿美元)融资,合并后公司将保留柏林和多伦多双总部。五日前,联合CEO Reto Spörri离职,Ilhan Scheer成为唯一CEO。
欧洲各国政府嘴上说”要可控的AI”,但此前拿得出手的开源模型大多来自美国和中国。Kolibri给了德语区公共机构一个本土选项,不过它的基准成绩全部出自厂商自测,独立评测尚未跟上;未来归属加拿大母公司,也让”主权”二字多了一层微妙色彩。这只蜂鸟能不能真正改变欧洲AI的生态位,还要看它落地后的真实表现。







