“小鸟,快速的翅膀,Kolibri 来了。”

10月3日,德国AI公司Aleph Alpha 正式发布 Kolibri,一个采用Mixture-of-Experts(MoE)架构的开放权重模型。
模型总参数为78.1B,单个token实际激活参数仅3.46B,支持最长100万token上下文,并以 Apache 2.0 协议开放权重。

不妨把它与中国开放权重模型对比下。
DeepSeek-V4 Pro为1.6T总参数、49B激活参数,V4 Flash则是284B/13B;Qwen3.5 35B-A3B为35B/3B;GLM-5为 744B/40B;Kimi K2.6则达到1T/32B。
而 Kolibri 是 78B/3.46B。
显然,Kolibri的总参数并不是最大的,远远比不上DeepSeek、GLM和Kimi的旗舰模型;但它把每个token实际调用的参数压到了只有总参数的约 4.4%。
这正是它的核心思路,模型可以很大,但没有必要每次都把整个模型算一遍。
Kolibri每层配置384个专家,每个token选择6个路由专家,同时保留1个共享专家。50层网络中采用混合注意力,大部分层只关注附近的512个token,只有部分层处理完整上下文,以降低长文本处理的计算成本。

这样做的目的非常现实——长上下文模型最昂贵的往往不是“模型有多少参数”,而是这些参数在实际推理时需要消耗多少计算和显存。
Kolibri因此在“模型能力—推理成本”之间寻找一个更好的平衡点。
Aleph Alpha 的测试尤其值得注意。报告把不同模型放在同一套测试环境中比较:使用 8张B200 GPU,以模型最快配置运行。

在基础模型比较中,Kolibri相对于 Gemma 4 Base,报告给出的结果是:吞吐量最高达到约1.6倍,同时平均英德语能力评分高22.7个百分点。
经过后训练之后,这个优势进一步扩大。与 Qwen3.5 等开放模型比较时,Kolibri的吞吐量最高达到约 2.7倍,平均评分高 21.4个百分点。
这并不是说 Kolibri 在所有单项 benchmark 上都击败了所有模型。Aleph Alpha 自己给出的定位也不是“世界最强模型”,而是希望把模型放到一个二维坐标里看,即能力和服务成本。
在这个意义上,它声称 Kolibri 在英语和德语开放模型中进入了 quality/serving cost 的 Pareto frontier。
这种思路其实并不新奇。
中国开放权重模型已经把MoE和稀疏计算做到了非常高的水平。DeepSeek早期模型就证明了“总参数很大、激活参数很小”可以显著降低推理成本;如今DeepSeek、Qwen、GLM、Kimi都在继续沿着这条路线扩大模型规模。
Kolibri的特别之处,是进一步把激活参数做小,同时把模型定位在企业级部署和欧洲主权AI场景。
Aleph Alpha是一家德国AI公司,2019年成立,总部位于海德堡,目前约有200名员工。
公司长期强调“主权AI”,主要面向政府、金融、工业等对数据控制、安全和本地部署有要求的客户,而不是单纯追求消费级聊天机器人市场。
从能力来看,Kolibri主要针对英语和德语,而不是试图覆盖几十种语言。

它预训练使用约20T token,其中约23.9%为德语、62.5%为英语;同时针对德语重新设计了tokenizer。
官方明确表示,这是一种有意的取舍:减少语言覆盖,换取特定语言上的更深能力。
这一点也很符合 Aleph Alpha的产品路线。
在企业和政府场景里,一个模型是否会说几十种语言,未必是最重要的问题。能否处理大量内部文件、长篇法律和技术资料,能否在本地部署,能否进行工具调用,以及企业能否掌握模型和数据,可能更加重要。
Kolibri因此支持推理模式、工具调用和RAG,同时提供最长 1,048,576 token 的上下文。不过官方建议实际服务时控制在256K以内,以获得更好的效率。
78B总参数、3.46B激活参数,再加上256K级别的高效长上下文和最高100万token的扩展能力,本质上是在寻找一个新的平衡点,不是“模型到底有多大”,而是“用多少计算,能获得多大的模型能力”。
对于企业AI来说,这个问题可能比单纯的排行榜更现实。
毕竟,模型参数最终都要变成GPU时间、电力、显存和部署成本。







