Token导航 LogoToken导航

Aleph Alpha发布Kolibri模型 3.46B激活参数跑赢DeepSeek

更新时间 2026-10-05来源 AI先锋官官方正文 1741字阅读约 6分钟5 张图片

“小鸟,快速的翅膀,Kolibri 来了。”

图片

10月3日,德国AI公司Aleph Alpha 正式发布 Kolibri,一个采用Mixture-of-Experts(MoE)架构的开放权重模型。

模型总参数为78.1B,单个token实际激活参数仅3.46B,支持最长100万token上下文,并以 Apache 2.0 协议开放权重。

图片

不妨把它与中国开放权重模型对比下。

DeepSeek-V4 Pro为1.6T总参数、49B激活参数,V4 Flash则是284B/13B;Qwen3.5 35B-A3B为35B/3B;GLM-5为 744B/40B;Kimi K2.6则达到1T/32B。


而 Kolibri 是 78B/3.46B。

显然,Kolibri的总参数并不是最大的,远远比不上DeepSeek、GLM和Kimi的旗舰模型;但它把每个token实际调用的参数压到了只有总参数的约 4.4%。

这正是它的核心思路,模型可以很大,但没有必要每次都把整个模型算一遍。


Kolibri每层配置384个专家,每个token选择6个路由专家,同时保留1个共享专家。50层网络中采用混合注意力,大部分层只关注附近的512个token,只有部分层处理完整上下文,以降低长文本处理的计算成本。

图片

这样做的目的非常现实——长上下文模型最昂贵的往往不是“模型有多少参数”,而是这些参数在实际推理时需要消耗多少计算和显存。

Kolibri因此在“模型能力—推理成本”之间寻找一个更好的平衡点。

Aleph Alpha 的测试尤其值得注意。报告把不同模型放在同一套测试环境中比较:使用 8张B200 GPU,以模型最快配置运行。

图片

在基础模型比较中,Kolibri相对于 Gemma 4 Base,报告给出的结果是:吞吐量最高达到约1.6倍,同时平均英德语能力评分高22.7个百分点。

经过后训练之后,这个优势进一步扩大。与 Qwen3.5 等开放模型比较时,Kolibri的吞吐量最高达到约 2.7倍,平均评分高 21.4个百分点。

这并不是说 Kolibri 在所有单项 benchmark 上都击败了所有模型。Aleph Alpha 自己给出的定位也不是“世界最强模型”,而是希望把模型放到一个二维坐标里看,​即能力和服务成本。


在这个意义上,它声称 Kolibri 在英语和德语开放模型中进入了 quality/serving cost 的 Pareto frontier。

这种思路其实并不新奇。

中国开放权重模型已经把MoE和稀疏计算做到了非常高的水平。DeepSeek早期模型就证明了“总参数很大、激活参数很小”可以显著降低推理成本;如今DeepSeek、Qwen、GLM、Kimi都在继续沿着这条路线扩大模型规模。

Kolibri的特别之处,是进一步把激活参数做小,同时把模型定位在企业级部署和欧洲主权AI场景。

Aleph Alpha是一家德国AI公司,2019年成立,总部位于海德堡,目前约有200名员工。

公司长期强调“主权AI”,主要面向政府、金融、工业等对数据控制、安全和本地部署有要求的客户,而不是单纯追求消费级聊天机器人市场。

从能力来看,Kolibri主要针对英语和德语,而不是试图覆盖几十种语言。

图片

它预训练使用约20T token,其中约23.9%为德语、62.5%为英语;同时针对德语重新设计了tokenizer。

官方明确表示,这是一种有意的取舍:减少语言覆盖,换取特定语言上的更深能力。


这一点也很符合 Aleph Alpha的产品路线。

在企业和政府场景里,一个模型是否会说几十种语言,未必是最重要的问题。能否处理大量内部文件、长篇法律和技术资料,能否在本地部署,能否进行工具调用,以及企业能否掌握模型和数据,可能更加重要。

Kolibri因此支持推理模式、工具调用和RAG,同时提供最长 1,048,576 token 的上下文。不过官方建议实际服务时控制在256K以内,以获得更好的效率。

78B总参数、3.46B激活参数,再加上256K级别的高效长上下文和最高100万token的扩展能力,本质上是在寻找一个新的平衡点,不是“模型到底有多大”,而是“用多少计算,能获得多大的模型能力”。

对于企业AI来说,这个问题可能比单纯的排行榜更现实。

毕竟,模型参数最终都要变成GPU时间、电力、显存和部署成本。

文章标签DeepSeek模型发布开源大模型应用落地
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多