开源模型 SOTA 正式易主。Kimi K3 这次真是扬眉吐气。
昨天晚上团建刚结束,同事就说,K3 发布了。我去,看来传言果然是真的。
我回到家打开一看,X 的时间线已经刷屏了。口碑非常好。甚至,我感觉这是 DeepSeek R1 之后,唯一在 X 上口碑能这么好的模型了。

还有之前 a16z 的投资人说:

现在每次有新模型发布,我都会第一时间去看原始信息,尤其是官方团队写的 Blog。
因为我基本可以确定,这篇文章一定经过了内部核心研究员、产品负责人,甚至 CEO 的多轮确认。
模型这次到底解决了什么问题,更新了哪些关键能力,团队最看重哪些方向,都会体现在里面。
社交媒体上的很多讨论很热闹,但基本都有情绪夹杂其中,噪音比较多。

而且 Release Blog 的信息基本都是倒金字塔型。最前面的信息是最重要的。大家看我的截图,其中有几个关键信息:
1、2.8T 参数模型。这个是目前全球范围内,参数规模最大的开源模型。
2、基于混合线性注意力机制和注意力残差,这是 Kimi 过去最重要的两个技术创新。
3、原生多模态。
4、100 万上下文。
5、面向长程编程、知识工作和推理等场景设计。
6、仍然落后于最强的闭源模型 Claude Fable 5 和 GPT-5.6 Sol。
看完这几句话,我的第一反应是,K3 已经是顶配了。
2.8 万亿参数,目前全球能够把模型做到这个规模,并且真正完成训练和部署的团队,依然屈指可数。
很多人可能觉得,参数量无非就是一个数字,算力足够多,继续往上堆就行了。
其实模型做到这个规模以后,复杂度会急剧增加。训练时间非常长,中间任何一点不稳定,都可能带来巨大的损失。
大尺寸模型,极其考验团队的基础能力。从算力投入,到数据质量,再到训练稳定性,任何一个环节出现问题,都会影响最终效果。
全球范围内,能把模型预训练做到这个万亿量级的 AI 公司,一只手数得过来。国内只有 DeepSeek 和月之暗面。超过 2 万亿的,只有月之暗面。
混合线性注意力机制和注意力残差这两项技术,之前 Kimi 都单独发过论文。现在回头看,他们都是在为 K3 做准备。

我试着用更通俗的方式,说一下自己的理解。
先说混合线性注意力。
传统注意力有点像读一篇很长的文章。每看到一句新内容,都要回头翻阅前面的原文,看看哪些信息和现在有关。
好处是查得很细,但文章越长,需要处理的内容就越多,计算和缓存的压力也会迅速增加。
KDA 换了一种思路。它更像一边阅读,一边维护一份不断更新的工作笔记。
新的信息进来之后,模型会把有用的内容写进去,也会逐渐淡化已经不重要的信息。后面再处理新内容时,不需要每次都对全部历史信息进行同样规模的计算。
当然,只依靠笔记也可能漏掉细节。
所以 Kimi 使用的是混合架构。在一些层里使用更高效的 KDA,在另一些层里保留 MLA,让模型仍然可以直接查找上下文里的具体信息。
简单理解,就是大部分时候先看整理过的笔记,必要的时候再回头翻原文。这样既能降低处理超长内容的成本,也尽量保住模型对细节的理解能力。
再说注意力残差。
大模型内部有很多层,信息会从第一层开始,一层一层往后传。
传统的残差连接,基本是在前一层结果上继续累加新的信息。模型只有几十层的时候,这么做问题不大。
但模型越来越深以后,前面某一层提取出来的重要信息,会混在越来越多的内容里,传到后面时可能已经被冲淡了。
可以把它想象成很多人接力修改一篇文章。传统的做法,是每个人都只拿到前一个人改完的版本,然后继续往上加。
等修改了很多轮,最早那几个人留下的一些重要判断,可能已经埋在厚厚的稿子里,很难再被找到。
注意力残差相当于给后面的编辑多了一个选择。
写到某个地方时,他不只看上一版,还可以回头查看前面不同阶段的版本,根据当前需要,把最有用的信息重新拿出来。
所以,它解决的是模型变深之后,信息如何继续有效地往后传。KDA 主要让模型更高效地处理超长内容,注意力残差则让信息穿过很多层以后,不容易被淹没。
一个处理上下文长度,一个处理模型深度。这也是 Kimi 官方所说的,让信息在更长的序列和更深的模型里流动得更顺畅。

我看到 X 上有很多人说 K3 超过 Claude Fable 5,这个有点过。官方在 Blog 也承认和这些顶尖模型有差距,但达到 Opus 4.8 的水准,应该是没什么问题。
给大家看看我们团队跑出来的真实 Case。注意,我跑的全部是真实生产环境会用到的案例。
比如下面这个是我们 AI Maker Summit 大会的电子门票。之前其他的一些电子门票,就很简陋。
这次,我用 K3 做了一个有真实物理质感的电子门票,表面还带着细微的颗粒和印刷质感。
做出来后,同事们都觉得非常好看。我希望能把这份心意也传递给我们的参会者。
就像乔布斯说的那样,我们认真做事情,不需要和用户讲出来,他们也能感觉到。
下面这是我在 Kimi Code 中的实现过程截图。

还做了一个手风琴式的折叠和翻页效果。我放了一些自己喜欢的照片,大家看看。
K3 的推理和执行能力都有明显提升。
第一次完工后,卡片的样式重叠,交互也很糟糕。它自己 Review 屏幕效果之后,又开始重新计算墙面的宽度、卡片旋转轴和横向位移。
能明显感觉到,Kimi K3 在这类长程的编程任务上变得非常聪明,能很快定位到问题。

紧接着,我又做了我们大会网站的概览页面。交互动画很棒。
上面这些都是前端类的场景。中午,我又用 K3 把我们大会网站的交易系统重构了一次。
之前,购票系统用的是第三方的一个 SaaS,这次,我彻底把前后端都切换到了自己的平台上:
有一说一,目前 K3 除了慢,没啥毛病了。我觉得比 Opus 4.8 要好。
跑交易系统这个 Case 的时候,中间模型有报错,我查了下,应该是算力不足。估计今天涌入了不少用户。我群里很多人都说重新开始给 Kimi 续费了。
话说美国的用户是在 Anthropic 和 OpenAI 这两家之间来回徘徊。国内,似乎大家开始在 GLM 和 Kimi 之间徘徊了?
这是我新的交易系统。批量填写参会者的这个功能,是 K3 自我发挥的,我感觉还不错。

我把微信和支付宝也都接入了进来:

这是对应的 CMS 后台:

跑完之后,我让 K3 做一次完整的支付链路的安全审计。

跑了大概 15 分钟,他输出了下面的安全审计报告:

找 GPT 5.6 Sol 验证了下,80%的结论准确。

说一下我不带情绪的真实感受。
1、K3 比 GLM 5.2 要聪明,在长程任务方面的推理深度更好。它和 Opus 4.8 比较接近。
2、价格方面,K3 在国内方面并不算便宜,但和 Opus 4.8 相比,仍然有价格优势,至少能便宜 3/4。
3、我用的是 Kimi 的 Coding Plan,直观感觉比之前的 2.x 系列耐用。
4、自主推进项目的意识特别强。所以像刚才做安全审计,我一直给他强调说,不要改代码,先分析。
5、如果价格能再便宜一些,就更好了。
最后,再说一个细节。
K3 的发布 Blog,第一句话是:
犯其至难而图其至远者,发之以勇,守之以专,达之以强。
这句话出自苏轼的《思治论》。去面对最困难的事情,追求最远大的目标。
出发的时候,要靠勇气把路打开;走在路上的时候,要靠专注守住方向;真正抵达最后,靠的是长期磨炼出来的坚韧和力量。
很激励人心。
某种程度上,这句话也很像 Kimi 这几年的写照。
大模型浪潮刚开始的时候,Kimi 是国内最早的一批入局者,也是当时最受关注的明星公司之一。
杨植麟那几年被媒体频繁报道,很多人把他视为这一代大模型创业者里最有技术天赋的人。
但后面的路并不顺。
字节开始在应用端大规模投入,豆包迅速做大,Kimi 一度也被卷进了激烈的投流竞争。
后来 DeepSeek R1 发布,包括李开复在内的大佬,都觉得其他模型没希望了。那段时间,Kimi 的声音明显小了很多。
再往后,Kimi 收缩应用端的投流,把重心重新放回模型研发。后来有了 K2。
K2 刚发布的时候,口碑同样很好,只是模型行业变化太快,没过多久,又有更强的新模型出来。
这一次,K3 又回来了。
K3 肯定也不会是终点。按照现在的迭代速度,可能再过几个月,又会有新的模型刷新大家的认知。
但至少在发布这一刻,K3 确实让人眼前一亮。K3 代表了国产模型的新高峰。
X 上已经有很多人在讨论,开源模型和最前沿闭源模型之间的差距,正在被压缩到三个月以内。
这个说法当然很难精确验证,但 K3 已经站到了当前开源模型的 SOTA,应该没有太大争议。
回头再看苏轼的那句话,会觉得很贴切。
发之以勇,守之以专,达之以强。Kimi 这两年的经历,也是对这句话最好的注脚。
国产模型加油。我也不想一边被嫌弃,一边又憋屈的使用 Anthropic 的模型。







