
今天上午云栖大会,我听了半导体专场。
这个专场规格挺高,工信部电子司副司长史惠康也到场致辞。
他说了几个关键词我印象挺深,一个是「以用促研、以用促产、以用促强」,形成良性循环;还有一个是算力、存力、运力、电力四力融合。
四个力放在一起讲,说白了,芯片不能只看单点,得放到系统里看。
他还给 AI 芯片定了个位,说它是承载算法、支撑算力、连接软硬生态的关键底座,战略性和基础性的作用越来越突出。
最后引了句古话,「致广大而尽精微」,格局要有,细节也要抠。这话听着像政策语言,对照平头哥的做法会发现,干的恰好是这回事。
别人先造芯片再找客户,它是先摸清客户跑什么任务,然后再画芯片。
为什么这么说呢?
你想想看,一般芯片厂商怎么干活?先定规格,做设计,流片,量产,然后,拿着产品去找客户,跟人说你看我这个芯片性能多少、跑分多少,你适不适合用。
这条路没毛病,英伟达这么走过来的,但问题是,你得先有生态、先有客户基础,别人才跟着你走。
平头哥背后是阿里云。阿里云上面跑着几百个客户的真实业务,覆盖 20 多个行业,基础大模型、自动驾驶、具身智能……
这些业务到底在跑什么负载、模型参数多大、是推理还是训练,显存要多少、带宽够不够,平头哥看得到。
一般芯片厂商定义规格的时候靠什么?
行业趋势报告,跟几个大客户聊聊天,再靠工程师的经验判断。平头哥不用猜。它知道客户实际在干什么,芯片该怎么定义,心里有数。
平头哥半导体副总裁李伟良,管这个叫「应用芯片驱动定义」。说白了,芯片特征怎么选、算力跟显存怎么配比,全是跟业务方一轮一轮对焦出来的。芯片到业务,闭环迭代。不是闭门造芯片。
举个例子,低精度计算。
大模型推理不需要太高精度。FP8 就够,甚至 FP4 也行,但精度降下来,输出质量不能跟着降,这需要在芯片计算单元里做专门的增强。
这个需求从哪来的?从客户场景里长出来。平头哥知道上面跑的是什么模型,知道低精度是刚需,所以在 V900 里专门做了 LP4/LP8 增强。
传统做法是什么?
先造芯片,精度就这么高,爱用不用,让客户自己想办法适配。平头哥先搞清楚需求,再在芯片层面解决,这两条路出来的东西,能一样吗?
除了场景驱动,还有三道护城河。
第一道,软件协同设计,全自研的软件方案,芯片和算法一体化设计。
什么意思呢?传统做法是芯片团队把硬件做完了,交给软件团队去适配;硬件已经定型了,软件只能在框框里跳舞,性能损耗不可避免,发现问题再返工,周期又长。
平头哥不是这样,算法需要什么样的计算模式,芯片架构就怎么配合,打一开始就在一起搞。
第二道,多芯片融合设计。平头哥不只做 AI 芯片,它还自研 CPU、SmartNIC、SSD。为什么?
因为真实的 AI 场景里,任务调度、数据传输、缓存加速,每一个环节都需要多颗芯片协同配合;只做好一颗 AI 芯片不够,得把计算、存储、传输这条链路全打通,端到端的性能才能拉满。
第三道是工程实现。
810E 和 M890 两颗芯片已经成功交付,100% 落地,没停在 PPT 阶段,真刀真枪干出来的。
伟良管这个叫「技术底气」,每颗芯片 100% 成功的实践,这些能力在每一代产品上都得到了验证。
而且你看它的节奏:
810E、M890,到 V900 明年 Q1 推出,再到 2028 年 Q3 基于新架构的 GA900,每年交付一颗芯片。这个节奏本身就说明问题。
这套方法论跑了两年,最新作品就是 V900。
……
V900 到底做了什么?
讲具体参数之前,伟良先讲了三个变化。第一个,性能不能只盯单芯片了,得从单芯片一路拉到超节点,多维度一起提。
第二个,生态得打开,芯片不能绑死在一个场景里,得能灵活调配,变成一种生产性资产;第三个,安全这件事越来越重要,算力可不可信,已经成了客户选平台的关键变量。
这三个变化放在一起,V900 设计框架就清楚了。伟良有句话说得挺狠:V900 远超对现有方案的简单改良,是对 AI 算力底座的重新架构构建。
先看性能。V900 计算单元是 M890 的 2 倍,FP4/FP8(低精度浮点格式)算力是 3 倍。注意这是双口径,算子平均 3 倍,大模型端到端平均也是 3 倍。
我在现场看到伟良说这话时,加了句「非常有信心」。什么概念?M890 大概对标 H20 到 A100 这个区间,V900 翻三倍,已经进入更高一档了。
3 倍怎么来的?
计算单元翻倍是一层。还有一层是架构优化,V900 整个数据通路针对大模型推理重新做过,调度效率、片上数据搬运都比上一代快。
计算单元翻倍加架构优化,3 倍就是这么来的。
打个比方:
计算单元翻倍,好比灶台从 5 个加到 10 个;架构优化,好比重新设计厨房布局,厨师取食材的路径更短、动作更顺。灶台多了一倍,效率也提了,合在一起,出菜速度翻三倍。
显存和带宽也一起涨了。216GB HBM(高带宽内存),什么概念?现在主流的大模型,权重几百亿到几千亿参数,216GB 能装下很大一部分,不用做那么多切分,推理效率自然上去。
片间互联带宽 1200GB/s,这决定数据跑多快,模型再大,数据通道也得喂得饱。

性能说完了。但芯片做出来只是第一步,客户的代码能不能跑上来,才是关键。
这就得说生态,很多人对国产芯片最大的顾虑就是迁移成本,代码写得好好的,换个芯片跑不了,或者跑起来性能大打折扣,谁愿意换?
平头哥今年 7 月开源了一整套 AI 软件栈,叫 T-Head SAIL。驱动程序、运行时、编译器、高性能库、工具链,全给你。
客户现有的 CUDA(英伟达计算平台)代码,迁移过来大概 7 天能跑通,不需要重写。
7 天,这个门槛够低了。开源的意思是什么?代码摊开给你看,能改能调能二次开发。不被锁死在一家的生态里,有备选方案。
第三个维度是安全。
还有一个细节不能漏,金融、能源这些行业,数据安全是红线,芯片不光要能跑,还得让人放心。你不安全,人家根本不敢把核心业务放上来。
V900 做了六大安全能力,从资产管控到安全调试再到芯片级硬件防护墙,一整套系统化方案;底层基于 MLA 标准和 SPDM 协议,设备身份验证、远程验证机制都有,给上层应用提供硬件级的保护。
伟良管这个叫「从可用到可信」。好用之外,还得值得信赖。
所以,伟良自己总结 V900,三个词:极致性能、生态开放、安全可信。性能从单芯片拉到超节点,生态做到零门槛迁移,安全做成技术底座。三个维度,缺一不可。
参数说完了,但参数到底能不能跑出来,得看谁在用。
……
先看数。两年不到,客户超过 650 家,覆盖 20 多个行业。线上 40 多家自动驾驶、20 多家做具身智能,训练加推理都有。
线下的话,各大运营商、各地计算中心、金融、能源,都进去了。
金融这块值得单独说说。150 多家金融机构,部署超过 10 万张卡。金融客户是最难搞的,对稳定性和安全性的要求高到离谱,能进去说明产品确实扛得住。
而且,成本比英伟达低 30% 到 60%,金融场景有人算过,差不多一半。10 万张卡省下来的钱,不是小数目。
Kimi K3 这个例子值得好好聊聊。
月之暗面做的,2.8T 参数,1.5TB 权重,开源世界最大的模型。
他们的工程副总裁徐欣然在演讲里透露了一个细节,在相当长一段时间里,Kimi 推理扛不住流量,不得不停止售卖 API。想卖但算力撑不住。这个「幸福的烦恼」,说明推理算力瓶颈是实打实的。
这种级别的模型对芯片的要求非常全面,用徐欣然的话说,「在每一个方向上都不能做得差」。
为什么?她算了一笔账。
100 毫秒,要把 1.5TB 的权重全部搬一遍,系统至少要提供 15TB/s 的带宽,用户才能感受到一个正常的、不卡顿的输出。
访存能力弱一倍会怎样?成本哪止翻倍,直接从原本能跑 100 条请求,变成只能跑 0 条。成本涨 100 倍。
而且推理成本的大头在 Decode 阶段,占总成本的 60% 到 90%。Decode 就是模型一个字一个字往外蹦的过程,这个阶段吃的主要是访存带宽,不是算力。
所以,芯片的访存能力直接决定推理的经济性。
还有延迟问题。假设芯片差一点,每步多 100 微秒,93 层每层做两次通信,加起来就是 20 毫秒;100 毫秒砍掉 20 毫秒,留给 attention(注意力机制)的时间只剩一半,成本又翻倍了。
每一个环节都在抠,每一个方向都不能松。
徐欣然有个说法挺有意思:
模型架构的演进,说白了「面多了加水,水多了加面」。访存不够就加访存,计算闲了就加计算,过一段时间发现计算又太多了,再调整;来回博弈,永远在找平衡。
所以,K3 选芯片时,对平台的要求这么全面,任何一个短板都会打破这个平衡。
而且,K3 本身也融合了好几家开源技术,attention 用的 KDA 结构,底层引入的 MLA,MOE(混合专家架构)部分用的 LATE MOE。
大模型走到今天,本来就是生态协作的产物。这种模型对芯片的兼容性天然要求就高,你得都能跑、都跑得好。
K3 已经在 M890 上跑起来了,徐欣然原话说「兼容性做的比较好」,国内能做到损耗很小的也就两家。
她还说了一句话:
有了超节点之后,很多之前对单颗芯片的巨大压力,也许可以通过更优的并行策略或者算法去改进。
什么意思呢?系统级的方案远不止硬件堆叠,它打开了算法层面的新空间。单卡做不到的事,放到系统里就有了解法。
而且,她对下一代芯片的期望很明确,各项指标都要两倍甚至三倍,没有哪一项可以单独过关。这个期待,跟 V900 的 3 倍叙事是对上的。
这说明什么?外部客户占比超过 60%,不光是阿里自己用得好,外面的人也在用。真有人掏钱买,不是内部消化。
最后说一句大的。伟良有句话我觉得挺准确:真武是系统,不止于芯片。
什么意思呢?
平头哥做的远不止一颗 AI 芯片。AI 芯片,加上自研的 CPU、SmartNIC、SSD,从芯片到超节点,算存网协同,给你一整套软硬件全栈的东西。
前面提到的多芯片融合设计,到了这里,你就能看出全貌了,一整条链路在配合,一颗芯片单干不出这个效果。
伟良之前说的那句「让芯片成为可灵活转运的生产性资产」,意思就是这个:芯片是活的,在系统里可以灵活调配,不能把它片面地理解成,焊在板子上只能干一件事的死资产。
史惠康说的四力融合,算力、存力、运力、电力,到了平头哥这里,变成了具体的工程实践,从芯片定义到系统交付,这条路走了两年,650 多家客户用脚投票。
造芯片不难,难的是知道该造什么样的芯片。致广大而尽精微。平头哥这两年,算是把这句话走了一遍。








