Token导航 LogoToken导航

微纳核芯叶乐谈三维存算一体芯片

更新时间 2026-09-29来源 观察者网正文 5197字阅读约 17分钟5 张图片

编者按:9月20日至23日,国家发展改革委联合中央统战部、全国工商联在中共广东省委党校举办新时代民营经济人士培育赋能第八期培训班。经国家发改委民营经济发展局推荐,观察者网·芯科状元与杭州微纳核芯电子科技有限公司首席科学家叶乐进行了深度对话。

微纳核芯成立于杭州,在无锡和上海设有子公司,是一家以原创架构为核心壁垒的三维存算一体芯片企业。在AI大模型推理需求爆发、先进工艺供应受限的双重背景下,这家民营企业走出了一条从SRAM存算一体、三维近存计算到RISC-V异构的全链条自研路线。

【文/芯科状元】

观察者网:存算一体、近存计算、存内计算,这些概念之间有差异,技术路线也各有侧重。微纳核芯在技术路线上的判断,核心逻辑是什么?

叶乐:我从三个角度来讲。首先,DRAM的三维近存计算,严格来说是“近存”,不是存算一体。真正的存算一体,是在存储器的比特单元层级,既存又算,这才是真正意义上的存算一体。 

图片

我们为什么选择这条路线?第一点,我们国家在先进工艺方面,相对来说暂时还落后于国际水平,这是现实。那么如何用相对成熟的工艺来提高算力密度,就变成了一条非常重要的新路径。只有基于国内现有的工业基础和集成电路制造基础,才有机会在性能上追赶进口芯片。所以核心要点第一条:如何用成熟工艺把算力密度做上去。

第二点,无论端侧还是云侧,功耗都是很大的挑战。端侧设备是电池供电,功耗高意味着续航时间受限。云侧的问题在于,算力规模越堆越高,芯片和板卡的散热就成为上限——功耗太高,散热跟不上,算力规模也堆不上去。所以云侧同样需要低功耗,功耗低了,单卡的算力规模才能提升。我们发现能效指标特别重要。

基于算力密度和能效这两个核心要求,我们很早就坚定地走了SRAM存算一体这条技术路线。通过多次流片验证,我们能把算力密度比传统架构提升四到六倍左右。

但只解决算力密度还不够。大模型推理场景还需要解决带宽问题,因为带宽决定了推理的token生成速率。SRAM存算一体虽然本身速度快,但存储容量有限,没办法把大模型的全部参数放到片内。所以必然需要片外的DRAM大容量存储器来存放权重和KV cache。这时候,传统的二维平面结构就面临片外DRAM与SRAM存算一体芯片之间的带宽瓶颈。怎么办?通过混合键合的方式,把它们进行3D堆叠。 

图片

所以我们的技术叫“三维存算一体”,指的是三维近存计算加SRAM存算一体两项技术的结合。它主要解决了芯片在做大模型推理时的性能问题,同时能基于国产成熟工艺,做出逼近先进制程水平的性能和效果。

做到这一步之后,还要面临一个挑战:怎么让客户用得好?也就是软件生态和计算完备性的问题。今天的模型可以固化成ASIC,但模型在持续演进。我们做出了一个判断:大模型AI推理中,张量计算——矢量矩阵乘和矩阵矩阵乘——占到了90%以上,存算一体主要对这类张量计算进行原位加速,效率很高。模型未来再演进,变化的主要是一些矢量算子和标量算子,但这部分占比很小,大约百分之几。

所以我们想到,一定要用一个CPU跟存算一体做异构。选CPU的时候有三条路径:x86、ARM、RISC-V。x86的生态受限,ARM也不能称之为完全自主可控的生态,而RISC-V是开源开放的。所以我们坚定地选择了基于RISC-V与存算一体的异构架构。

在此基础上,我们还自主定义了基于RISC-V扩展的存算一体指令集,以及上层的算子库和编译器。我们也在开发对标国外Triton的一套存算一体算子库开发语言和框架,在不久的将来会将其开源,从而建立起一个基于开源开放RISC-V的存算一体软硬件生态——既解决计算完备性问题,又实现良好的客户软硬件适配。

观察者网:您提到用混合键合来提升带宽,目前国内的混合键合工艺能达到要求吗?

叶乐:混合键合工艺本身是非常OK的,无论性能、水平还是良率都没问题。真正有挑战的是,多层存储器和计算芯片堆叠之后,整体系统的良率问题。这不是混合键合本身带来的,而是存储器堆叠层数多了以后,应力问题、散热问题,这些会带来良率和可靠性方面的挑战。 

图片

观察者网:微纳核芯在牵头制定RISC-V存算一体的全球标准。但如果过早暴露底层架构,可能被同行跟进模仿。短期暴露底层与长期生态红利之间,这个平衡点您怎么看?

叶乐:这确实需要权衡。从长期角度来看,我们的指令集和算子库、编译器,一定要坚定地走开放路线。因为它有利于下游用户更早地在我们的生态上做软件开发和适配,一旦用习惯了,就很难离开这个生态和系统。所以从长期来讲,开放反而会加深和加强微纳核芯三维存算一体在这个领域的护城河。

短期来看,如果过早暴露了过多技术细节,确实会引入一些模仿者和跟随者,这很难完全避免。但我们很有信心,因为三维存算一体不是一个单点技术的创新,而是一个系统性的全链条自研:存算一体核心IP是自研,基于存算一体的NPU是自研,RISC-V异构架构是自研,指令集、编译器、算子库是自研,3D近存也是自研。竞争对手要模仿和跟随这条全链条,短期内难度还是比较大的。

观察者网:您怎么看存算一体芯片在当前AI算力格局中的位置?它是对传统冯·诺依曼架构的补充,还是在某些场景可以做替代?

叶乐:在矩阵运算场景比较密集的应用中——比如大模型推理、未来的具身智能等——尤其在推理侧,存算一体实际上是可以做替代的,因为它在能效和算力密度上的优势都比较大。

观察者网:我们了解到微纳核芯选择了AI手机作为切入口,当时的考量是什么?

叶乐:我们切入AI手机是在2024年。2023年ChatGPT出来之后,我们深刻地意识到模型已经非常厉害了。以前AI主要专注于训练,但ChatGPT时刻之后,推理的大爆发就要来了——训练是投资,推理是变现。到了2024年底,国产的"ChatGPT时刻"也出现了,尤其是DeepSeek的开源,进一步加速了推理时代的到来,因为模型开源之后,很多用户都可以自己部署。

我们在2024年上半年就意识到,推理部署一定是云边端都会有场景。为什么从手机切入?因为我们的技术在手机上优势非常大。第一,我们功耗低。手机对功耗极其苛刻,越是在这种低功耗的苛刻场景下,我们的低功耗优势越能拉高竞争壁垒。第二,手机量特别大,量大就意味着客户非常看重供应链的稳定可靠。云端不一样,云端供应链不稳定也能卖几百张、几千张卡;但手机场景,客户考虑的是你有没有稳定可靠的供应链保障。我们基于成熟工艺来做,这个特点在AI手机领域进一步放大了我们的优势。

所以我们从AI手机这个端去切入,这也是微纳核芯的重中之重,一直在顺利快速地推进。在此过程中,我们也在同步推进云侧的大模型加速板卡等场景。

观察者网:随着大模型迭代,KV Cache和模型权重占比的变化,存储器架构出现了分层趋势。这个问题您怎么看?

叶乐:分层是对的。SRAM是存储器里面最快的,所以它一定是处理最热的数据——频繁搬运、频繁更新的数据。我们用SRAM存算一体来做热数据处理。但SRAM容量有限,所以第二层级是DRAM,用DRAM的三维近存来做中间层级的存储。如果数据量还不够,再下放到SSD/NAND这个层级。

这里面我想表达的是,存储器的三级分层,一定是越热的数据用越快的存储器,越靠近计算核心。这个顺序不能颠倒:SRAM、DRAM、NAND,不能把NAND排到比DRAM更靠近计算单元的位置,因为DRAM更快,NAND更慢。

图片

存储器没有“全能冠军”,本质上是折中:越快的存储器,耐久性越好、带宽越高,但容量就越小;容量越大的存储器,速度慢、耐久性差。所以分层一定是SRAM紧接着DRAM,再接着NAND,三者都离不开,越靠近计算核心的越是前面层级的存储器。

观察者网:从一颗存算一体芯片的流片到交付客户,成本方面客户的接受度如何?

叶乐:成本是客户非常关心的话题,尤其端侧对成本更敏感。我们的成本优势主要来自几个方面。第一,DRAM的3D近存所起到的效果等同于HBM,甚至可能更好,而我们知道HBM是非常昂贵的。用3D DRAM来做近存计算,能获得比HBM性能可能还更好一点的效果,同时成本更低。第二,底层的计算芯片如果采用先进工艺成本很高,而微纳核芯采用成熟工艺,成本比先进工艺低不少,在计算芯片这一块也有成本优势。第三,良率。如果良率特别低,成本就会翻倍上去,良率也是一个非常重要的课题。

观察者网:微纳核芯的股东阵营中有不少实力雄厚的机构和国家队。作为一家以原创架构为核心壁垒的企业,您在融资过程中是如何说服投资人的?

叶乐:这是一个过程,核心还是“摆事实、讲道理”。

第一步,要非常清晰地剖析中国AI算力芯片领域到底面临哪几个挑战,不能回避:先进工艺受限的问题、传统二维平面结构带来的带宽瓶颈、新架构必然面临的计算完备性和软件生态难题。这些问题要原原本本给投资人讲清楚。

第二步,针对这些问题,我们有什么切实可行的方案来一一破解。第三步,要有佐证的证据——之前的流片结果、ISSCC等顶会的文章发表、仿真验证数据。第四步,是团队实力——我们是一个具有很强原创自主创新色彩的团队基础,再加上产业界非常资深的工程团队的组合。

另外很重要的一点是客户背书。为什么一些头部客户愿意跟我们合作?很多企业是先拿产业投资,再让投资人帮忙介绍产业合作。但微纳核芯从头到尾是反过来的——我们靠自己的技术实力去说服客户选择我们的方案,客户的业务部门直接跟我们合作在先,产业投资反而在后。

还有供应链。国内最头部的集成电路制造企业和最头部的存储器龙头企业,都在跟我们深度合作,这也佐证了业界对我们这条技术路线的看好。

观察者网:微纳核芯的技术路线是系统性工程,对人才要求很高。在人才招募和培养方面,您有什么心得?

叶乐:我们对人才的要求确实特别高,需要两方面素质:创新的能力和创新的勇气。我们往往更重视"有没有能力",但其实勇气同样重要。人都有对失败的恐惧感,创新本身是难的,即便很有能力的人,面对一个开荒的事情,也可能畏手畏脚。所以大多数团队和企业选择跟随已有的成熟路线。

我们的做法是,很多最核心的、颠覆性的技术路线,由我本人亲自带队开拓出来,然后指导团队完成。大家看到这条路有了很好的结果,就慢慢建立起了信心和勇气——原来我们也能做原创,也能打胜仗。这个信心不是一天建成的,需要长时间的积累,是厚积薄发的过程。

在核心人员方面,最重要的开荒性人才,很多是北京大学集成电路学院毕业的博士,博士毕业之后留在公司继续开荒,其中一部分也是我亲自培养的。他们是一批非常优秀的创新开拓者。

同时,由于我们的技术天花板足够高,也吸引了一大批有丰富工程经验的高水平人才陆续加盟。有人在前面开荒创新,落地的时候还需要有工程经验的人来保驾护航——正好,他们的工程经验可以在微纳核芯这个赛道里面发挥出自己的价值。

总结一下:第一,团队核心技术亮点要有特色;第二,带领团队打胜仗,建立创新和开荒的信心和勇气;第三,持续吸引更优秀的人才;第四,不断培养人才。

观察者网:微纳核芯总部在杭州,子公司在无锡和上海。不同城市的产业政策对公司发展有怎样的助力?

叶乐:杭州是一座非常有活力的、年轻的、有包容度的城市,吸引了大量年轻人。年轻人代表未来,年轻且有活力就预示着创新的氛围和创新的未来。营商环境对我们非常好,其他各地其实也都很不错。

不过,我想表达的一个核心观点是:民营企业的发展,一方面离不开各级政府的大力支持,但最终还是要回归商业本质和市场化竞争。企业面对的最终环境不是“动物园”——被保护起来竞争——而是真正的“野外”环境。初期比较弱小的时候,政府的扶持非常重要,但你不能永远依赖扶持,永远在动物园里称大王是没有意义的。最终要靠自己的市场化竞争能力,在真实的市场环境中胜出,这样才能做大做强。

这也是我经常对团队讲的:不能依赖扶持,必须建立自己的市场化竞争能力。特别感谢各级政府对我们的支持,但我们最终一定要面向市场化竞争。

观察者网:半导体行业既需要经验积累,也需要创新突破,这两种特质如何融合?

叶乐:这个问题说得特别到位。AI、大模型这些领域,是非常典型的创新驱动行业,创新的比重很大,工程和经验的比重相对较小。可是集成电路不一样,你既要有创新,又要有工程经验,所以它的门槛非常高。

国内过去很多成功的集成电路企业,在发展历程中工程经验的属性占据主导。为什么?因为没有工程经验,你连前提条件都不具备。所以过去更多的团队是跟随国外的技术路线。但我认为企业要有使命感——迟早我们国家需要有一批企业,在工程经验的基础上去开荒、去突破、去创新。

如何把创新文化和工程文化这两种人才、两种思维方式糅合在一起,其实是一件很难的事情。我们在这方面做了大量探索,也开了很多荒。

图片

本文系观察者网独家稿件,文章内容纯属作者个人观点,不代表平台观点,未经授权,不得转载,否则将追究法律责任。关注观察者网微信guanchacn,每日阅读趣味文章。

文章标签芯片应用落地
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多