Token导航 LogoToken导航

Groq、Cerebras与OpenAI的推理芯片路径对比

更新时间 2026-09-23来源 硅谷101正文 1.9万字阅读约 60分钟17 张图片

过去几年,推理消耗的token爆炸式增长,token经济随之成型,推理专用芯片也持续升温:去年年底,英伟达以约200亿美元与AI芯片初创公司Groq达成技术授权协议,并吸纳其创始人Jonathan Ross等核心团队,被外界视为一次变相收购(acqui-hire);做晶圆级“大芯片”的Cerebras今年6月IPO,市值达到670亿美元;OpenAI联手博通,推出了首款自研推理芯片Jalapeño,从设计到流片仅用了9个月——加上我们之前聊过的谷歌TPU,推理芯片牌桌上的玩家越来越多。

这场推理芯片大战中,各家真正比拼的是什么?为什么走向了不同的技术路径?推理芯片未来又会向什么方向收敛?

图片

本期硅谷101,我们请来两位AI芯片创业者,逐一拆解这些热门推理芯片在技术路径上的取舍与得失。其中嘉宾Mark是英伟达首席科学家Bill Dally的学生。Bill Dally是现代GPU并行架构最重要的奠基者之一。我们也借由Mark的视角,去了解这位芯片大师是如何思考问题和看待创新的。

以下是这次对话内容的精选:

图片

泓君:今天跟我在一起的两位嘉宾,一位是负责推理芯片的硬件还有系统架构的Mark,还有一位是负责软件和编译器方向的子扬。大家要不要跟听众介绍一下,训练和推理对芯片的要求有什么不同?为什么可能需要两种不一样的芯片?

Mark:从成本角度看,这是商业模式决定的。训练本身没有直接回报,所以大家计算训练成本时,其实是在赌一个最强训练集群,做出最强模型,再靠未来推理把训练投入收回来。

但推理在商业上很容易算账:用户愿意为每100万个token付多少钱,我推理出这100万token要花多少成本。成本包括买GPU、消耗电等。所以推理追求的是性价比,而不是极致性能,会把成本更多考虑进来。

比较有意思的是计算密度,英文叫“arithmetic intensity”,它的缩写正好也是“AI”。训练时有海量数据,有足够并行度,可以把多余算力充分利用起来。但推理时,语言模型被认为是一个强逻辑过程,逻辑需要一定顺序完成。

所以语言模型token生产的过程,在推理里是严格意义上的线性的、或者说是严格意义上自回归的。我必须先知道当前token推出来的结果,再把它作为输入喂给模型,它才能告诉我下一个token是什么。

推理分两个阶段:prefill(预填充)阶段,有很多token可以并行处理;但decode(解码)真正产生token时,必须一个一个生成。而每生成一个token,都要把整个模型(比如1.6T参数的模型),从存储介质读到计算单元里。所以推理,尤其decode阶段,对算力和带宽的需求发生了本质变化。

泓君:我可不可以理解成,GPU在训练部分核心解决算力,在推理部分核心解决内存带宽?

徐子扬:更准确地说,训练和推理的prefill阶段,所有token都是已知的,可以用大量并行度,读取一次数据后同时做很多计算。GPU硬件本身,需要你同时做大量运算,才能把它的硬件资源用满。在这个比例下,带宽其实是不足的。

泓君:给听众一个更形象的例子吧。比如我给大模型一个问题,让它出一个采访提纲。用户把提示词输进去,它开始推理、写提纲,会用到多少GPU或推理芯片?用GPU和用专业推理芯片,在延迟、成本上有什么不同?

Mark:prefill阶段有充足并行度,只要把模型从GPU的HBM(高带宽存储器)里读到计算单元一次,就可以把你喂给它的东西同时处理完。这可以带来足够并行度,让GPU充分利用算力。

但到了decode这块,比如它要说“好的,下面是我为你准备的一份采访提纲”,这句话里每一个token、每一个词,都意味着你要把模型从存储介质里读上来一遍。读取模型次数上,大家可以清楚感受到:是一句话读一次,还是一个词读一次,读的量都是整个模型权重。

GPU不能接受把模型从HBM读到计算单元后,就只处理一个用户的token。所以它真正做的是batching(批量化处理)。它要收集1万个用户不同的推理任务,并行地把这1万个用户里的第一个词、第二个词、第三个词一起推理出来。所以从用户角度会感受到:为什么我这里推一个token这么慢?因为用GPU做这件事,你不光在等GPU推理你自己这一个token,还在等同一批里其他9999个用户的token。

GPU这种大算力密度,用HBM提供非常昂贵的带宽,导致用户体验上,不管Agent场景还是reasoning自己思考的场景,推理速度都有比较强的限制。

泓君:那如果用推理芯片呢?

Mark:推理芯片是一个非常泛的词,分太多种了。推理本身也足够复杂,分为prefill、decode;decode里因为模型不同,还分attention、FFN。

我们认为,未来理想的推理系统可能包含很多种不同芯片,能把实际decode token这个过程做得足够便宜、足够快。这可能是需要打破GPU传统架构,做更有针对性的新架构,以及使用不同于HBM的其他介质的意义所在。

图片

泓君:从现在市面上这些说自己做推理芯片的公司来看,你觉得做得最好的是哪家?Groq怎么样?

Mark:Groq、Cerebras都在这条技术路线上。我觉得大家看到了正确的问题,它们确实已经把东西做出来,而且像Groq现在和英伟达配合的关系,确实是我们设想中比较理想的状态:GPU处理哪一部分任务,然后Groq处理哪一部分任务。

所以在大的方向上,尤其英伟达收购Groq之后,更好地做异构推理系统这个角度来讲,其实我现在是比较看好Groq的这条技术路线。

图片

Groq LPU推理卡 图片来源:Groq

泓君:可以展开聊一下吗?

Mark:我觉得最关键两个点,第一,怎么提供高性价比带宽。包括我们最初想做现在这个项目,也是因为看中了有远比HBM要好两三个数量级、带宽性价比更高的介质。

这种介质的关键不在介质本身,而在于你要关注局部性的问题。你要提供比HBM更高一层的局部性。HBM是把存储和计算放到一个封装里,所以它的带宽能做到很高。但我们希望把局部性提升到下一层:把存储直接放到计算芯片里面。

带宽的核心是连线的密度及频率。当你把线从封装走线,变成计算芯片内部光刻出来的线,这两种线,在密度、成本、包括能耗上面,都有本质差别。

如果有些介质能让我把模型权重放到计算单元或计算芯片上,那就是质的提升。这是解决带宽问题最本质的方法。而SRAM(静态随机存取存储器)只是刚好目前阶段最成熟、最可靠、可以让你有机会把存储放到计算芯片里的一个方式。

泓君:现在Groq是这种方式吗?我知道你们要走这样的方式。

Mark:是,Groq也是这种方式。另一个关键点是“异构”。我觉得Groq比Cerebras稍好一点,就在于它和GPU可以更好地结合起来。因为推理不是钢板一块,里面有算力密集的部分,那部分GPU做得也很好。如果你未来的系统能把异构这个点做得比较极致,那么在芯片以外的系统层次,我觉得会有更大优势。

徐子扬:刚刚的讨论,都是围绕着云端的推理芯片。推理芯片是一个巨大市场,云端的、边侧的,大家各有侧重。大家都要获得相对低廉的带宽。但端侧有物理空间上、功耗上的限制,这就导致了在端侧上面,我们可能还会看到其他一些思路,比如3D DRAM(三维动态随机存取存储器)。其实很多思路都在提供更高、更便宜的带宽,包括所有HB开头的词,HBM、HBF……都是想把原先的介质做到更高的带宽。

泓君:我先花一点时间解释一下我们这期要频繁提到的三个词:SRAM、DRAM还有HBM。最简单的理解方式就是,它们都是存储数据的地方,但是区别就是说,离干活的地方有多远。

DRAM是你电脑里面的内存条,它能装很多,但是离得远,来回取数据要花时间。

HBM,它是把DRAM搬到了计算芯片的旁边,而且还开了很多条通道,所以它的容量大,速度也快,现在英伟达的高端GPU用的就是它。那它的代价是什么呢?就是贵,而且全球的产能非常紧张。

SRAM不一样,它可以直接做在计算芯片里面,所以它其实是最快的方案,快很多,但是它有一个致命的缺点,就是太占地方。存同样多的数据,SRAM需要的芯片面积是DRAM的几十倍、上百倍。

所以我们总结一下就是说,DRAM它的方向是便宜,但是慢;HBM快,但是贵,而且抢不到货;SRAM最快,但是它装不下。

徐子扬:在云端场景,对整个系统铺多大,没那么大限制,只要它能给我们提供足够吞吐。我们会从更本质的角度考虑:什么样的物理介质能提供最密的连线和最高带宽?我们找到的是SRAM。

Groq和Cerebras这两家公司,本质上它们的速度和可能的性价比都来自于SRAM,尽管它们没有着重强调这一点。其他一些美国AI推理芯片创业公司,包括d-Matrix、MatX,也在往SRAM方向走。并且谷歌TPU、亚马逊Trainium,如果我们去看现在所有发布的芯片,每一代SRAM都是变得越来越大的。

SRAM和现有的其他存储介质相比,从带宽角度,无论绝对数量,还是每块钱能买到的性价比,都非常高。所以我们能看到,大家都在往这个方向收敛。

图片

泓君:可不可以一句话总结Cerebras?它相当于在一个巨大晶圆上做一整块的芯片设计。它的优点是什么,缺点是什么?和Groq相比,它的优劣势和trade-off是什么?

Mark:我觉得可以以一个更统一的视角,去看大家做的这些事情。以Cerebras和Groq为例,它们在Transformer出来之前,就预见到未来可能有一部分AI系统对带宽有非常大需求。大家都经历了同样的思考过程:怎么把带宽做得更便宜、更高,最后发现SRAM是比较好的介质。

但做这件事有trade-off。你要跳出local minimum(局部最优),就要损失一点东西。SRAM损失的是单芯片容量。DRAM是一个晶体管加一个电容存一个比特;SRAM需要六个晶体管,所以存储一个比特的代价更高,一个芯片上能做的容量会变得很低,可能比HBM要低两个数量级。

大家都发现了这一点,怎么提升容量呢?最简单直接的就是,你要把系统做得更大,做几百个、几千个芯片,单纯就为了把所有模型权重都放到六个晶体管的SRAM里。放是都能放下,只要系统够大。但问题在于,先放下了,如果它就在里面存着,并不能产生token。你得用另一种方式把它读出来,并且做有效的计算。

这时候大家会发现,当你系统足够大之后,很多计算或整个系统效率的瓶颈就卡在通信上。大家的思维实验其实都做到了这一步。这时候Cerebras和Groq开始分歧了,大家用了两条不同技术路线,来解决大集群通信调度问题。

Groq的思路是:实际调度如果放在运行时做,开销往往会很大,它希望把调度放在运行之前,也就是编译器这个时间点,把未来芯片系统里可能做的所有计算、通信都想明白了。哪个使用周期做什么计算,哪个周期开始通信,都排布好之后,实际运行时就没有调度问题了。这某种程度上缓解了集群变大之后调度成为瓶颈的问题。

Cerebras更简单粗暴:之所以集群通信有代价,是因为一个柜子里几百个芯片,大家总是有物理距离的。那如果把一个柜子的事情塞到一个大的wafer(晶圆)上,那物理距离、线的带宽,自然都会变得更好一些。

但在我们看来,他们在做各自技术决策的时间点,没有足够信息来支撑他们来判断未来具体需要面向哪样的workload来优化,因为那时Transformer还没出来。

Cerebras最后可能面临的大挑战,是如何控制整个wafer的良率以及成本;Groq则是在做出“依靠编译器做完全静态调度和编译”这个选项时,没有办法预先知道现在语言模型Transformer推理里有如此大的动态性,比如MoE(混合专家模型)的产生,这与它当时的技术选择并不那么匹配。

泓君:可以详细解释一下吗?

徐子扬:MoE这样一个网络有非常多的专家。每一个token在推理时,会去激活专家里的一小部分,这一小部分是在运行时决定的,随着不同的token在选择,比如在128个专家里选8个,这件事你没有办法在编译时预测。

现在的单颗SRAM是没有办法把整个网络都放进去的,一定会出现有些专家在一部分芯片上。这里就有调度问题:我要把这样的token送到哪一颗芯片上?这本身有一定的动态性。

如果想用一个静态的方式解决这个动态性,一种思路是,我非常保守,我把它都送过去,那有些芯片就在空转。另一种解决方式是换一种方法切模型。我们推演过,如果不用专家去切分这个模型,现在这个模型的大小很难用其他的几个维度把它切得很干净、很高效。所以这个动态性就变成了它的静态调度的很大问题。

泓君:我印象中MoE是在DeepSeek发布后变得非常主流,引起大家强烈关注的。但英伟达acqui-hireGroq是在2025年底,它应该也能看到这些问题。它当时为什么会做出“收购”的决策?大家有没有一些相关的消息跟推理?

徐子扬:用一个保守的思路去想,它会有一些芯片空转,但这只影响性价比,不影响我能做到很快这件事。现在市场对Groq和Cerebras的定位其实就是快,性价比没有被拿到台前那么多讨论。现在整个商业逻辑是这样的:如果我做推理比别人快几倍,比如我现在是100 token每秒,但是拿Cerebras能做到750甚至2000 token每秒,那我可以为此付很多溢价。

SRAM和HBM相比,性价比有两到三个数量级优势。所以我们在做整个系统时,其实可以浪费掉一个数量级。牺牲掉的就是它为了解决MoE去做技术上的一个trade-off。从带宽角度来说,性价比还是更高的。

Mark:从商业的角度来讲,别人如果愿意为更快买单,你不会主动告诉别人,你的成本其实是更便宜的。

泓君:所以Cerebras跟Groq,谁更贵?

Mark:我认为是Cerebras。

泓君:Groq创始人Jonathan Ross,也是谷歌TPU的核心设计者之一。他在设计这两套架构时,核心关注点有什么区别?

徐子扬:整个Groq的思路是围绕着编译器发生的。因为Jonathan Ross本身也是编译器团队的leader。他出来做这件事的思路,就是把确定性编译做好,然后围绕这个编译去设计硬件。所以就从静态编译和静态调度出发重新设计了硬件。

刚刚说的静态调度是一点,还有另外一点是determinism(确定性)。比如我们从存储介质里面把东西读出来,是100纳秒后出来,还是300纳秒后出来,会有一个抖动。这个抖动在DRAM中更明显。当它用了SRAM,再加上芯片设计,它其实是把确定性做到极致,也把静态时钟同步做到极致。这一切都围绕着:最后我能在编译器看到整个系统,并为它做这么样一个排布。

但是,他创业的时间点,有一些特性。2016年Groq成立,最开始想做很多图像、语音,但他们一直想做推理。在那个时代,模型和今天Transformer、MoE出来以后是不一样的。包括一些动态性,在那个时间点和今天,它的需求是不一样的。

图片

泓君:我们刚讲到,Groq和Cerebras都有一些时代局限性在里面。它们创业的时间点,生成式AI和大模型还没出来,深度学习在整个业界是一个比较主流的方向,但是不是以Transformer为主,我们不知道。像Groq,当时也无法预测未来会和MoE有一点不匹配。

那Cerebras为什么成本比Groq还高?它从创业到现在,将近9到10年后,又站到了大家关注的焦点上。你们觉得在这中间它调整了什么?做对了什么?

Mark:我为什么刚刚第一反应是它的成本会比Groq高。首先,从技术路线讲,它需要以整个晶圆的规模去生产它的产品。这会遇到芯片生产过程中非常关键的一个参数——良率。

传统上,比如现在设计芯片,单芯片尺寸极限差不多800mm²,一个晶圆上可以切出40个类似芯片。良率会影响切出来的芯片有多少是好的。如果没有做任何partial good的设计,良率50%,可能就切出20个好的。

但如果单一产品尺寸就是整个wafer,Cerebras会做很多事情在于,我接受芯片上30%的单元都是坏的,仍然让产品能用。但这时候仍然和大概率40%、50%都是坏的这个良率是不匹配的。而且一旦整个晶圆达不到良率的需求,整个晶圆就作废了。这意味着,你要制造出一个成功的晶圆级产品,成本是非常非常高的。

图片

Cerebras WSE-3 晶圆级芯片 图片来源:Cerebras

徐子扬:除了良率,Cerebras还有一个问题,整个系统要为这个和其他芯片完全不一样的设计做改变。比如软件上,整个晶圆上可能有几十万个小core,坏了哪些部分能绕过去;如果坏在关键部分怎么办?这些事情之前都没有针对这样一个系统研究过,所以它首先要解决软件问题。还有你这个系统要怎么插到机柜里,也有一些额外事情,它都要自己解决,因为它可能是现在唯一一个比较有名的晶圆级生产商。

Mark:这个问题非常非常复杂,我们要捋一下逻辑。当我们说实际成本的时候,大家最关心的是token成本。token成本,我们强调了很多带宽成本,因为每推一次token,意味着要把整个模型从存储介质,比如从SRAM里读上来。

但回到数据中心本质的成本,其实有两部分:采购系统的成本,以及实际运行中的电费、能源消耗。Cerebras由于良率导致的成本高,都是它的硬件那部分成本高。这部分某种程度上摊薄了它能在实际带宽上获得的收益。比如,如果是简单的芯片,没有良率问题,可能单芯片成本可以做到英伟达的1/10,带宽做到10倍,就像Groq这种形态。但如果制造部分成本太高,很可能是10倍英伟达的带宽,但3倍HBM的成本,那带宽实际性价比就要打折扣。

这其实类似Groq要为它的确定性打一个折扣,Cerebras要为它复杂的良率成本打一个折扣,最终折扣都要打到token成本上。

图片

泓君:英伟达为什么要花200亿去acqui-hire Groq?它最看重的点是什么?

Mark:这也很直接明了,我和Bill Dally(英伟达首席科学家)聊很多技术需求时,会发现GPU这个架构没有办法很好解决推理带来的新的大带宽的需求。我觉得从NVIDIA角度,它也有一些大公司的问题,尤其是在技术架构上。比如CUDA,既是一个很强的护城河,同时某种程度上也是创新的一个包袱。

我觉得Jensen很清楚,未来推理里,算力不一定是唯一的关键,需要补充带宽方面的技术能力。综合各种原因,acqui-hire一个有这种能力的公司,是非常好的决定。

图片

Groq3 LPX机柜,2026年8月,英伟达宣布该机架已全面投产 图片来源:NVIDIA 

泓君:英伟达其实也是可以从内部做的,但很难吗?

Mark:Bill在NVIDIA Research,他们其实会做非常多架构层面创新,而且很早就开始做。比如围绕CGRA也发表了很多论文。但是在一个成熟的公司里,把一个研究想法颠覆式地推给产品团队,难度非常大。即使是英伟达这样的公司,也很难在内部推动,不如干脆acqui-hire一个和之前团队没什么关系的新技术团队。

泓君:我们之前说英伟达有一个很大的护城河,就是CUDA的体系。现在做推理芯片,或者做芯片,有多大程度可以绕过CUDA,或者说建立一套全行业通用的软件体系?

徐子扬:从推理芯片角度,绕过CUDA是百分百会发生的。事实上,我们去看几家大厂的推理芯片,比如TPU、Trainium,都没有一丁点说要兼容CUDA。

泓君:但大家依然会觉得TPU软件系统难用。为什么Anthropic能大量采购TPU?我听到一个说法,因为它有很多工程师是谷歌过去的,知道JAX怎么用。但如果让一个从没做过软件编译器的工程师做这些事情,大家还是觉得难。TPU在软件层还是一个黑盒,除非谷歌自己的人来做。

徐子扬:它只要不是“非常多个”难的问题,如果只是“一个”难的问题,我只要把Transformer里所有算子都在新芯片上写出来,那我Transformer就能跑了,商业逻辑就通了。另外有了AI加持,现在针对算子和整个运行时的开发,其实大大加速了。

泓君:我先说一个结论,大家认为推理芯片绕过CUDA是一定的事情。

Mark:对,我想说一下原理。比如用TPU软件、AWS软件,包括华为软件,其实很难用,这一点我不否认。核心点在于,在训练时代和推理时代,大家“为软件好用买单”的意愿,相比于“愿意为绝对token成本降低买单”的意愿,发生了本质变化。有些软件很难用,但如果难用能带来更好性能、更好性价比,在推理时代,大家天平会更多往性能、性价比倾斜。

以至于我们看到很多已有的做法,比如DeepSeek,虽然它用GPU芯片,但其实它更愿意直接去写很底层的PTX汇编代码,做很底层的优化。这就是为什么我们认为推理时代CUDA一定会被绕过。

泓君:我们一直在说成本。现在看Groq、Cerebras,还有你们未来做的芯片,性能跟性价比相比现在市场主流芯片(比如GPU),大概是什么量级?

Mark:从很多原理分析角度,我们认为未来更理想的推理系统,有机会在速度上做到比现在GPU,或者以通用AI芯片GPU、HBM这种架构,至少两到三个数量级提升,从几十token每秒,到一千甚至一万token每秒,这是单用户推理速度的提升;以及10倍左右性价比提升。

图片

泓君:你们怎么判断一个推理芯片好不好?评价框架是什么?比如每个token产出的成本、推理速度、每个token耗电量、芯片算力利用率,以及软件和编译器,哪些方向是重要的?

Mark:我觉得在推理时代,前三个是重要的:成本、速度、耗电量。第四个(利用率)会影响第一个(成本)。但是最终大家关心的肯定是成本。

因为我们看未来整个系统是异构的,所以对一个芯片来说,不能单纯地从它的算力、带宽、容量让大家对整个系统产生一个综合的认知。未来衡量芯片好坏,一定要在系统层次衡量。

徐子扬:要再强调,我们在说的是云端AI推理芯片。如果是一个盒子,或放在手机上的芯片,每个token成本并不是最重要的。端侧最重要的可能是我最多花100美元买这个芯片,这100美元能达到某一个速度的推理,东西就能卖出去。所以端侧AI芯片考虑的是完全另一件事。

但从云端考虑,最终成本会被分解到每个token成本。所以第一优先级考虑token生产成本,第二优先级考虑速度。速度是未来非常重要、很核心的AI Infra指标。再往后是用电量,在云端角度,今天总持有成本(TCO)里用电量在整个比例里头是较小的那一端。

Mark:国内和美国这一点上有比较大的区别。国内我们了解到,大概是1/3在电,美国大概2/3在电。这个其实会影响大家更关心什么,比如老黄天天讲的tokens per watt(每瓦特token数),还是tokens per dollar(每美元token数)

泓君:如果遇到同行,或者看一家芯片公司,你们会怎么判断它行不行?如果用一个问题问芯片公司,会是什么?

Mark:刚才那三个问题(成本、速度、耗电量),都是很好的问题。但我们比较关心的其实是两个,就是你的tokens per second可以做到多快、多便宜。可能很多实际做推理芯片的公司根本没有这个数字。

徐子扬:从用户端角度理解,就是你这个芯片组成的系统,每个token的价格,和它对单一用户的每秒推理速度。这两个是我们最关心的核心问题。

图片

泓君:推理速度现在是核心制约瓶颈吗?从我作为用户体验来说,我觉得现在推理速度够用了。

徐子扬:这是我们思考非常多的问题:做“快”,这个“快”本身有多大意义?

先从今天商业逻辑说。自从Agent大规模爆发,现在大量语言模型产生的token,其实并没有被人读。这里有两个点:在Agent之前,有个东西叫chain of thought(思维链)。它产生token的这部分不是给你看的,是给模型自己产生最后结论的。这部分速度要快一些,因为最后是给自己看的;Agent这部分产生的token,也不是给人看的,是给别的Agent读的。

人本身阅读token的速度没那么快。我们可能做到100 token每秒,人就已经读不过来了。所以今天很多GPU或其他系统,它去反推的时候,都是往100 token每秒去发展的,甚至会低一些,50 token每秒。

但对Agent系统,我们认为这个速度一定程度上没有上限,越快越好。对AI来说,长期的核心制约有两个:能耗和时间。单位时间内能解决多少事情,本质上取决于系统对单用户的推理速度。

Mark:你提了一个很好的点:你觉得已经很快、够用了。我觉得核心点是,它一定会(通过某种方式)让你觉得够用,但会在别的地方实现这一点。比如它知道用户不能接受一个问题想两天,甚至一个小时可能都不能接受。所以这本质上限制了在这一天或一个小时之内,我能生产多少token来解决用户问题。

所以推理速度更快,并不意味着你要从一分钟思考,最后交互速度变成一秒钟;而是在同样一分钟交互时间里,模型可以用10倍更多token做更多内部自我思考,来提升智能水平。

徐子扬:或者用Agent的方式去做很多确证的实验来回答这个问题。

泓君:有意思。我看到答案的时间可能一样,但背后是这个模型思考了一遍,还是思考了十遍。所以推理芯片做得好,可以让模型在同样时间里更智能。

Mark:所以你看黄仁勋演讲的PPT,坐标纵轴是每瓦特token数,或者每秒每瓦特token数,是说token的成本;横轴讲的就是推理速度。Bill喜欢叫“interactivity”(交互性),但是老黄的PPT里面,横轴标注是“Smarter AI”,他认为推理更快意味着整个AI可以更聪明,就是基于刚刚的逻辑。

泓君:我理解了。所以有时候,比如看到一些应用很快给我答案,可能只是因为AI思考得少而已。这太有意思了。

徐子扬:我们甚至觉得,之后token的规模还会继续扩大,其中很大一部分都是在AI自己的系统里转,来为你产生最终智能。比如哪一天AI系统足够聪明,我说你去解决癌症,然后它在那慢慢解决,大部分token是在它自己里头转。

但如果我们会希望它在有限时间内解决,比如我想让AI系统判断明天股票市场怎么样,它如果用两天时间想这个问题,那回答没有任何意义。

所以我们为什么觉得时间是非常重要的本质约束:世界不会为任何事慢下来,很多事情需要在确定时间点之前得到答案。我们希望在确定时间节点里获得更多智能,这个就翻译成“快”。

图片

泓君:现在很多国产芯片,甚至英伟达的芯片,大家有一个宣传出来的纸面算力值,但真实用起来感觉算力没跑满,有时连对折都不到。这中间消失的算力去哪了?为什么会有一部分算力浪费?为什么达不到理论算力值?

Mark:我觉得分两部分。如果单纯讲算力浪费,现在很多workload,包括一些注意力机制、很多应用,它的计算和访存的比例没有长在英伟达GPU的“甜点”上。这可能是比较大的一些方向,因为你卡在带宽上了。计算机体系结构有一个roofline,如果是带宽瓶颈,算力显然用不起来。

另外,推理其实是非常快速、由很多细小算子组成的。你想,每秒钟两三百个token了,这时每一个token对应的计算任务非常细碎。相比训练都是大矩阵相乘,这种细碎会造成一部分调度的损失。

泓君:这是使用者用的问题,还是芯片设计的问题,还是软件层的问题?

徐子扬:三者都有。Mark说到的算力和访存那部分,就更本质一些,这个可能是硬件设计和现在用的workload应用不匹配造成的。

再技术一点,现在经常说芯片在等数据从别的芯片传过来,意思是我们在互联上卡住了。任何一个数据没有及时到要算的那一边,无论是因为这一片上的HBM带宽不够大,从那里读出来时间太长,计算单元空转;还是我要从别的地方传数据导致空转。最后导致计算单元在做矩阵乘法,现在模型里最大的东西就是矩阵乘法。

我们在算MFU,模型算力利用率,基本上只算矩阵乘法这一块。所以一旦矩阵乘法在空转,最后会得到比较低的MFU,我们就会说这个芯片没有被很好地用起来。

回到roofline model,在推理,尤其为了高单用户推理速度的场景,还有另一个场景叫MBU(内存带宽利用率),访存带宽有多少被用起来。比如带宽拉到100%,芯片是不是百分百用起来?也不完全是。芯片至少有两个单位:访存带宽有没有百分百用起来,算力有没有百分百用起来。

这回到第一点:如果我设计时带宽非常小,算力非常大,那我把带宽吃满时,我的算力可能还空着。

泓君:所以它是一个综合的问题。你们自己设计推理芯片时,会把这些考虑进去吗?理论利用率和实际利用率。

Mark:我们会考虑进去。怎么避免实际执行过程中的调度、摩擦导致利用率损失,这点可能是我们更多可以在芯片设计上做优化的地方。

图片

泓君:你们为什么要回国创业?

Mark:我当时回国不是因为创业这一件事回国,我在国内已经待了三年左右。我很多PhD朋友、导师都还在美国,所以每年也会去硅谷几次,和大家继续交流。

虽然现在国内有先进制程的实际的技术限制,但长远看,在一些更具挑战的方面,比如控制成本、性价比导向的供应链解决方案,国内整体环境有更大优势。

泓君:主要是供应链比较完善,供应商也比较多。即使团队在美国,可能也经常要回来看看硬件环节。

徐子扬:再本质一点,是搭基础设施的能力。因为我们本身搭的是推理基础设施,涉及几个核心点:数据中心在哪、怎么建、用水用电,中国有非常强的优势。另外,中国也是一个非常大的市场,它是能完全转起来的。

Mark:还有另一个角度。当时Groq和Cerebras做得比较艰难的点在于,美国最主流模型不是开源的。当你做一个很新的芯片,要让不懂你芯片的人适配你的模型,不太现实;要强行让自己适配一个自己不知道的模型,也不太现实。

所以当你做出芯片,更希望有一些开源东西可以拿来跑,在自己上面做出效果。但至少当时那些开源的,比如千问、Llama,显然不是美国最主流、用得最多的模型。所以他们在商业化上,短期只能看到开源模型的那部分小的市场。

但是国内反而倒过来。国内最强大的模型,以DeepSeek、智谱为代表,至少在架构层面更开放。从市场角度,国内可以稳定获取的最好的AI模型的API,其实也都是这些开源模型。

图片

泓君:Mark,当时你去斯坦福读PhD的时候,Bill Dally很有名嘛,是英伟达首席科学家,也可以说是整个芯片领域的GPU的奠基人,因为他在斯坦福做的流处理研究,变成了今天的GPU。当时你为什么选他做导师?你跟他的交流怎么样?

图片

Bill Dally 图片来源:NVIDIA

Mark:你说的stream processing(流处理),这其实是他2000年之前做的工作,只是后面NVIDIA更成功地把这个事情做了商业化。但他后面随着和NVIDIA合作,逐渐又在产业上主导了很多类似方向。

我大四的时候,Bill有一个马上就要毕业的学生韩松,他拉我过去,想让我帮忙做一些研究助理。那时候虽然是松哥指导我,但每周会和Bill有例会。

这个人给我的第一印象,是非常非常聪明。另外一个点,他在研究上看的问题是一些很本质的问题。他不会去解low hanging fruit,因为那对他的职业发展已经不重要。他是很资深的教授,没有任何短期学术压力,比如发多少论文。所以他看到的是一些更本质的东西。他实际上感兴趣的技术点,往往都是那些很难做,但一旦做出来,可能对整个学界、业界有非常大影响的点。这是我那时候开始就非常欣赏的他的特质。

泓君:你刚提到Bill看问题,会看到非常本质的地方。从你2017年开始读他的PhD,有哪些研究和交流,让你觉得他没有关注表面细节,而是直接戳到当前芯片设计最核心的环节?

Mark:后面我真的加入他的组里,跟他非常认真地做一些研究的时候,他当时非常感兴趣的点,我觉得除了他,没有人看到那个点。他当时去尝试做和现在深度学习完全不一样的另外一类——完全逻辑的AI的加速。

过去AI发展有两个不同分支:一个是偏深度学习、神经网络这种感知分支;另一个是强逻辑分支。强逻辑分支,大家往往会尝试构建很大的知识图谱,建立非常严谨的逻辑。现在就变成,比如大家尝试用AI证明数学定理。

泓君:那是哪一年?

Mark:2017年。但逻辑的AI的发展其实过去三四十年都有,而且到现在都有很强的应用,比如一些数学原理证明,再到芯片后面布局布线里,其实有非常强的逻辑AI参与。

所以Bill当时很感兴趣的点是:英伟达已经可以把偏感知的神经网络类AI加速得很好,但在他看来,未来AI是强逻辑与强感知的结合。强逻辑那一部分,当时基本没人在关心,因为之前几乎没有人做过针对性硬件,大家更多停留在软件层面。

那时候我们从头设计了一个全新芯片架构。它和现在CPU、GPU,包括我们想做的这些完全不一样,是专门加速这件事情的加速器架构。

从现在角度看,我知道硅谷很多创业公司,大家一开始有这样的想法:如何让现在这些语言模型Transformer更好地为数学原理、物理原理服务。我觉得这部分在未来可能也是很有影响力的芯片方向

泓君:所以你觉得他当时跟你们主导的强逻辑的芯片,就是重新设计的芯片,在今天的AI时代已经变成主要方向了,还是仍处在研发阶段?

Mark:我觉得它还处在算法研发过程中。本身解这个逻辑问题的算法非常固定,叫SAT(布尔可满足性问题)。但如何把这个问题和Transformer更好结合,让Transformer去把实际复杂的数学和物理问题拆解成这种强逻辑问题,我觉得是现在很多尝试做AI for Science的公司在做的事。现在算法层面还没有收敛。未来如果大家发现它真的很有效,以及未来如果科学探索的瓶颈真的落在“如何更快地求解复杂逻辑问题”上,那对芯片和硬件的需求会是确定的。

泓君:你觉得他给你的启发,更多是在芯片领域、学术领域,还是在思考方式、沟通方式、人格特质方面?

Mark:我觉得是后者。刚提到我跟Bill做的第一个项目,之后包括我的博士论文,很多东西并不一定是某一个确定方向。比如大家会看到他现在是GPU的奠基人,但我觉得本质上,他并没有和GPU绑定。GPU只是结果。原因是他是一个非常好的研究人员、非常好的架构师,所以能发现最重要的东西是什么,并以最好方式做出来,这成就了现在的GPU。但他对我影响更大的,可能是一些芯片设计、系统设计,甚至怎么做研究,更本质的需要关注的一些点。

举一个例子,我们现在做的很多芯片会围绕一个点去出发,叫locality(局部性)。而这件事情最早我是从Bill那里得到了非常大的震撼。他跟我说,整个芯片设计,一切都是围绕局部性去展开的。

泓君:什么叫局部性?

Mark:局部性就是location,位置,把东西放在那。他的原话是——“计算机系统结构就像房地产,一切都在于位置、位置、位置”。比如CPU里Cache(缓存)的设计,本身就是一种时间局部性和空间局部性的使用。

时间局部性,就是如果我用了一段数据,那未来一段时间大概率会重复使用这段数据。空间局部性,就是如果我用了一段数据,那大概率马上会用到它周围的一部分数据。

我们现在做AI芯片,要考虑把模型权重存在哪、为什么想用SRAM,就是希望提供最好的局部性。因为在AI时代,尤其做推理decode这个过程,时间局部性和空间局部性在算法上都被抹平了,这些都不复存在了。所以我们就要在架构上做更多实际硬件上的局部性,来弥补这一点。

在思考怎么更好地做事,或者找到更值得做的事的时候,我觉得他的逻辑是要找到最难的事情,找到对整个系统影响最大的那个点,并尝试解决它。他会关心trade-off。当你只做微小提升时,其实可以保全大局,不需要做颠覆式修改。但如果你要做很难的、数量级的提升,你一定要很清楚想明白:哪些东西可以牺牲,哪些东西真正关键。

只有想明白这些问题,你才能在整个系统层面做出更关键的选择,才能跳出local minimum(局部最优),找到全局最优解。

泓君:很有意思。这个就是说,我们不要去做微创新,要找到最难的那个问题,从全局角度做颠覆式创新。但它意味着失败概率很高。你跟Bill合作过程中经历过失败吗?

Mark:非常非常多。但我刚刚说的点,其实和成功失败没有关系。它是你做事情的逻辑:什么样的事情是Bill觉得值得做的,以及现在是我们觉得值得做的。做的过程中,肯定会有很多失败。但他不会因此否定你要解决的问题,你可能只是没有找到正确解法,甚至这个解法可能是没有的。

泓君:我觉得这段非常鼓舞人心。你回来创业,Bill Dally给了你什么样的建议?

Mark:我跟Bill会讨论很多技术细节。比如当时我有一些想法想用SRAM来实现,我会跟他讨论非常多。因为我现在想做的很多东西,和我当时PhD跟他一块做的东西,从方法原理上讲很相像。具体创业建议的话,Bill给我的建议就是:一定不要用PhD写的代码,因为这是Bill上一个创业里的惨痛教训(笑)。

泓君:他的整个特质还是更偏一个科学家。

Mark:正是这样。Bill当时给我另外一些点,其实是怎么做研究。但我现在会发现,那些东西并不一定是做公司最好的点。他认为做研究的本质,就是用最小的代价获取最多的知识。所以当时比如涉及流片,用科研经费把片子造出来,在Bill看来完全不必要,因为你已经在流片之前获得99%的知识了,除了工程实现,流片本身并不能带来额外的东西。

现在创业这件事,其实就是你要去解决剩下1%工程上的事,而且这部分可能要花费你99%的精力,但它对这件事能不能做成的贡献没有那么大。你在做工程之前,就可以从设计的角度知道这件事技术瓶颈在哪、能不能做。但实际工程上要解决的实际设计、散热、供电问题,是你要花很多精力去真的把它做出来的。

图片

泓君:今天是我们在节目发出前的一次补录。6月24号,OpenAI跟博通发布了第一颗自研推理芯片Jalapeño。子扬,你们这些天有没有研究OpenAI的推理方案?它跟你们想的思路有什么不一样?

图片

OpenAI首颗自研芯片Jalapeño 图片来源:OpenAI/X

徐子扬:我们在Jalapeño出了以后,认真探索了一下他们公开资料有的信息,包括在HotChips分享的一些内容。

首先,他们做的芯片目前是AI推理芯片,但定位是一个通用AI推理芯片,和GPU还是比较接近的。它的通用性体现在,可以跑各种模型,甚至能跑一些游戏的demo。

我来说几个我们看下来的侧重点,包括和我们不一样的点。

最重要的一个,是电的效率和钱的效率。OpenAI对电的效率非常敏感。因为现在美国数据中心缺的并不是资本和空间,而是电的供给。所以它非常需要用同样的电,产出更多的token、更多的智能,也意味着更多的收入。我们看到这颗芯片在功耗上做了很多工作,所以它的每瓦或每兆瓦能产出的token数,是大于英伟达对应的Rubin架构的。

另外一个特点,它是通用的,这包含很多意涵。首先通用性体现在,它把我们之前说的一些异构部分,包括prefill、decode,还有attention、FFN,都用一颗芯片全包了。它在设计上,加入了对小维度矩阵乘法的支持,所以在batch size比较小的情况下,性能也能做到比较好。

还有一些公开信息,甚至说它下一代要去支持训练。所以它在通用性上,和我们,包括Groq、Cerebras的系统级异构的思路有一些不同。

还有一个小特点就是,用了很多AI来帮助,包括从软件栈上看,它的Gluon写的kernel,很多优化都交给了Codex。另外它的芯片设计,无论是性能优化,还是从项目启动到流片的速度,都比我们之前看到的芯片项目有明显提升。它说启动到流片用了9个月。

泓君:这个速度相当快了。我其实有一个疑问。当时我们录播客时讲到,业界推理芯片在向SRAM路径收敛。但我们看OpenAI这颗芯片,它并没有走这条路,而是把HBM4带宽堆到单封装15.4TB/s。同样是解决带宽问题,但HBM是挺贵的一条路。为什么他们会选这条最贵的路?

徐子扬:这个贵代表,你买对应芯片、买存储、买存储带宽,价格比较高。但其实OpenAI最本质的限制在于电。它可能对资本开销、对造芯片成本没那么敏感。

这也和中美在算经济账上不太一样。中国电的比例比较低,占1/3甚至更少;美国是2/3,更多是电。但成本只是一部分,另一部分是供给。美国的电,每一年能提供多少新增的电的产能,是比较明确的。如果想在这个确定产能内产出更多token、更多智能,其实更关心的是芯片把电转换成token的效率。

OpenAI相对不那么关心我们之前提到的SRAM最本质的优势:每一块钱能买到的带宽比HBM高很多个数量级。这一点转化成的是,你最后花同样价格生产芯片,或同样芯片产能去生产产品,能得到更多的token。但目前OpenAI更关心另一个指标:从电的角度。

泓君:总结来说还是第一点,省电。

徐子扬:反过来说,为什么SRAM相对没那么诱惑?SRAM带宽非常高,但容量受限,所以在做芯片通用性上比较受限。包括我们自己的方案,包括Groq、Cerebras的方案,都会做一种系统级异构,一颗芯片要去和别的芯片配合。

但我们看到OpenAI选择做一颗更通用的芯片。这个我们上次讨论说到了,模型公司和云厂商业务比较多元,也有训练需求,模型五花八门,语音、图像模型也要跑,所以对芯片通用能力要求比较高。

做芯片都是trade-off。当你的需求点,有些对容量要求很高,有些对带宽要求很高,那就要找一个更全能的、可能更贵的解决方案。那最后就指向,在这个点上HBM的确做得很好,尤其HBM4带宽比之前也有很大提高。

泓君:那如果是长上下文的KV cache,HBM的方案会比SRAM有优势吗?

徐子扬:这涉及的还是要不要做异构。包括我们自己想的方案,和Groq跟GPU结合的方案,其实都是把attention这一部分的KV cache放在另外一块芯片上,不是SRAM方案上。

至于长上下文,它对KV cache、对容量需求有多大,我们看到最近几个月有非常大的变化。包括DeepSeek新模型出了之后,它的第一张图就是每一个token的KV cache,这个数字每一代都在往下缩,这次缩了1/4到1/8。所以我们之后遇到长上下文,它对容量有多大需求,这是一个正在变化的事情。

但因为它的需求是动态的,并且随着用的人数、随着上下文增长,它会不断地变大,所以一定程度上对容量的性价比有要求。这一点就落在了SRAM不太舒适的区间内。所以我自己想这个问题时,我们不会优先考虑用SRAM去存KV cache。

泓君:HBM每一代带宽提升比SRAM密度提升要快,那SRAM路径的优势窗口会不会在两三年后就关上了?

徐子扬:我们看HBM带宽增长,虽然现在已经做到一个很好的数字,但它带宽增长其实也没有大家想得那么乐观。包括这一代之后带宽增长从哪里来,也不是很确定。

从第一性原理去思考,如果你的连线还是通过走着某一种铜线(它不一定是铜线,区别于光刻出来的线)在一个带内走线,它的密度是有天然瓶颈的。

包括我们看到HBM一定程度上走到极限,是会从边上走线变成面上走线,类似一些厂家在做3D DRAM。这些都是未来存储很有前景的方向,但它最后会落在整个trade-off空间里的不同点位上。我们现在看,在带宽这个点位上,HBM也好,其他HBF等等也好,很难达到SRAM的带宽绝对值和性价比。

泓君:你觉得SRAM现在相比其他方案有哪些缺点?

徐子扬:最大缺点其实就是容量的性价比。因为它要用6个晶体管锁1个比特,而且一般来说,为了达到这个带宽,要放在同一个die(晶片)上,SRAM的堆叠其实会降低它的带宽。所以在这个点上,它容量性价比非常低。如果我们对存储有很大需求,需要存非常多数据,那SRAM可能不是最优方案。

但这个要分成两个问题讨论。你要存的数据量可能很大,但它是一个固定量时,比如我们要把模型权重全部存在SRAM里,那我们可以用很多个芯片组成一个集群去做,这个还是在SRAM可以接受的空间内。

但如果你要存的数据变化很多,并且可能未来持续增长,比如KV cache,那我们就认为它在容量上受限这个缺点,会使得它不适合这个场景。

泓君:了解。上一次录播客时,你说你觉得业界推理芯片方案在向SRAM收敛。OpenAI这个芯片出来后,你还会保持这个判断吗?

徐子扬:我觉得在一定程度上,在这个大的系统级异构趋势中,为了提高token性价比,还会有很多公司向SRAM收敛。

但的确,OpenAI提出的这个思路有非常有意思的地方。它其实是把异构这一点做进了一个芯片,就它的芯片里有很多部分,它们之间是异构的。OpenAI提出了一个dark silicon(暗硅)概念。当然这个概念一直都存在。OpenAI认为它比较容易接受这个成本代价:拿这一颗芯片去做不同的事,做某些事时,可以把其中一些部分关掉,或者降低功耗。

这种异构和我们想的系统级异构最大区别,其实还是它用了更多成本去买这个芯片,但可以做到电的效率更高。所以从per dollar角度,它这个方案其实不会很好。我觉得这涉及不同市场条件下,限制条件不同,会收敛到不太一样的地方。

我们看到,在对带宽要求非常高和带宽性价比非常高的地方,还是会收敛到SRAM方案。但如果电是第一限制,那OpenAI这个方案也是一个很好的解决方案。

泓君:你们研究他这个方案时,会觉得对你们现在做芯片的思路有什么启发吗?

徐子扬:我觉得对于AI的使用上,一部分验证了我们的一些想法,包括软件栈能被AI快速提升,比如AI怎么来做芯片设计和优化,这对我们其实有一定启发。

异构是发生在系统级,用不同芯片去组异构,还是发生在芯片内,在芯片内用不同单元去组异构,我觉得这其实就是在不同市场下,限制条件不一样,会走出不一样路径。这个我们看清楚之后,觉得我们的一些想法还是成立的。

泓君:异构发生在芯片内,现在业界是只有OpenAI这样做了,对不对?

徐子扬:异构发生在芯片内,这是OpenAI比较明确展示出来的。但比如原先英伟达GPU,也可以理解为异构发生在芯片内,只不过它是一个通用芯片,更强调通用性,没有像OpenAI去说,我把不同需求放在一起,并且通过各种方式能关闭一些东西,来提高电的效率。这是我第一次看到这样一个解决方案。

异构发生在系统级,包括之前讨论的Groq、Cerebras,和现在很多AI芯片,其实都在往系统级异构方向走,一些芯片配合做不同事情,包括PD分离(prefill/decode分离

这个大的场景下,包括训练和推理分离,这些都是异构发生在系统级。

泓君:你觉得现在,或者说未来,整个推理芯片市场,还会是英伟达的天下吗?整个市场格局会变成什么样?

徐子扬:这个问题很难回答。我们当然不希望它是英伟达的天下。如果那样,就意味着这么多在做有意思探索的公司都很难存活,包括我们。

我们看到了,以GPU为核心的英伟达,在尝试其他技术探索时,它在迭代速度和方案选择上可能会有一定限制。所以我们也看到,有很多在做的新的方案,其实不是从英伟达出发的,包括Groq。也看到英伟达去acqui-hire了Groq。

所以我没有办法直接回答这个问题。但我们希望整个AI芯片变得更多彩一些,方案变得更多一些,这也符合我们对整个异构的认知。


今年10月10日—11日,硅谷101年度科技大会Alignment 2026将再次回到硅谷,用整整两天时间,带你抵达AI变革发生的最前线。

扫描下方二维码,或点击阅读原文,了解大会详情并报名,使用折扣码 FANS15 注册,还可以获得15%折扣。

文章标签OpenAI芯片算力
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多