Token导航 LogoToken导航TokenDH.com

英伟达副总裁Ian Buck:从 Vera Rubin 平台看 Agentic AI 时代的算力演进

更新时间 2026-09-20来源 Andy730正文 7287字阅读约 23分钟13 张图片

AI 时代的硬件降本逻辑重构

“降低词元成本最有效的方式,绝非降低 GPU 售价或使用低成本网络,而是每一代都交付大幅提升的算力性能。如果将节点或机架的性能提升 10 倍到 30 倍,这种性能提升会直接作用于计算公式的分子,从而降低整个数据中心每个词元的成本。”

解析

传统 IT 采购习惯通过压低硬件单价来控制成本。然而在 AI 工厂时代,算力性能的提升呈指数级(10 倍至 30 倍),对 TCO 的拉动作用远超芯片单价的微调。因此,通过提升性能来摊薄单位算力成本,远比单纯采购低价硬件更为高效。

Agentic AI 排除人工干预,引发算力消耗剧增

“智能体让人类退出了这个交互循环,计算资源的消耗速度完全取决于智能体自我转折与思考的速度。以前服务设计者可以依赖‘人类阅读和打字需要时间’这一间隙来调度算力,而现在智能体自我提问和转折极快,在 AgentX 基准测试中,算力需求在纯数值层面直接提升了 100 倍。”

解析

从 Chat 模式跨越到 Agentic AI,算力需求迎来了范式转变。过去云服务调度的底层假设建立在人类反应与输入速度受限的基础上,而 Agent 移除了 Human-in-the-Loop 的缓冲,使算力进入无缝且高频的满载状态。

评价 AI 芯片的核心指标发生转移

“对于每一代算力产品,我们考虑的不只是绝对词元性能,唯一关键的指标是每兆瓦(MW)的总词元吞吐量。提高这一指标,就能提升 AI 工厂产生营收的能力。”

解析

AI 硬件评价体系正在发生重塑。行业评估标准已从追求单芯片 FLOPs 或单卡跑分,转向评估数据中心的电能转换效率(Tokens per Megawatt)。算力的核心价值不再局限于峰值性能,而是体现为将电能转化为实际营收的效率。

通过软件挖掘数据中心 40% 的隐性产能

“通过软件在机架与固件层面动态管控功耗,确保其永不超出阈值,可以在完全相同的预留电力包络下部署多达 40% 的机架,直接将吞吐量提升至每秒 12 亿词元。”

解析

数据中心按照硬件最大峰值功耗预留电力的静态部署模式已被打破。在电力供应受限的客观条件下,利用 MaxLPS 等软件定义电力技术,无需新建数据中心或增加电力配额,即可在原有电力包络内提升 40% 的 GPU 部署密度。

Ian Buck:从 Vera Rubin 平台看 Agentic AI 时代的算力演进

目录

  1. 引言:二十五载计算演进与数据变换的力量

  2. 范式转变:从2023年的Chat基准测试到智能体AI工作负载

  3. 认识Vera Rubin:面向智能体计算的全栈架构

  4. 极致延迟与吞吐量:Groq LPU集成与Olympus核心

  5. 生态系统与扩展:NVLink Fusion、智能存储与MaxLPS功率管理

  6. 展望未来:按年度节奏交付AI基础设施路线图

引言:二十五载计算演进与数据变换的力量

Ian Buck: 今天我将分享如何面向智能体AI时代推进基础设施建设,这本质上代表了推理含义的新时代。我会从我的工作视角分享一些看法,并介绍我们正在研发的创新技术,让这里的社区了解我们正在构建的产品。同时,我也会详细介绍Vera Rubin,说明过去几年甚至仅在过去一年中发生的巨大变化,以及我们在高层面采取的应对措施。

我认为计算的领域极其广阔。Ian和Patterson博士解释过计算如何改变了他的视角,从早期的磁芯存储一直延伸到今天与未来。这切实展示了计算基础设施与计算能力的重要性:将数据进行变换,获取信息后施加计算并输出结果,再反馈回来重新变换。这就是价值创造的本质。存储信息很重要,传输信息也很重要,但价值是在计算以及将实际数据变换为计算的过程中产生的。

从我们的角度来看,这个平台规模巨大。我在NVIDIA工作了近26年,这一切显然始于将一种全新的计算平台上线,即CUDA。从那时起,它的应用范围得到了极大扩展。这张图展示了使用我们GPU的人群多样性,涵盖超大规模云服务商、AI原生企业、初创公司、各大AI实验室、企业客户以及边缘端。这融合了AI模型与传统模拟计算,或者说是两者的结合,因为它们如今在相互支持。

现在Hugging Face上已有超过300万个模型,其中约3000个模型占据了约90%的下载量。模型的多元化在持续扩展,工作负载正从计算机视觉扩展到物理科学、生命科学、语音、自然语言以及机器人技术。我们拥有用于量子计算和模拟的AI模型,也有正在探索全新架构的多模态与前沿模型。在此之上,还有一整套用于计算的模拟库和应用,覆盖计算光刻、决策制定、医学成像、天气分析到基因组学等各个领域。

计算已成为科学研究、工业生产、消费者互动和企业计算不可或缺的能力,横跨AI与模拟计算。我们目前有超过8000个主要的CUDA应用运行在这些平台上,而我们构建这个平台已经有大约25年了。

 范式转变:从2023年的Chat基准测试到智能体AI工作负载

现在的状况如何?这就是Vera Rubin。它的设计初衷是成为下一代推理与智能体平台。显然,我们继续支持大规模训练,这也是我们能够提供的能力。但让这一切落地生根的是AI工厂,而Vera Rubin就是为此而设计的。

它建立在丰厚的生态系统之上。我们在全球可追踪到有超过1000万名开发者在NVIDIA GPU上进行开发。它涵盖云服务商、网络服务商、OEM和ODM。有超过300家主要公司构建了供应链来协助交付这个平台,看着这一切发生令人惊叹。

它具有极高的通用可替代性。我认为这也是它能够为全球带来巨大价值和帮助的原因之一:你提供了一个可以运行所有工作负载和每个模型的计算平台,无论是开源模型、闭源模型还是前沿模型。它可以支持预训练、后训练、推理、智能体AI以及加速计算,所有这些都在智能体工作负载中同时调用。

此外,它具有很强的耐用性。David提到GCP中的GPU仍在提供最初的Voltas,那可以追溯到很久以前,几乎有十年了。你仍然能看到我们十年前发布的GPU在创造价值。事实上,如果你追踪我们在COVID初期发布的A100的每小时实例租用价格,就会发现它随时间推移不降反升,且需求依然强劲。

那么软件层面发生了什么变化?变化最显著的是工作负载。最初的大量基准测试是基于Chat进行的,那是2023年突破性的工作负载,后来成为MLPerf Inference等基准测试的基础。它当时大约有1K的输入词元数量,用于系统提示词和其他用户数据的KV Cache大小可能在4K左右,人们以多轮对话的方式与它交互。你提出问题,它给出回复,然后你可能再追问,平均大约三轮对话。这是一种人机回环(Human-in-the-Loop)模式,当时还没有智能体,但这成为了基准测试和理解我们价值的基础,即运行此类工作负载的效果如何,无论是DeepSeek模型还是类似于ChatGPT的闭源接口。

如今,智能体AI已截然不同,它带来的挑战超乎想象。它的需求极其严苛,在纯数值层面提升了100倍。这是来自AgentX基准测试的数据,虽然不能说代表所有人,但对比我们今天的基准测试与以前的推理,平均输入规模达到了142000个词元。而且它是动态的,你需要支持从1K、10K、100K一直到142K、200K甚至更长的短输入。每一种输入长度都需要一整套全新的算子内核优化、调优和数学计算调整,这极大增加了软件优化的复杂度。

KV Cache的规模变得异常庞大。模型开始支持多达100万个词元。你开始时规模可能很小,但随着智能体进行多轮交互(现在不再是人在回路中,而是智能体在不断自我提问),上下文会持续累加。现在所有这些KV Cache都需要在整个数据中心范围内进行管理。

最后,交互轮数呈爆发式增长。以前服务设计者可以依赖这样一个事实:人类需要花时间阅读答案然后再给出下一个提示词,这使得任务调度相对容易。现在智能体让人类退出了这个循环,计算资源的消耗速度完全取决于智能体自我转折的速度,这种速度非常快。

在AgentX基准测试中,他们只设置了大约四个子智能体,而我们在商业服务中拥有成千上万个智能体,但它们都需要进行智能路由。模型现在必须做出决策,并在整个平台中调用所有这些不同的子智能体,且KV Cache需要在所有环节中得以保留。

如果审视工作负载的结构,会发现它复杂得多。过去只是词元输入、运行模型、词元输出,现在则涉及调度CPU通过Helm Charts管理动态Kubernetes容器。我们有LLM负责处理上下文和观察数据,另一层负责推理,还有一层负责决定在下一轮中调用哪些子智能体或工具。

最后,我们还要运行所有这些工具:有些基于CPU,有些需要GPU,有些是模拟计算,有些则是加速计算。在此之上,我们有CPU集群在管理和监控安全与治理。我们不希望智能体发生幻觉、产生错误想法或浪费时间和词元营收资金,因为那会导致系统崩溃。所有这些都需要在内存上下文窗口中进行管理,而作为模型工作知识库的上下文窗口也因此发生了爆炸式增长。

 认识Vera Rubin:面向智能体计算的全栈架构

这就是Vera Rubin的设计初衷。当我们发布它时,我们谈论的不是推出单芯片,也不是降低单个LLM模型的成本,而是要能够运行整个工作负载。

在基础平台方面,Vera Rubin NVL72建立在我们为Grace Blackwell所做的基础之上,并扩展了其能力。当我们希望从用户词元角度实现更快速度时,我们还加入了基于Groq LPU技术的加速包。对于这些高价值工作负载,我们可以进一步提升平台性能。

在此之上,智能体CPU至关重要。我们必须能够快速、高效、满载地完成所有工具调用和计算,从而将结果快速返回给用户。我们绝不希望CPU拖慢整个技术栈的运行速度。

最后,所有KV Cache都需要在智能存储中进行管理。随着系统内部流动着各种上下文,所有数据都需要被管理、治理并集成到软件定义网络中,同时在后台进行优化时对KV Cache执行索引和向量检索。这就是为什么我们针对存储推出了BlueField,与所有构建这些系统的存储合作伙伴合作,由我们向他们提供SmartNIC和计算平台。

再来看规模化网络。这些模型非常庞大,单个GPU根本装不下。事实上,目前所有人都在做解耦推理。我们去年讨论过Dynamo软件,如今它已经广泛应用。每个人都在将Prefill阶段与Decode阶段分离运行,并在其上管理所有KV Cache,从而获得最佳的词元速率和吞吐量。要连接所有这些组件,需要网络基础设施的支持。当然,所有这些设施也可以用于RL和后训练阶段的训练过程。

这些是刚刚发布的SemiAnalysis智能体基准测试在Vera Rubin上的运行结果。通过与整个生态系统在开源和闭源模型上的全栈协同设计,它在智能体工作负载上实现了30倍的AI工厂吞吐量提升。事实上,根据你在帕累托曲线上观察的位置不同,部分场景下的性能提升甚至高达60倍。

左侧是每兆瓦(MW)的总词元吞吐量。所有这些数据中心都受到兆瓦(MW)功耗的限制。对于每一代产品,我们考虑的不只是绝对词元性能,关键指标是每兆瓦(MW)的总词元吞吐量。提高这一指标就能提升AI工厂产生营收的能力。

如果你在运行像DeepSeek v4这样的模型,你会希望思考速率达到每秒100个词元以上,以便计算出答案并快速返回。事实上,你可能希望进一步提升到每秒200至250个词元,这样智能体就可以进行更深度的思考,并在65轮交互中更快给出答案,无需让用户等待太久。

此外,我们还必须降低每百万词元的成本。这张图展示了对比Grace Blackwell与Vera Rubin生成词元的成本。可以看到,由于性能提升,成本大幅下降。我们降低成本最有效的方式就是每一代都交付更强的性能。如果我只是降低GPU芯片的售价,或者采用成本更低的网络,我只是改善了这个庞大数据中心里的一个细小环节。如果我将那个节点或机架的性能提升10倍或30倍,这种性能提升会直接作用于公式分子,从而降低整个数据中心每个词元的成本。

 极致延迟与吞吐量:Groq LPU集成与Olympus核心

如果我们希望思考得更快、更积极,并能够执行快速交互,该怎么做?在许多应用场景中智能体举足轻重,我们希望将它们置于关键路径上,用于实时业务分析或前沿计算。我们可以进一步提升Vera Rubin的性能。从Blackwell到Vera Rubin,我们提升了整体用户交互体验。但如果我们想追求极致,从每秒数百个词元提升到单用户每秒数千个词元,我们可以借助Groq技术进一步释放性能。

这些是最新出来的测试数据。对于像Gemma 4或Qwen 3.8这样拥有100K长上下文的模型,我们在Gemma 4上可以实现每用户每秒3400个词元,在Qwen 3.8上可以实现每用户每秒2529个词元。在大上下文场景下这个速度非常惊人。上下文越长,模型为了生成每个新词元就越需要检索整个对话历史,这增加了计算量,但这也是智能体应用场景所必需的。

工具调用极为关键。全球不仅缺乏数据中心和GPU,也同样缺乏CPU。虽然此前人们使用连接到Blackwell的Grace CPU来进行工具调用,但我们现在看到了对用于智能体计算的高效快速专用CPU的需求。我们提取了原本连接到Rubin GPU上的CPU,构建了专用的Vera CPU机架。

什么是Vera?它采用了NVIDIA自主设计的Olympus核心。它的设计目标是实现高速度,在每个核心满载运行的同时,以最快的速度输出答案。我们通过定制的Olympus核心实现了这一点。

为了让所有核心高速运转且不产生瓶颈,核心与核心之间拥有极高的带宽。这是一个大型单片计算裸片,每个核心无需跨越Chiplet进行多跳传输即可访问内存,从而获得了极低的内存访问延迟。配合LPDDR内存子系统,它不仅功耗低,而且延迟比市面上其他方案低40%。在CPU计算中,内存延迟往往起主导作用。

这与云时代之前的CPU表现形态有所不同。过去的CPU具有高单线程性能但核心数较少,导致整体吞吐量较低。而在AI出现前的云计算时代,衡量指标变成了每个核心的成本,这拉高了核心数量,而单线程性能则退居其次。这就是核心数量激增的原因,因为当时云服务客户主要询问的是每个核心的价格,用于运行网页托管和数据库。

Vera的设计旨在让188个核心(开启SMT时为176个核心)保持高吞吐量,同时维持高单线程性能,确保词元延迟不受影响。

这些结果经由Signal65使用斯坦福大学的Terminal Bench基准测试进行了验证。我们在80多项测试中运行了Terminal Bench的CPU端任务,Vera展现出了1.6倍的性能提升。智能体完成工具调用的速度提高了60%,在编译代码、运行Git和代码验证等核心智能体任务上的处理速度最高提升了2倍。

客户已经开始寻求部署这款产品。Perplexity Space发现,任务执行往往受限于创建沙盒的速度。通过引入Vera,他们观察到沙盒启动、执行快速计算并关闭的整体速度提升了1.5倍。

ClickHouse是一个被各大前沿实验室用于安全与治理的实时分析型数据库,他们在Vera上运行了其公开基准测试套件,结果位列榜首。

Vera目前已正式发布,早期采用者涵盖Oracle Cloud Infrastructure(OCI)以及多家系统厂商。

 生态系统与扩展:NVLink Fusion、智能存储与MaxLPS功率管理

NVLink是实现AI与推理高速运行的关键要素。从无NVLink到8路互连,再到完整的NVLink 72,它显著改善了帕累托性能曲线。NVIDIA是一家网络技术公司,我们正在通过NVLink Fusion计划向所有人开放NVLink。芯片设计者只需设计自己的XPU加速芯片,通过与NVIDIA合作,即可对接我们的NVLink Chiplet IP和NVHBM技术,从而直接融入完整的NVLink生态系统。

早期合作伙伴包括初创公司The Matrix,他们正在为其下一代Raptor XPU采用NVLink Fusion,以连接Vera和NVLink Switch机架,构建包含The Matrix芯片的完整NVLink 72架构。亚马逊AWS及Annapurna Labs也在与我们合作,将定制IP集成到NVHBM的基底裸片中,在其定制芯片上释放出30%至40%的计算资源,同时利用NVIDIA SerDes实现更高的带宽和更低的延迟。

在数据中心层面,随着我们专注于提升每兆瓦(MW)或每吉瓦(GW)的推理效率,一个核心问题是数据中心内部可以容纳多少GPU。工作负载的功耗特征是动态变化的。即便在DeepSeek-R1上,GPU功耗也会根据不同阶段在600W(瓦)到1900W(瓦)之间波动,导致预留的电力资源未能充分利用。

为了解决这个问题,我们与生态系统合作开发了名为MaxLPS(Max Land Power Shell)的软件。MaxLPS能够在Vera、Rubin和NVSwitch层级动态管理并限制机架和固件层面的功耗。通过与数据中心管理软件协同,运营商可以在完全相同的电力包络内部署多达40%的机架(例如在吉瓦级数据中心内从4000个机架扩展到5600个机架),将词元吞吐量提升至每秒12亿个词元。

Lambda验证了这一软件栈,Dave Ward指出,在相同的兆瓦(MW)容量下,可部署的GPU密度得到了显著提升,B200提升了约25%,Vera Rubin上则可提升高达40%的计算资源。

展望未来:按年度节奏交付AI基础设施路线图

NVIDIA始终坚持严格按一年为周期推进路线图。在Vera Rubin之后,我们接下来的演讲将介绍Vera Rubin Ultra,随后是Feynman架构以及Feynman Ultra。您可以确信NVIDIA将保持年度发布节奏,持续推进AI词元工厂、推理以及数据中心规模的智能体基础设施建设。

非常感谢大家的时间。

本文来源:Andy730

风险提示及免责条款
市场有风险,投资需谨慎。本文不构成个人投资建议,也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资,责任自负。
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多