Token导航 LogoToken导航TokenDH.com

卖铲人亲自下场:英伟达开源多模态大模型,锁定万亿算力帝国

更新时间 2026-05-19来源 田丰说正文 5385字阅读约 17分钟15 张图片

作者:快思慢想研究院 田丰,第四波智库研究员 王兆昱

编者按:英伟达免费送出AI的"眼耳鼻",背后是一场比出口管制更隐性、更深远的产业卡位战

一、一个不寻常的早晨
图片

北京时间2025年4月29日凌晨,当大多数中国AI从业者还在熟睡,英伟达悄悄完成了一次意味深长的战略动作——以"开源"之名,向全球企业级AI市场投放了一枚精心设计的开源大模型。

这款名为Nemotron 3 Nano Omni的多模态大模型,融合了视觉、音频与语言处理能力,在视频推理场景下比同类开源全模态模型的系统效率高出9.2倍,在多文档处理场景下高出7.4倍。它支持256K token的超长上下文窗口,而Nemotron 3家族中更高层级的模型则支持最长100万token的上下文窗口,能一次性吞吐企业级长文档、长对话乃至整个代码库。更关键的是——它免费开源。

图片

一家年营收1305亿美元、毛利率常年维持在70%以上的芯片巨头,亲手把自己的核心模型技术免费送出去,这件事值得追问:为什么?

经济学上有一条古老的格言,常被用来描述平台竞争的底层逻辑:免费从来不是慈善,免费是最贵的护城河建设方式。

二、AI Agent的"器官移植"难题
图片

要理解这场故事,必须先理解AI Agent当下面临的一个根本性困境——模态割裂。

想象一个企业部署的AI Agent,它需要完成一项看似简单的任务:查看一段工厂监控视频,听取一段语音指令,阅读一份质检报告,然后给出处理建议。在现有的架构下,这个Agent需要分别调用视觉模型、语音识别模型、文本理解模型,再用一个推理模型整合输出。每个模块之间通过接口传递数据,上下文无法共享,信息在流转中衰减,延迟层层叠加,成本同步攀升。

H Company的CEO Gautier Cloix描述过一个真实的工程痛点:"要构建有用的Agent,不能等几秒钟让模型解读一块屏幕。"这句话揭示了一个工业级AI部署中几乎人人心知肚明却鲜少被正面讨论的瓶颈:AI Agent的"感知系统",长期以来是企业自己东拼西凑的"义肢",协同笨拙,延迟高企。

图片

Nemotron 3 Nano Omni的设计逻辑,正是从这个痛点切入。它基于30B-A3B混合MoE(混合专家)架构,底层融合了Mamba与Transformer的混合设计,将英伟达自研的视觉编码器C-RADIOv4-H和音频编码器Parakeet-TDT-0.6B-v2整合进同一个神经网络骨架。图像、音频、视频、文字这四类模态信号,全部流经同一个混合专家网络,系统根据输入内容类型自动激活对应的专家模块,其余保持休眠。

这套架构的效果,是把AI Agent分散的"器官"整合成一套原生协作的感知系统。英伟达的说法是:此前AI Agent的眼耳鼻是企业自己拼凑的义肢,Nemotron 3 Nano Omni要给AI Agent配上一整套原装器官。

在基准测试中,这套“器官”(模型)表现不俗:MMlongbench-Doc、OCRBenchV2等复杂文档智能榜单第一,WorldSense和DailyOmni等视频音频理解榜单领先,VoiceBench音频理解测试领先准确率,共在六大权威榜单上位居第一。首批采用这一模型的企业名单,也颇能说明问题——富士康、Palantir、Oracle、Dell Technologies、Docusign。这些名字锚定的是工业质检、企业文档处理、客服语音分析、屏幕操作自动化——清一色的企业级硬核场景。

第四波科技智库特约研究员、盘古智库高级研究员江瀚指出,Nemotron 3 Nano Omni大幅降低了企业部署AI Agent的技术门槛和成本,有可能在办公自动化、工业质检、智能座舱等垂直场景掀起真实的落地浪潮——这正是此前因感知层碎片化而迟迟无法规模化的场景。

三、卖铲人为什么要亲手挖矿?
图片

这里存在一个让很多人困惑的表面矛盾:英伟达一直是公认的"AI淘金热里的卖铲人",靠着向所有参赛选手卖铲子赚得盆满钵满。现在它亲自下场做模型,是要和自己的客户抢生意吗?

这个判断,恰好理解反了。

理解这件事,需要借助一个来自科技产业史的经典类比。2007年,谷歌将安卓系统开源,很多人当时也问了类似的问题:谷歌放弃控制权,这不是赔本买卖吗?十年之后,答案浮出水面:谷歌将安卓开源,不是为了失去控制权,而是以开源换生态规模。生态规模扩大之后,谷歌牢牢锁定的,是安卓平台上的广告变现层——那才是真正的金矿。

英伟达的逻辑与此如出一辙,只是变现层换了位置。

Nemotron系列模型在架构上针对英伟达硬件进行了专项优化——Ampere、Hopper、Blackwell三代GPU架构均有硬件感知优化推理支持。这意味着,Nemotron在英伟达GPU上性能最优,而在其他硬件上则有不同程度的性能折损。这里存在一个精心设计的环形逻辑:英伟达的模型在英伟达的GPU上性能最优;英伟达的GPU为英伟达的模型定制优化;开发者选择模型,就在不知不觉间选择了GPU;更多GPU部署,反过来强化模型的性能优势。

图片

数字是最好的证明:Nemotron家族模型在过去一年内的下载量已超过5000万次;CUDA平台已被全球600万开发者采用;英伟达在GitHub上维护超过1000个开源资源,在Hugging Face上发布了450个模型。黄仁勋曾亲口说:"开放创新是AI进步的基础。通过Nemotron,我们将先进AI转化为开放平台,赋予开发者构建大规模Agent系统所需的透明度与效率。”

翻译成产业竞争的语言就是:开放给开发者,锁定给英伟达硬件。

英伟达FY2025全年营收1305亿美元,同比增长114%,毛利率维持在70%以上。这组数字证明,"卖铲"生意不但没有因为"做模型"而被稀释,反而因为模型生态的持续扩大获得了更大的杠杆效应。卖铲人亲自挖矿,吸引来更多人来买铲子的理由。

值得一提的是,开源模型本质上也是算力需求的强大放大器。正如DeepSeek V4的发布最终是利好英伟达和华为昇腾芯片需求的,Nemotron的广泛部署同样在为GPU创造更多消纳渠道。开源模型与芯片销售之间的收益体量相差悬殊,英伟达从未真正与其核心客户——模型开发商——正面竞争,它做的始终是:以模型生态撬动更庞大的硬件需求。

四、一场"Agent操作系统"的定义权争夺
图片

但英伟达的野心,还不止于此。

快思慢想研究院院长田丰指出,Nemotron 3 Nano Omni被设计为多Agent系统中的感知子Agent——专门处理视觉、音频和文本输入,与负责执行任务的Nemotron 3 Super和负责战略规划的Nemotron Ultra无缝集成,形成模块化、可扩展的Agent分工架构:感知层→执行层→规划层。这个设计哲学,揭示了未被充分讨论的产业图景:企业级AI Agent系统,未来不是一个超级大模型包打天下,而是各司其职的模块化协作体系。英伟达抢占的感知层,正是整个Agent系统中调用最频繁、对延迟最敏感的环节。

这一步棋,同时将英伟达的定位从AI基础设施提供商,延伸至运行在该基础设施上的模型供应商——与谷歌、亚马逊、微软的"模型+云"组合,形成直接的正面竞争。英伟达不再只是卖铲子,它开始在矿场里插旗。

图片

顺着这条路线延伸到终点,英伟达的终极目标清晰可见:成为事实上的"Agent操作系统"——硬件层是GPU,软件层是CUDA,模型层是Nemotron,推理服务层是NIM微服务。四层全栈锁定,任何一层的替换成本都极高。

AI知名研究者Andrej Karpathy曾描述过"平台战争"在计算机时代的历次演绎——从PC时代的微软Windows,到移动互联网时代的iOS与安卓,再到云计算时代的AWS与Azure。英伟达的Nemotron战略,正是这场平台战争在AI Agent时代的最新章节。

黄仁勋在2026财年Q4财报电话会上直言:"代理式AI的拐点已经到来,企业正在加速部署智能体。"这句话是一份战略宣言。

五、谁的蛋糕,正在被悄悄切走?
图片

Nemotron 3 Nano Omni在HuggingFace的技术说明文档里,藏着一个有趣的细节:该模型的训练过程中,将阿里千问的Qwen3-VL-30B-A3B-Instruct、Qwen3.5-122B-A10B、Qwen3.5-397B-A17B以及Qwen2.5-VL-72B-Instruct作为改进参考和对标基准。而在全模态竞争的正面战场上,Nemotron 3 Nano Omni与阿里的Qwen3-Omni形成直接竞争。

这意味着两件事:英伟达将阿里千问系列视为全模态赛道上最需要对标和超越的技术坐标;千问系列在全球多模态模型竞争格局中,已具备不可忽视的技术地位。

但英伟达的发布,仍然对中国AI产业链形成多层冲击,且冲击的路径远比"模型性能竞争"更为隐性。

图片

第一层:企业AI中间件公司。 智谱、百川、MiniMax等国内做"多模态感知+Agent编排"的创业公司,其核心价值之一在于帮助企业解决感知层的建设问题。当英伟达免费提供高质量多模态感知基础模型,这些公司在感知层的建设投入价值可能会被压缩。若不能拿出更强大的多模态模型,或向垂直场景深度集成迁移,它们将逐渐沦为英伟达生态的二级开发者——就像当年安卓生态里那些被平台规则约束的应用开发商。

第二层:云厂商的AI推理服务。 阿里云、腾讯云、华为云的企业AI Agent推理服务,面临"用户直接部署Nemotron+自建GPU推理"的替代压力。但这并不意味着千问系列束手无策:阿里Qwen3.5-Omni在音频理解基准MMAU上得分82.2,超越谷歌Gemini 3.1 Pro的81.1;在语音对话基准VoiceBench上得分93.1,优于Gemini的88.9。在中文语境、中文文档处理等垂直场景,本土模型的数据优势仍然显著,千问系列并非没有还手之力。

第三层:科大讯飞受到冲击最直接。讯飞的核心商业模式长期建立在"语音识别+多模态感知"的企业服务上,而Nemotron 3 Nano Omni内置的音频编码器Parakeet-TDT-0.6B-v2,与讯飞的核心能力形成正面重叠。当英伟达提供开源、高效、在英文场景领先的多模态感知基础模型,讯飞的差异化空间将被进一步压缩至"中文专业场景+政务/教育领域定制部署"的细分护城河。

第四层:国产GPU厂商。 华为昇腾、摩尔线程、沐曦、燧原等国产GPU厂商面临的,是一种比硬件出口管制更隐性、更持久的侵蚀:模型生态锁定。英伟达开源模型配合CUDA深度优化的策略,持续强化"Nemotron在英伟达GPU上性能最佳"的路径依赖。国产GPU厂商若不能同步提供对Nemotron家族的完整适配与性能优化,"模型生态锁定"将比硬件禁令更静悄悄地蚕食其市场空间。

还有一层冲击往往被忽视——国际市场的标准化压力。Nemotron全套生态一旦在美国市场形成事实标准,出海的中国企业、试图打入国际市场的中国AI公司,将面临一个新的隐性关卡:"是否兼容英伟达Agent架构?"这是比单纯模型性能竞争更深远、也更难以正面突破的产业压力。

六、中国AI产业的应对坐标
图片

面对这场来自英伟达的多维压力,中国AI产业的应对路径,在田丰看来,只有一条清晰的方向:在英伟达难以复制的三个维度建立不可替代性。

其一,中文垂直场景的数据优势。中国独特的语言生态、监管体系、产业场景,形成了英伟达难以快速渗透的本土壁垒。中文文档处理、政务AI、医疗影像的中文场景,本土模型天然占据数据与语境优势。

其二,本土合规部署能力。数据主权、网络安全法规、政府采购的本地化要求,构成国际模型进入中国市场的安全壁垒,这是法规层面的护城河,不随技术迭代而消退。

其三,与国产GPU的深度共优化。华为昇腾等国产GPU厂商与本土模型公司之间的深度协同,可以在"模型-芯片"的组合层面构建独立于英伟达CUDA生态之外的技术路线,这是最难被模仿也最具长期价值的差异化方向。

图片

诺贝尔经济学奖得主保罗·克鲁格曼曾指出,在全球化的产业分工中,率先建立标准的一方往往获得超额回报,而迟到者则长期支付兼容成本。英伟达正在AI Agent基础设施领域率先建立标准;中国AI产业能否在细分场景建立自己的标准,将在相当程度上决定这场竞赛的最终格局。

尾声
图片

历史总是押着相似的韵脚。20年前,英特尔通过x86指令集锁定了PC时代的算力生态;15年前,谷歌通过安卓锁定了移动互联网时代的入口;今天,英伟达正试图通过GPU+CUDA+Nemotron+NIM的四层架构,锁定AI Agent时代的算力与感知基础设施。

图片

这一次,锁定的工具不再是硬件接口或操作系统,而是模型——那个比任何硬件都更难替换、比任何协议都更深度嵌入业务流程的东西。

免费的,往往是最贵的。开源的,有时是锁得最深的。

参考文章:《英伟达全新开源大模型,抢谁的蛋糕?》第四波

图片
畅销书:《AI商业进化论:“人工智能+”赋能新质生产力发展》

出版社:人民邮电出版社

作者:田丰

帮助你定位AI当下发展坐标的指南针

帮助你洞察AI未来演进趋势的航海图

通俗化解读AI的原理、特性和四大发展规律、提供AI赋能商业、引发新质生产力变革的一手案例分析。既有宏观视角的全局观照,又有各行业应用层面的下探记录,聚焦AI的原理与实践、现在与未来,是当下AI应用的全景图、更是身处AI技术浪潮之中的探路书。

资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多