
为满足人工智能普及带来的算力需求,科技巨头们全力支持在美国建设更多数据中心,然而整个行业面临的障碍也不容忽视。
超大规模云服务商正积极筹建顶尖服务器集群,但其新建项目因可能影响区域电网、供水及生态环境,遭遇日益强烈的政治阻力和公众反对。AI驱动的未来究竟由怎样的基础设施来支撑、由谁来建造、何时能够落地,目前仍是未知数。
AI带来的供应链瓶颈
算力需求急剧攀升催生了数据中心建设的四大供应链瓶颈,且在过去一年内均显著加剧:
·先进制程晶圆代工与封装产能紧缺;
·高带宽内存(HBM)供应紧张,同时大量动态随机存取存储器(DRAM)产能被转移至HBM生产;
·电力供给不足,尤其集中于电网基础薄弱、老化严重的地区;
·机架内及机架间数据传输所需的光互联激光器短缺。
科技咨询顾问杰夫·泰特(Geoff Tate)表示:“一年前,台积电几乎垄断了AI加速器领域,但彼时他们的表态还是‘基本能跟上需求’,而近期的说法则变成了‘已经无法满足需求’。一年前,存储器尚未被视作行业瓶颈,但如今形势已大相径庭。电力供应问题在一年前就已是明显的痛点。而光互联激光器此前未被纳入瓶颈范畴,因为向光互联的转型趋势尚不明确,但这一情况在过去半年里发生了根本性转变。”
上述任何一个瓶颈都会对AI算力的扩张速度产生重大影响。泰特指出:“这些瓶颈相互关联——最薄弱的一环会制约其他所有环节的需求。AI要持续增长,就必须同步突破所有瓶颈,缺少其中任何一项,数据中心都无法正常运转。”
能源供应挑战
Endura Technologies执行副总裁兼首席产品官达乌德·亚兹达尼(Davood Yazdani)表示,传统电源管理方案已难以满足当前AI时代的需求,数据中心运营商正积极寻求能提升每瓦Token生成效率的新型设计方案。
“归根结底,数据中心最核心的指标是每瓦能产生多少Token,”亚兹达尼说,“实现这一目标的路径有两条:一是提升能效,能效提升意味着可用功率增加,进而生成更多Token;二是在能效相对较低的情况下,通过提高末级稳压电路的工作频率来加快响应速度,让处理器以最高效的方式运行,满足Token生成的需求,两者结合的综合效益更为显著。”
亚兹达尼认为,集成稳压器(IVR)的研发将是大型云厂商追求能效的关键技术方向之一。
他补充道:“数据中心的用电增速与电网的供电能力完全不在同一量级,功率上限始终存在,因此必须在给定功耗预算内最大化吞吐量。这正是当前业界普遍看好IVR的原因——尽管这项技术尚处于市场导入阶段,落地需要时间,但对任何数据中心而言,功率上限都是无法回避的现实。”
电力供应问题与公众反对数据中心的一些原因不谋而合——大型云厂商的大规模建设被认为会推高普通用户的电费。
“地方政治是最重要的非技术挑战,”泰特说,“在美国许多地区,选民和政客正在采取行动限制数据中心扩张,因为他们认为数据中心是电价上涨的幕后推手。精明的运营商会尽量避开公共电网,选择自建离网发电设施。”
在这样的政治背景下,以小型反应堆为核心的核能发电方案重新进入了人们的视野。
亚兹达尼表示:“在发电方式上,核能会成为很多人认真考量的选项,因为常规电网扩张已不太可能实现,数据中心运营商都在关注微型反应堆和小型核电站。”
不过,微型反应堆目前尚未真正应用于数据中心供电,并非每座采用核能的数据中心都会直接配备一台微型反应堆。
NANO Nuclear Energy首席执行官詹姆斯·沃克(James Walker)解释道:“微型反应堆目前还没有投入使用,因为新技术正在许可申请和示范验证阶段。有些人想当然地认为每个数据中心最终都会配备自己的微型反应堆,但我并不这么看。有些设施接入电网永远是更合理的选择,尤其是在发电和输电容量本就充裕的地区。但也有一些地方,开发商正苦于无法获取足够电力,或者被告知要等上数年电网才能支撑新园区,在这些场景下,先进反应堆就显得颇具吸引力。”
核能在数据中心运营商中备受关注,还因为其技术可靠性。
沃克表示:“已有的用电需求规模以及预测中的未来用电量,完全是另一个量级,电力公司正在想方设法满足这些需求,同时又不能损害电网对其他用户的供电。如果一个设施要全天候运行,就需要不依赖天气和时段的发电方式,能够提供基础负荷电力、部署选址灵活,且年停机率低,这正是核电的核心优势。现有核电站现在就能提供这种稳定电力,而先进反应堆还能让运营商更灵活地选址、保障供电。五年前从未布局核电的企业如今纷纷与核电运营商签署长期协议,这绝非偶然。”
公众舆论阻力
然而,这一切都建立在大型云厂商能够如愿推进的前提下。盖洛普(Gallup)最新民调显示,七成美国民众反对在社区新建人工智能数据中心,红蓝两州议员也纷纷出台新政,加强对大型云厂商的监管限制。
政策分析机构MultiState副总裁摩根·斯卡尔博罗(Morgan Scarboro)指出:“这个话题早已不再局限于政策圈,人们在餐桌上就会谈起AI,谈起数据中心,它已经完全进入了公众视野。无论是保守派还是自由派人士,均对数据中心监管发声,这一现象极为特殊。我们追踪数千项政策议题,从未见过哪项议题能实现全美各州同步立法管控:美国佛罗里达州出台的新规与纽约州拟推行的监管政策如出一辙,这真的让人震惊。”
纽约州已对新建大型数据中心的部分环境许可暂停审批,期限最长一年,但全面叫停施工的议案仍在审议之中。斯卡尔博罗梳理了过去一年各州立法机构推动的三类常见法案:
·“成本自担”法案,要求大型云厂商/AI企业自行承担因其用电需求引发的电网扩建费用,或缴纳费率附加税以抵消电费上涨对普通用户的影响;
·强制信息披露,要求数据中心运营商追踪并定期报告用水量、用电量及噪声水平;
·暂停对数据中心运营商的税收优惠,或对其用电征收专项税。
尽管如此,美国政府部门仍在努力平衡民众对数据中心的担忧与其带来的经济机遇。斯卡尔博罗表示:“地方政策制定者处境两难,既需要招商引资拉动地方经济,又面临民众抵制数据中心落地的压力,毕竟其他行业的投资机会极为有限。”
Iceotope产品与计算业务负责人凯尔·伊尔根(Kyle Illgen)认为,公众对数据中心运营商的信任缺失快速加剧了行业运营难度,但也让合规可持续运营成为项目落地的必要前提。“短短两年内,数据中心管理从冷门细分领域,变成复杂度最高的行业之一。更重要的是,孟菲斯科洛西斯数据中心事故等事件发生后,社区和监管机构对新项目的审查力度大幅提升。用电需求、水资源消耗、噪声影响和环境代价已成为规划决策的核心议题,数十亿美元的项目因地方反对而被迫延期或取消。这意味着可持续发展已不再是一项企业战略目标,而是行业扩张的必要前提。”
外界对电网负荷与生态环境的担忧,也让热管理技术研发落地成为行业核心挑战。
“热管理与所有关于能耗和水资源的抗议直接挂钩,”伊尔根说,“AI基础设施今天面临的每一项重大挑战——性能、运营成本、可持续性、用水量、社区认可度、部署灵活性和未来可扩展性——都与热管理息息相关。而随着每一代新硬件的推出,热管理的难度也在持续攀升。”
数据中心专业化趋势
人工智能运算复杂度提升催生供应链瓶颈,也推动头部厂商转向专业化、定制化数据中心建设。新思科技(Synopsys)混合信号PHY IP产品管理总监曼米特·沃利亚(Manmeet Walia)表示,这种专业化正在导致半导体IP生态系统日趋碎片化。
“云服务商和大型云厂商的体量已经足够庞大,可以自成一体,规模足以支撑自己的需求,“沃利亚说,“他们追求的是高度定制化的解决方案,各家的算力需求、人工智能应用场景、机架架构均存在差异,进而对内存规格、容量、速率、性能指标形成个性化需求。芯片裸片异构拆分的普及,催生大量定制化IP方案,行业碎片化特征愈发明显。”
与此同时,供应链问题也在对这种碎片化趋势形成制约。DRAM短缺正在影响系统设计方向。
新思科技杰出工程师丹·威尔金森(Dan Wilkinson)表示:“所有这些厂商的行动背后都有共同的驱动因素,其中之一就是HBM。随着每一代新产品的推出,速度不断提升,厂商们显然也在密切关注这一变化;尽管各家的工作负载存在差异,但最终都在使用同一套存储生态。速度提升后,计算端也需要跟上,进而需要更高带宽来整合各个组件。我认为存储问题是所有大型云厂商共同关注的重要驱动因素。”
大型云厂商正在寻求传统架构之外的变通方案。过去几年,许多方案依赖英伟达GPU和CUDA等标准组件来加快上市速度,并辅以内部设计的专用加速器。但随着算力规模大幅跃升,数据传输和存储成本已成为比以往更突出的挑战,由此催生了更加定制化的方案需求,这些方案可能仍会包含GPU,但也可能包含其他组件,尤其是在智能体AI部署方面。
“企业有两种主流选择,一是选择英伟达,获得最高的原始性能,并确保按时交付,”沃利亚说,“二是采用ASIC芯片,或者采用COT模式自行构建芯片,成本更低、技术自主,并能针对自身工作负载和机架架构优化性能。新思科技正是凭借其IP技术,与集成商或ASIC厂商合作,提供解决方案。我们直接与主流超大规模数据中心运营商合作,为其核心SoC开发解决方案。这些都是专为这类SoC定制的IP。”
亚兹达尼认为,如果足够多的主流厂商都选择定制ASIC,将对英伟达的市场领导地位构成威胁。
“英伟达在GPU领域目前排名第一,但这种格局不会一成不变,因为所有大型云厂商都追求技术自主。他们希望拥有针对特定应用场景进行优化的解决方案,这对英伟达来说无疑是一种威胁,”亚兹达尼说,“英伟达的GPU非常适合特定类型的矩阵计算,对某些模型而言几乎是完美之选,但未必是针对Meta、谷歌或AWS等公司工作负载的最优解,这正是他们纷纷启动自研芯片的原因。他们目前仍然依赖英伟达,但随着时间推移,会逐步推出自己的产品。例如,谷歌就拥有自己的TPU,且出货量在快速增长。那么,英伟达目前80%至85%的市场份额,未来还能保持吗?”
话虽如此,英伟达并不会就此退出历史舞台。“2029年至2030年,行业目标是实现单机架1兆瓦算力,英伟达正领跑这一赛道,“沃利亚说,“实现这一目标需要不断提高集成度,这意味着我们不仅要开发多芯片解决方案,而且这些解决方案还将采用3D、3.5D、4D等技术。这为我们带来更大的自由度和新的机遇,也带来更高的复杂性。”







