【环球网科技报道 记者 郑湘琪】随着AI从训练走向推理,从问答走向Agent多步执行,算力需求结构正在发生变化。推理侧需求快速增长,Token消耗呈指数级增长,企业对算力的衡量标准也从单一硬件参数转向系统能力与业务价值。在这一背景下,基础设施厂商如何高效生产Token、如何让算力投入与业务产出形成对应,成为行业共同探索的重要方向。
“衡量AI算力的标准正在从‘Token多少钱’逐渐转向‘Token创造了多少价值’。随着AI进入生产环节,企业会越来越关注单位成本能够产生多少Token,并进一步把Token产出与业务价值联系起来。”近日在2026云栖大会期间,联想中国基础设施业务群战略技术总监黄山在采访中表示。

Token价值成为算力新标尺
Agent的快速普及,正在重塑AI的算力需求。黄山谈到,过去用户提问、模型作答,Token消耗呈线性轨迹;如今要让AI像数字员工一样多步执行、自我校验,Token消耗不再是简单的倍数关系,而是呈现数倍乃至指数级的增长。“一旦Agent开始执行命令,Token使用量就会剧增。”
伴随着Agent在更多场景中落地,AI算力的需求结构也在发生位移。黄山透露,目前推理和训练之间的Token消耗比例已经超过6∶4,推理侧的算力需求正在快速增长。相较于过去行业普遍关注如何扩大训练集群规模,当前的Agent时代,如何持续、高效地完成大量推理任务,正在成为基础设施建设需要回答的新问题。
而从智算中心到Token工厂,算力的衡量方式也在发生转变。黄山解释称,“显卡的算力指标只是影响训练与推理性能的三项因素之一,另外两项是一级互联的通信指标和显存带宽指标,这两项在训练时代常被忽略。所以说在推理时代衡量算力不能只看算力指标,而应关注实际购买显卡的成本与能产出的Token数量。”
算力价值要体现在Token产出上,如何高效生产Token便成为供给侧的关键。黄山以联想业务为例拆解了Token的成本结构:基础建设约占四分之一,其中电费约占10%,软硬件协同影响Token成本的50%以上。这意味着,影响Token生产效率的不只是芯片硬件,更在于计算、通信、访存、存储、推理优化以及整个系统的调度能力,AI算力的竞争正在从单点硬件能力走向系统能力。黄山还提到,联想正在布局Token hub,通过分时调度挖掘算力的时间碎片,白天多用、晚上少用,把闲置算力调度到别处,这一层的增益目前还难以估量。
与供给侧的成本相对应,需求侧的规划方式也在改变。在黄山看来,未来企业的算力建设不能再由IT部门单独定义,而应该由业务来定义。企业首先需要明确AI究竟要解决什么问题,把AI能力嵌入业务工作流,再由工作流反推所需的Token量、SLA以及算力规模。由真实业务节奏决定算力建设,而不是盲目“先买算力,再找场景”。
这种底层逻辑的转变也影响了企业AI部署方式。公有云承担弹性与调度,私有化部署满足安全与数据确权的需要,两者动态调配形成的混合式AI,未来会成为企业部署AI的必然选择。他以联想自身举例称,中等尺寸模型自己部署更划算,大尺寸模型出于安全和数据确权考虑,做混合式调度。这种“由业务节奏决定算力规模”的逻辑,意味着算力建设正在转向价值驱动,企业对算力的投入也将更可衡量、更可持续。
加码超节点演进与软硬协同
随着大模型参数规模不断攀升,超节点正在成为算力基础设施领域备受关注的技术方向。“对于万亿级模型而言,超节点已经成为训练和推理的重要架构选择。”黄山提到,按照工信部的定义,32颗及以上的AI算力芯片实现一级互联,才称得上超节点。
第一代超节点架构受到柜内铜缆等因素限制,扩展能力基本止步于一两柜的范围。“铜缆信号在三米以外会剧烈衰减,因此大多只能扩展到一柜或两柜。再往下走就需要光互连,但光互连速率会降低。”黄山说。下一代超节点架构需要解决更大规模的柜间光互联、更高的单柜密度,以及与之匹配的全液冷、800V高压直流和集群级软件管理等一系列问题。黄山透露,“联想将争取率先突破第二代超节点架构。”
在软件层面,黄山把推理优化归纳为六个方面,包括算子、通信库与通信原语、访存语义,以及在推理框架中的PD分离、投机推理和KV Cache的分级存储与缓存命中优化。这些环节相互配合,共同影响着推理任务在实际业务中的效率与成本。
在黄山看来,芯片、整机、系统到软件栈等基础设施厂商很难依靠某一单点能力形成完整优势,关键在于把这些前沿技术要素整合起来,形成面向实际业务的系统能力。他透露,联想软硬协同团队在过去四年里持续积累AI智算的训练推理集群效率优化能力,从芯片到模型的全栈优化,包括操作系统、推理框架等一系列软件层。
“我们做系统、做软硬协同是必须的。”黄山表示,联想还在关注GPU之外的上游方向,包括RPU、TPU、超节点、Switch、NPU等,并在系统设计时将其他要素整合进来。“如今算力芯片形态持续演进,联想会继续在这些上游方向扮演好‘整合’的角色,以供应链能力与软件能力,把系统的价值充分释放出来。未来联想希望继续以混合式AI为底座,把算力资源变成可持续、可度量的智能产能,全面赋能企业将AI从技术试点推向规模化生产。”
回顾联想在算力领域的思路,一条逻辑贯穿其中:算力的价值不在于规模本身,而在于它能否高效转化为业务产出。混合式AI正是这一逻辑的落地方式——通过系统设计与软硬协同,把芯片、存储、网络、软件等环节整合为面向实际场景的系统能力。当AI进入生产环节,企业需要的已不只是一批显卡,而是一套能够持续、稳定、可度量地生产Token的算力体系。面向未来,联想有望为AI走向千行百业提供更坚实的支撑。







