Token导航 LogoToken导航

英特尔与阿里云合作破解智能体CPU基础设施难题

更新时间 2026-09-29来源 数智前线正文 4812字阅读约 16分钟10 张图片

图片

智能体规模化落地,CPU重回C位。英特尔与阿里云从记忆、执行、成本、信任入手,拆解Agent时代基础设施的难题。

文|赵艳秋

编|牛慧

9月,杭州国际博览中心人潮涌动。2026云栖大会英特尔专场上,英特尔数据中心集团副总裁、中国区总经理陈葆立在开场展示了一组数据,把当下人工智能业界严峻的供需问题提出来——今年智能体开始规模化部署,底下的基础设施跟得上吗?

需求一侧,全球约80%的企业已在尝试将智能体引入工作流,IDC预测到2031年中国企业使用的智能体将超过3.5亿个,计算、存储与执行环境承压;供给一侧,为承接这些需求,有银行预测,中国相关产业需要投入超过2万亿元。

图片

如何应对这场考验,成为英特尔与阿里云在本次大会上共同回答的主题。从英特尔展台约30个演示,到汇聚双方芯片、软件、存储与云服务专家的专场论坛,讨论围绕真实负载展开:如何保留越来越长的上下文,如何让大量沙箱快速启动,如何降低模型调用成本,又如何让智能体更安全地使用数据。

陈葆立指出,AI工厂关注的问题正在变化:过去讨论有多少算力、多少token,如今更关心怎样调度资源,“完成更多的工作”。阿里云智能集团资源总监、首席服务器架构师卓久则强调,这波需求同时推高了CPU、GPU以及内存和存储的重要性,需要“从硬件到软件,从GPU到CPU到存储”的全链条协同。

从定制芯片、存储加速到轻量浏览器,双方展示的合作进展,正在把这些战逐项拆解、联合解决。而这一切的背景,是一个此前很少被讨论的变化——在智能体时代,CPU重新变得紧俏了。

01

Agent时代,CPU重回C位

过去三年,AI基础设施几乎等同于“抢GPU”。到了2026年,故事反转了:CPU也开始被抢了。

英特尔二季度财报显示,数据中心与AI事业部营收同比增长59%,CEO陈立武在该季度财报电话会上表示,“在数据中心领域,CPU需求正在起飞,客户需求正超过公司持续扩大的供应能力”。为此,公司上调了2026年资本支出。价格也随之上行。根据媒体报道,本轮服务器CPU价格整体涨幅为10%–20%,预计紧缺状况至少延续到2027年。

图片

需求突然爆发,与Agent规模化部署密切相关。陈葆立指出,智能体背后的多层软件创新,记忆管理、命令执行和反复验证,持续增加CPU需求。

具体而言,算力结构正在经历三阶段转向:从训练到推理,CPU与GPU之从1:8,升至1:4,并在Agent时代走向1:1。“甚至部分场景,CPU的配比会超过GPU。”英特尔数据中心集团产品规划部总经理李尔成说。

算力结构的变化是由Agent的工作方式引发的。Agent是“计划—行动—观察”的循环,一个简单任务可能要转二三十轮,而较为复杂的AI Coding任务要循环数百轮。大模型推理主要由GPU承担,CPU则负责智能体编排、状态管理、工具执行、内存层级与安全隔离。CPU侧若未及时准备数据、创建沙箱或调度请求,GPU就可能被“饿着”。从GPU到CPU到存储,需要全链条协同。

CPU增量因此需要放到整个数据中心看:用量比值上升,主要不是AI服务器内部简单调整配比,更多来自新增的一整类纯CPU Agent宿主机,承载编排、工具和沙箱,并通过网络调用GPU推理服务。

由此形成两条路径:GPU服务器或存储服务器中的机头,负责主机侧调度、数据与缓存管理;独立的Agent CPU服务器,承接智能体及其执行环境。前者侧重提高GPU利用率,后者更关注支撑任务持续推进。

图片

评价标准也随之改变。英特尔白皮书提出,优化目标正从tokens/秒,转向SLA约束下每美元完成的任务数,即在约定的服务质量与时延内,同样投入能完成多少工作。这呼应了陈葆立开场时的判断:AI工厂要通过更好的资源调度,“完成更多的工作”。

02

云栖展台上的"四道关"

在这样的形势下,沿着英特尔展台的演示一路看下来,智能体规模化运行要解决的难题,可归结为“四道关”。

第一关:记忆关——草稿本越写越厚。

Agent每调用一次工具、接收一轮反馈,上下文就继续增长。KV Cache像一本保存中间计算结果的“草稿本”,下次直接翻看,不必重算。循环越多,草稿本越厚。现场工程师给一组对比:Agent的上下文已迈向百万token,折算下来的KV Cache可达TB级,而GPU显存最大不过几百GB。装不下,“草稿本”上的内容被挤出,下次用只能重算,首token响应(TTFT)也拉长,IT账单加大。

英特尔的解法是让草稿本分层存放:眼下要用的数据留在显存,其余按冷热程度转入内存、SSD或分布式存储,需要时再取回来——以存换算。搬运途中的压缩和解压,交给至强内置的QAT(数据保护与压缩加速技术)引擎,不占用CPU核心,测试中可无损节省高达30%的空间。展台上的KV Shrink方案,英特尔测试显示,首token响应相比未开启分层存储的原生vLLM基线最大提高到15倍。

图片

同一思路也被放大到更通用的存储场景:展台另一个演示由QAT负责压缩解压、DSA(数据流加速器)负责数据搬运与校验,把这部分开销整体从CPU核心上卸下来,KV Cache只是它承接的数据之一。

第二关:执行关——让成百上千个“工位”及时开工。

Agent要反复循环,结果又难以预知,因此需要安全隔离的“工位”——沙箱,既限制错误影响范围,又能快速创建、销毁、回滚和恢复。“工位”越多,布置耗时过长,开销就越明显。

展台上的“英特尔IAA加速安全沙箱方案”,覆盖Firecracker与E2B两种场景。加速“工位”布置的关键是快照——把准备好的环境或暂停时的运行状态“存档”,下次直接恢复。至强内置的IAA(存内分析加速器)加速压缩与解压,减少了快照体积和CPU核心开销。展台数据显示,E2B场景下,128个沙箱并发拉起,沙箱创建速度提升1.40倍。

图片

李尔成在论坛中也提及,至强“内置了QAT、DSA、IAA这样的加速器,对于Agentic AI里最重要的沙箱拉起、释放、并发执行有着显著的加速作用”。

图片

第三关——账本关:让贵的模型干更重的活。

识别图片里的文字,不必每次都惊动万亿参数模型。展台上的至强LLM Router(大模型智能路由)就像一个派活员,比如写代码时,将系统规划交给贵模型,写小模块、跑测试交给小模型。它采用三级级联决策——第一级快速判断决策复杂度;拿不准,交给几百MB、可放进CPU缓存的小模型;再拿不准,由强模型兜底。Router还内置中英文PII脱敏,在请求发往外部模型前处理敏感信息。

另一个案例是PolarDB库内向量抽取,将原本跑在GPU上的Qwen3.5-2B挪到CPU上,借助至强内置的AMX加速器,支持短、长上下文的吞吐稳定端到端提升约2.5倍。它展示了特定小模型任务在CPU上有优化空间,能直接降低Agent的响应延迟和算力成本。

第四关——信任关:Agent手里握着你的数据。

Agent读文件、连业务系统,掌握着用户最敏感的那部分资产。阿里云Confidential Agent基于英特尔TDX机密计算技术,把Agent的核心运行时关进一间硬件级隔离的"密室":内存由CPU全程加密,用户对话、长期记忆、Skill文件与服务凭证都在其中。

现场演示中,用户下一条命令,系统便走一遍远程证明:由CPU签发一份无法伪造的报告,逐项说明这是不是经认证的真硬件、内存是否确实加密、开机到内核有无被篡改。确认后再建立加密通道访问Agent服务。

另一项展示更为前瞻:蚂蚁SM4th(后量子签名方案)结合英特尔至强6+原生支持的SM4国密新指令,同一算法的签名、验签性能提升16—37倍,无需专用加速卡。

03

从定制芯片到联合方案

实际上,英特尔与阿里云的合作早已渗透到相关具体层面。这次云栖大会上分别呈现了不同层次上的截面——从芯片规格的联合定义,到软件生态的共同建设,再到端侧算力的协同布局。

最直接的一层是芯片,从通用到定制层层深入。第一步是按需选配,阿里云与英特尔去年已联合推出基于英特尔®至强®6性能核处理器的第九代ECS实例,搭载于磐久服务器,依靠至强6性能核核心数、单核性能和内存带宽上的性能,加上高度优化的技术栈,最终算力较上代最高提升20%,L3缓存提升50%,最大睿频3.9GHz、全核睿频3.6GHz。

再进一步,是围绕具体负载定制处理器。展台上的GEM Mountain基于至强6架构,面向智能网卡、冷存储和边缘网络与交换机三类场景,在优化功耗与成本的同时,在至强6平台架构上做功能精简,把TDP压到百瓦上下,保留双通道内存和服务器级可靠性。

图片

三款SKU里,一款明确面向阿里云,采用16核设计、TDP 85—90W,用于阿里云MOC智能网卡。用展台工程师的话说,这款由阿里云提出低功耗需求,英特尔在至强6平台上裁剪定制、专门做出来的,“以前是没有这颗芯片的”。 这颗芯片不仅能够满足阿里云的需求定义,也能够应用于冷存储和边缘设备上,负责把虚拟化、网络与存储的管理开销从主CPU上接走。

定制还延伸到了存储介质。阿里云自研的AliSCM让一类新介质既能被CPU当内存直接访问,又能掉电不丢数据;它已在至强6平台完成适配,英特尔用内置的DSA加速数据搬运,读写性能成倍提升。

在软件与生态共建上,论坛现场,英特尔与阿里云终端智能计算宣布围绕Agentic Browser展开合作。

图片

阿里云终端智能计算事业部产品经理蒋佳忆介绍,2026年二季度浏览器访问的机器流量占比已达57.5%,首次超过人类。Agent正在成为浏览器最重要的新用户。但今天的浏览器仍然是为人设计的,实例重、并发高,在登录、验证码和复杂交互面前容易失败。

双方没有另造一个浏览器,因为Chromium是Chrome的开源底座,真实网站都按它的标准写的,换掉很多页面就打不开了。于是保留兼容性,只把为人准备的那些开销删掉:双方基于官方Chromium技术体系,对Blink、V8等核心引擎进行轻量化优化,并结合英特尔至强处理器AVX - 512指令集,以及IAA、QAT等硬件加速器能力,内存开销最多降了三成,省下的内存换成并发,这样,一个Agent可以同时开出上百个浏览器办事。

此外,PolarDB库内AI、龙蜥社区五年OS开源创新也在这一层持续推进。

Agent不只在云上,双方也展开了端侧协同。第三代酷睿Ultra(Panther Lake)上运行的QwenWork端侧办公智能体,数据不出本地,也省下token。现场还有千问AI眼镜+AI PC辅助销售方案——门店销售问一句“给客户推荐一台五千元的电脑”,眼镜把请求交给本地算力,结合本地知识库与ERP给出方案,全程不上云。此外还有Qwen Book与Qwen Box、零售门店AI管理方案,以及锐炫Pro B70显卡赋能AIGC。

图片

现有平台的联合优化之外,芯片架构本身也在应对智能体需求。英特尔首席工程师龚海峰介绍了展台展示的下一代至强(代号Diamond Rapids)时提到,其架构围绕数据搬运、处理与保护展开:例如通过3D封装,将缓存放在计算核心下方,让取数据如同“从楼上到楼下”,缩短访问路径。

从眼前的软硬件调优,到面向未来的架构演进,真实负载正在提出更具体的要求。双方的联合研发分工也越来越具体:阿里云把云平台和业务现场的负载、瓶颈带进来,英特尔以处理器架构、内置加速器和软件优化能力参与解决,再回到实际场景中验证。从定制芯片到轻量浏览器,合作已经深入数据如何流动、任务如何执行、资源如何分配。

Agent仍在快速演进,正如卓久在论坛上说,这一年身处浪潮之中,发现AI这一波“浪潮越来越大,而且无法阻挡”。今天解决了缓存和沙箱启动开销,明天还会遇到新的并发、成本等方面的挑战。双方合作的长期价值,在于持续把这些问题转化为共同的设计与验证目标,让芯片、软件和云服务随真实需求一起改进。而最终衡量成果的,是企业能否用可承受的成本,让更多智能体可靠地完成工作。

资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多