

算力堆得多不如用得好?
一份来自英特尔的智能体攻略。


凌晨两点,一名程序员把一段报错日志丢给编程智能体,转身去倒咖啡。几分钟后,智能体已经自主拆解了任务、检索了三处文档、反复运行和调试了代码,并提交了最后的结果。普通人甚至连这位程序员都没有看到的是,这几分钟里,这个智能体足足拉起了几十个隔离环境来执行任务,在失败与成功间来回折返了上百次,更是有上百万个Token(词元)在数据中心深处被生产、搬运,又被消耗。
这就是2026年AI世界的日常。
工信部最新数据显示,截至今年6月,中国日均词元调用量已超过500万亿,近两年的增长逾5000倍。
数字狂奔的背后,是AI的用法变了。问答式的Chat AI,正在让位于会动手干活的智能体。一份公开研究测试显示,智能体编程的平均Token消耗约为单轮代码推理的1000倍。
当调用量以千倍、数千倍的速度膨胀,成本账前所未有的突出,只有把单位Token的综合生产成本压到像水、电一样便宜,智能体时代庞大的调用需求,才可能从少数重度用户的狂欢,变成一门长期成立的生意。
在算力产业链,切换也在发生:GPU不再是唯一的主角。TrendForce的判断是,AI数据中心里CPU与GPU的配比,正从传统的1比8到1比4,向智能体时代的1比2到1比1收敛;今年3月,英伟达首次以独立产品形式销售Vera CPU,并选择英特尔至强6作为其DGX Rubin NVL8系统的主机CPU搭档。
英特尔是这轮再定价中最直接的受益者。财报显示,今年二季度英特尔总营收161亿美元,创下十五年最强增速;其中数据中心事业部(DCG)该季营收63亿美元,同比大涨59%,至强6系列成为公司历史上量产爬坡最快的产品之一。首席执行官陈立武在财报会上表示,需求持续跑赢产能,服务器CPU的景气周期有望延续至2028年。
9月22日至23日,2026英特尔技术创新与产业生态大会(Intel Connection 2026)在苏州国际博览中心举行。

而所有亮相都围绕最核心的疑问展开,Token,其生产、流通和消费怎样才能更便宜,或者说更加物有所值;智能体,怎样才能又多、又快、又安全地跑起来。答案藏在两个略显生僻的技术名词里,分别是Token供给侧的KV Cache,与Token消费侧的沙箱(Sandbox)。

KV Cache里的成本账
要理解智能体时代的成本焦虑,得先看清Token究竟是怎么生成的。
大模型生成文字本是一个逐字“接龙”的过程:每生成一个新Token,模型理论上都要重新“回看”此前所有Token。为了避免把同样的内容一遍又一遍重复计算,工程上会把每个Token对应的两组关键向量——Key和Value缓存下来,这就是KV Cache的形成原因。它是让推理变快的功臣,也是吞掉显存的巨兽:缓存体积随上下文长度线性增长,并且要在整个请求生命周期内驻留在最昂贵的GPU显存,如HBM(高带宽内存)之中。
这是一笔不菲的开销。技术研究机构IntuitionLabs今年9月的测算显示,一个Llama 3 70B模型处理单条12.8万Token的请求,仅KV Cache就要占用约40GB显存。HBM容量已成为限制推理批处理规模与系统吞吐的首要瓶颈。压缩或各种卸载KV Cache的技术因此成为全行业必争之地,就在9月,DeepSeek发布的V4.1-Flash通过跨层复用与FP4缓存,把全局KV缓存压缩到每Token 890字节,约为上一代的四分之一。

当产业链上下游都在想方设法节省KV Cache成本,还要顾及其应用性能的当口,英特尔也给出了一套覆盖KV Cache全生命周期的“智能加速套件”,四个关键词对应四种省钱的方式。
先看这个套件交出的整体账:在主机到设备(H2D)的缓存搬运场景中,与业界常用的cudaMemcpyAsync方式相比,缓存传输速率最高提升达9.66倍;整体上,KV Cache无损压缩率最高提升至1.42倍,首字时延(TTFT)性能最高改善达15倍。压缩、复用、聚焦、扩展,四个关键词覆盖了一份缓存从生成、驻留、搬运到卸载的完整生命周期。具体来看:
KV Shrink,主打压缩,它能让缓存“变小、搬得快”。它用至强处理器内置的QAT(英特尔数据保护与压缩加速技术)对KV Cache做硬件级透明压缩,可明显降低它在内存或存储中占用的空间,且首字延迟(TTFT)基本不受影响。

KV Fuse,主打复用,能让“算过的内容不用再算”。智能体常常在多个独立文档、历史会话和工具结果之间来回切换,过去这些上下文的缓存彼此孤立、无法共享;KV Fuse通过多份KV Cache的融合与部分重计算,把已有结果真正利用起来——它创造性地借助小模型快速判断Top-K关键Token,只让主模型重算这一小部分Token。整个过程中KV Cache的存储和加载由QAT来加速,小模型的运行和加速则由至强6内置的AMX矩阵计算能力来承担,其目的,就是让GPU专注去算“新”Token,而不是反复算“旧”Token。

KV Cascade,主打聚焦,让大模型只处理真正有用的信息。由于上下文越长,有效信息的密度往往越低,于是就用KV Cascade先以小模型从海量上下文里筛选出相关片段、缩短主模型的输入,再交给主模型作答,这一系列操作下来,不但有更高的KV Cache命中,还有更短的主模型输入,进而就是更低的计算量和更短的响应时间。

KV Infinity,主打扩展,让KV Cache不必全部挤在昂贵的HBM里。它能通过按需加载与预测预取,配合CXL内存池化(T2.5)和访问延迟低于100微秒的Tier-3.5 KV Cache存储层,把缓存沿着HBM、DDR、CXL内存、NVMe全闪这个分层存储机制逐级卸载,在不增加HBM的前提下支撑更长的上下文;在Prefill与Decode分离的集群中,CXL池化还能让多台主机共享同一份缓存。在这个组件发挥作用的过程中,至强CPU内置的多种硬件加速技术同样能发挥作用:AMX依然加速Top-K检索与索引比较与预取决策,QAT压缩数据来加快数据,来降低与其相关的容量与IO需求,DSA则能加速从GPU显存,如HBM到DRAM的KV数据块搬运工作。

细细对比行业内其他与KV Cache卸载或压缩相关的技术或方案,会发现,英特尔这个KV Cache智能加速套件的独特之处,就在于只要用了至强CPU(限定为第四代至强可扩展处理器及其后续产品),那就可以在几乎零额外硬件成本的情况下部署和使用它们。上文提到的AMX、QAT、DSA还有下文要提到的IAA(英特尔存内分析加速器)及TDX(英特尔可信域扩展)等,都是内置在至强CPU中的、针对特定负载的硬件级加速器或支持类技术。而且它们的运行还基本不占CPU通用核心的资源,可以说是省上加省。


沙箱:另一个智能体产业的共识性基建
如果说KV Cache解决的是Token“贵不贵”,沙箱要回答的,则是消耗这些Token智能体“敢不敢放出来干活”。

智能体与聊天机器人最本质的区别在于,前者要真的执行代码、调用工具、访问数据,并在失败时并行试错、开出分支、随时回退。一个复杂任务会被拆成大量短周期的执行单元,每个单元都需要一个安全、隔离的运行环境,即开篇时提到的隔离环境,目前主要是以沙箱来实现。没有沙箱,让模型自己写的代码直接在主机上运行,无异于把机房钥匙交给一个不知疲倦、却偶尔会犯错的实习生。
沙箱也不是英特尔独创,它正在成为整个智能体产业的共识性基建。亚马逊云科技开源的Firecracker微型虚拟机(microVM),用独立内核和硬件虚拟化边界替代共享内核的容器,冷启动最快只需约125毫秒,最早支撑了AWS Lambda的无服务器计算。
但沙箱大规模铺开后,新的瓶颈出现了。智能体任务越拆越碎,沙箱被海量且高频地创建与销毁;生命周期越短,启动开销在总耗时中的占比就越高。行业通行的解法是快照(Snapshot):把操作系统和服务初始化完成后的状态,甚至是一些有价值的阶段性状态保存下来,新任务直接从这些快照恢复,支持恢复、分叉与回滚,跳过最耗时的启动过程和已经完成的阶段。而当并发规模上来,快照的创建、压缩、存储与恢复,反而成了卡住部署密度的关键路径。
英特尔的切入点正在这里——它利用至强处理器内置的IAA,来为沙箱快照做无损压缩与解压缩。这种快照压缩操作能减少其体积,让其以压缩态落盘到存储,从而减少存储IO压力,当沙箱需要恢复时,压缩态的快照同样能被快速取回,通过IAA解压后再恢复。这套方案的优势就在它能省存储IO,从而让更多沙箱在更短的时间窗口内穿行而过并完成拉起与就绪。而且,IAA的压缩与解压缩操作均不需要占用CPU通用核心的资源,因此也就不会抢占CPU的资源,就更不会面临资源抢争而导致的性能不稳定状况。据英特尔的实测,在32-128路并发的情况下,快照恢复的时延,使用IAA压缩后的方案要比未压缩的方案降低38%-42%,这不但表明采用IAA方案后沙箱启动速度可获明显提升,还表明这种收益会随规模线性扩展。

英特尔对沙箱的优化,并不止于快照恢复加速这一个环节。它按照沙箱运行时的冷热状态,把资源调度拆成热、温、冷三层,有一整套高效的应对策略。
热运行的沙箱内存不做压缩。DSA会利用操作系统的内核同页合并(KSM)机制来扫描跨沙箱的内存页,对重复页面只保留一份,整个过程对CPU几乎零开销,从而在有限内存内容纳更多沙箱,支撑更高的部署密度与超卖比。
温运行的沙箱,部分内存通过zswap进行压缩。专属的IAA硬件引擎负责执行Deflate压缩与解压算法,相比软件解压速度大幅提升,压缩后可显著节省内存与SSD开销。
冷运行的沙箱把大部分内存卸载到存储,IAA用于加速快照的保存与恢复、降低启动延迟;借助CXL内存,还可以扩展内存容量,让多台主机共享同一个智能体池。

在隔离强度上,TDX把沙箱之间的边界下沉到硬件:内存区域加密保护,PCIe I/O链路借助IOMMU、MKTME与设备可信执行环境加密,沙箱之间实现硬件级隔离,而应用代码几乎无需改动,已经过规模化部署和产品级验证。
安全还有另一重含义,那就是可信。当智能体开始接触企业的合同、客户数据和内部系统,仅有隔离远远不够。本次大会还实地展出了Agent-CC方案,基于英特尔TDX机密计算技术,为从推理执行、敏感数据处理到工具调用的全链路提供硬件级可信执行环境与远程证明,让模型、提示词、记忆和业务数据在运行过程中始终处于保护之下。

智能体的规模化竞争,终局是一道密度题,每颗CPU能承载多少个智能体?每个智能体每小时要花多少钱?企业又敢把多少核心业务托付给它?如果用一句话来概括,那就是:算力密度决定下限,算力性能决定成本,可信保障决定边界。
然而现实,比这句话还要复杂的多,或许我们可以引用英特尔抛出的一个更为复杂的公式来算这笔账,即每个智能体服务器机柜能真正交付的智能体数=理论每机柜智能体数x CPU调度有效性x资源平衡度x计算卸载效益。目前号称提供智能体场景最佳CPU的企业不止一家,但他们还多是在宣传每CPU、每服务器或每机柜理论上能承载的智能体数,且多是依据内存容量或CPU的核心密度,英特尔所述公式中后三个变量还鲜少被提及,而英特尔则已经在实际应用中展现了后三个变量带来的影响。至强CPU缓存的优化设计、微架构并行处理能力以及内置的各种硬件加速器或技术对多智能体并发和多沙箱并行执行的加速或加成作用,已经在赢得越来越多用户的认可。


算力中枢的内与外:AI工厂的重塑
组件层面的巧思,软硬优化的方案,最终都要变成或融入客户可以直接采购、部署的系统,AI工厂由此而来。
在本次英特尔技术创新与产业生态大会的“算力中枢·AI工厂”展区,大规模算力像工业品一样被制造和交付。
这里不再以单颗芯片为单位陈列,而是整机柜、整集群地铺开:CPU整机柜集群、GPU整机柜集群、全闪AI存储节点,这些近半年来频频亮相其他AI顶级行业会议与活动的重磅级算力设备,在本次大会上也是明星级展品。

当然,本次大会展区中,也有一些不常见但同样有冲击力的展示,其中最具画面感的,是集装箱式储能算力一体化方案:把变电、储能与算力一并装进标准集装箱,直接部署到绿电资源富集的地方,就近把电力转化为词元。


据英特尔披露,整套设备在工厂8至12周即可完成预制,现场一周内就能投运,并支持整体吊装迁移、分批模块化扩容,单箱可容纳12个标准机柜、支持100千瓦到数兆瓦的弹性部署;作为对照,传统土建智算中心的建设周期通常为1至2年。
如果说集装箱式储能算力一体化方案面向的是绿电旁的超大规模供给,那么词元一体机要补足的,就是AI算力的“最后一公里”。
对缺乏专业机房的中小企业,英特尔甚至把词元一体机的部署门槛降到了“有间办公室就成”。其TBX16词元一体机内置16颗GPU,采用图书馆级静音设计,可直接在办公室、研发实验室或会议室落地,模块化配置、无需专用机房;合作伙伴云创、同泰怡也带来形态相近的液冷一体机与22U轻量化整机柜,以填补工作站与大型智算集群之间的空白。

一个个靠近绿电要算力的“集装箱”,和一台台能放进办公室的词元一体机,被同一条逻辑串了起来:即Token的生产,正在被AI基础设施日益高涨的能源成本与企业一线业务需求重新组织与塑造,从过去单一的集中化部署方式,走向更为多样化的部署场景。
这种重新组织、重新架构、重新定义甚至重新创造的变革,正在智能体时代AI基础设施的每一个环节和每一个角落发生。而且它们都紧紧围绕着智能体时代AI基础设施的供给侧与需求侧展开,或者说是围绕Token的生产、流通与消费展开。本次英特尔技术创新与产业生态大会就像是这个新时代、这场变革的一个切片,英特尔试图说明,自己卖的不再只是一颗颗芯片,而是面向智能体时代且有更高投资回报的算力方案。
确实,当一天500万亿次甚至更多Token的消耗成为常态,真正稀缺的,或许早已不是算力本身,而是能把算力变得像水或电一样廉价、可信且随手可得的能力。这份答卷的成色,仍需在更大的AI浪潮里历练与考验。







