Token导航 LogoToken导航TokenDH.com

中信建投 | 有效算力框架下复盘AI演进:硬件结构性倾斜,云端生态格局重塑

更新时间 2026-05-26来源 研报精选正文 1.8万字阅读约 56分钟28 张图片
本文转载自微信公众号:中信建投证券研究
图片
文|于伯韬 许悦
海外AI行业核心投资逻辑呈现两条主线:在硬件与基础设施端,大模型推理的“两相结构”与Agent编排工作流导致通用GPU的边际收益下降,算力军备竞赛正向能源与电网要素的竞争演变,并驱动服务器架构向高数据复用率的ASIC(如谷歌TPU)、高性能指挥层CPU(CPU:GPU配比迈向1:1)以及因扩容刚需价格暴涨的DDR5 DRAM发生结构性倾斜;在模型与云生态端,随着OpenAI GPT-5.5的发布,其Codex生态的下载安装量正缩小与Anthropic Claude Code的差距 ,鉴于模型技术领先到市场份额变化存在3-6个月的滞后效应 ,Microsoft、Oracle及CoreWeave等OpenAI阵营的算力与云合作方正迎来确定性的叙事修正与战略性份额扩张的投资机会。
图片
有效算力预测模型预示AI模型性能提升的瓶颈来自物理算力、算法、范式,底层提升瓶颈主要是能源。Leopold Aschenbrenner在2024年6月发布的《Situational Awareness》报告引入了前沿的能力预测假说,即模型能力与由“物理算力×算法效率×Unhobbling杠杆”共同构成的“有效算力”呈现单调线性特征。历史数据显示,前沿AI训练算力在过去10—15年间以年均0.5至0.7个数量级(OOM)的速度扩张。报告推演,2023至2027年间全球AI总有效算力将再次实现约5个OOM的跃升,推动AI跨越AGI初级门槛(对标PhD级专家/自动化AI研究员)。但物理制约正在迫近,预计到2028年,单个前沿集群投资将突破千亿美元级别,峰值电力需求达10GW,AI算力的军备竞赛本质上正演变为能源供应与电网要素的竞争。
系统级工程优化与ASIC崛起。随着算力规模扩展,大模型竞争焦点已从“大参数+大训练FLOPs”的单一叙事转移到系统级硬件协同。在推理端,大模型工作负载呈现明显的“两相结构”:Prefill阶段偏向算力受限,而Decode阶段更偏向内存带宽受限,HBM的访存带宽成为主要瓶颈。这一特征推动ASIC的机会窗口,如谷歌TPUv6e通过脉动阵列设计实现中间计算的“零访存”,大幅降低了对昂贵HBM带宽的依赖,在Token成本与功耗上建立起对通用GPU的非对称优势,Anthropic已承诺自2026年起部署超100万片新型TPU芯片。此外,算法与底层的打通(如DeepSeek的多Token预测MTP架构及定制显存内核融合)正成为新的工程技术壁垒。
Agent工程化落地与算力重心向CPU转移。行业评价标准正在从“模型谁最聪明”演变为“Agent系统在崩溃前能自主工作多久”,核心范式转向“Agent=Model+Harness(工具调度、安全护栏等运行环境的基础设施)”。在Agent带来的“长会话+多轮工具回填”工作负载下,系统瓶颈正发生结构性转移:①CPU角色剧变:CPU在编排工作流和工具处理中从配角变为指挥层,相关处理在个别工作负载下可占总延迟的90.6%。②配比靠拢:算力基础设施的CPU:GPU比例正明确从传统的1:8向1:1(Parity)演进,并导致服务器DDR5DRAM因扩容刚需而出现价格暴涨。③范式革新:“VibeCoding”带来的启发式学习(HL)大幅降低了代码规则修改与维护成本,在小样本场景下的效率和最终性能已可比肩甚至超越昂贵的传统深度强化学习(PPO),成为低成本、高可控的Agent迭代新策略。
当前市场对于①HBM高景气度已经取得较高共识且反映到业绩层面,SK hynix 2026Q1营业利润率 72%(超过Nvidia的65%及台积电的58%),其中DRAM平均售价(ASP)环比上涨mid-60%,NAND ASP上涨mid-70%,受强劲定价支撑。SK Group会长崔泰源在2026年3月表示,全球芯片晶圆短缺可能持续到2030年,因为HBM需求持续超过供应并导致制造产能紧张。他补充说,扩大晶圆产能可能需要至少四到五年时间,预计缺口超过20%。 ②CPU也正处于快速定价阶段,Intel/AMD个股年内涨幅超过100%+,且管理层明确提出CPU长期受益于AI带动TAM大幅提升,Intel 电话会给出 CPU:GPU 从 1:8→1:4→向 parity 的明确口径(agentic orchestration 驱动)。③可能尚未充分发掘的方向: NVMe/eSSD、DPU、CXL/分层内存软件栈。在KV分层/多agent并发下,会变成不可或缺的系统部件(Samsung offload、SNIA distributed KV 都在给它补叙事)。
前沿模型商业化路径的结构性分化。在全球模型竞争与份额变迁上,存在三个关键动态:①国内外性能错位:国产模型虽然在公开基准测试上直追海外,但在引入防泄露的半私有/私有加权测试后,真实场景表现实际落后美国顶尖模型约8个月,目前的竞争优势仍主要维系在开源和极高性价比上。②前沿模型差异化:在前沿Agent领域,GPT-5.5在终端优先Agent(Shell执行与DevOps自动化)中具备明显的Token节省(少用72%输出Token)与速度优势;而ClaudeOpus4.7则在代码库优先Agent(PR审查、多语言重构)和工具编排协议(MCP)上保持领先。③云厂商投资启示:随着GPT-5.5的发布,OpenAI旗下的Codex在下载及VSCode插件安装量上正快速反超或缩小与ClaudeCode的差距。由于模型领先转化为市场份额存在3—6个月的滞后效应,这预示着Microsoft、Oracle、CoreWeave等OpenAI阵营的算力与云合作伙伴正迎来叙事修正与份额变化的投资机会。
图片
智能压缩:算力、数据、算法是核心要素,商业化关注交互形式/场景
核心逻辑框架:有效算力作为能力预测变量。Leopold Aschenbrenner在2024年6月发布的《Situational Awareness》报告中提出了一个突破性的AI能力预测框架,该框架的核心创新在于将"能力涌现"这一长期被视为神秘现象的问题,转化为可量化、可预测的工程学问题。有效算力 (Effective Compute) = 物理算力 × 算法效率乘数 × Unhobbling杠杆。模型能力 ≈ f(有效算力),在适当的对数-对数坐标系下,这一函数关系呈现单调线性特征,这意味着能力增长可以通过追踪有效算力的数量级(Order of Magnitude, OOM)变化来预测。经验数据表明,每增加1个OOM ,模型在标准化任务上的表现会产生可测量的台阶式跃升。
图片
这一框架并非理论推测,而是建立在长达十余年的实证观察之上。OpenAI团队在2020年发表的开创性论文《Scaling Laws for Neural Language Models》(Kaplan et al.)中首次系统性地证明:神经语言模型的性能(以交叉熵损失衡量)与模型参数量(N)、数据集大小(D)、训练算力(C)存在精确的幂律关系。该研究的核心发现包括:1)跨越7个数量级的一致性:在从10²到10⁹参数的模型范围内,缩放定律保持稳健,无系统性偏差。2)性能可预测性:给定任意两个变量,第三个变量对模型损失的影响可精确预测,预测误差通常在5%以内。3)单调递减关系:损失函数L与算力C的关系可表示为:L(C) ∝ C^(-α),其中α为经验常数,约为0.05-0.07。这种幂律关系不仅适用于训练损失(perplexity),同样适用于下游任务性能。PNAS 2024年发表的理论研究《Explaining neural scaling laws》 进一步从数学上证明了:对于多种模型架构和数据集,神经网络性能与模型规模、数据规模均呈幂律缩放。
图片
传统AI能力预测依赖于智能涌现,即认为某些能力会在特定临界点突然出现。这种思维方式导致预测充满不确定性和主观性。Aschenbrenner提出的OOM计数法改变了这一范式:①历史校准(2019-2023:GPT-2→GPT-4),追踪过去4年间三大驱动因子各自贡献的OOM数量:②物理算力扩张:GPT-2训练使用约4×10²¹ FLOP,GPT-4使用8×10²⁴至4×10²⁵ FLOP,增长+3.5-4个OOM;③算法效率提升:通过比较"达到相同性能所需算力"的变化,估算贡献+1-2个OOM;④Unhobbling解锁:从base model(续写模型)到ChatGPT(对话助手),通过RLHF、提示工程等手段实现质变。
图片
其次,将这4.5-6个OOM的增长映射到实际能力变化:①GPT-2(2019):基本语言理解,无法完成复杂推理;②GPT-4(2023):MMLU(综合知识):~86-90%准确率,MATH(数学推理):从GPT-3的5%提升至52.9%,HumanEval(代码生成):67%通过率,能力对标:优秀高中生至大学本科生水平。
展望,趋势外推(2023-2027:GPT-4→AGI门槛)。基于以下假设:1)物理算力增速维持:Epoch AI数据显示,2020-2024年前沿语言模型训练算力年增长率为5倍(0.7 OOMs/年),即使考虑边际递减,未来4年仍可贡献+2-3个OOM。2)算法效率趋势延续:ImageNet领域2012-2021年算法效率提升速率为0.5 OOMs/年(Erdil & Besiroglu 2022),语言模型领域类似。4年可贡献+1-3个OOM(保守估计2个);3)Unhobbling深度开发:从"聊天助手"到"自主智能体",通过test-time compute、多智能体协作、工具使用等手段,预计等效+1-2个OOM。预计2027年总增长:3-6个OOM(最佳估计~5个OOM)。按线性外推,这应对应从"优秀高中生"到"PhD级专家/能够自动化AI研究员工作"的能力跃升,即AGI(通用人工智能)的初级门槛。
图片
图片
有效算力的增长并非来自单一来源,而是三股力量的协同作用:物理算力的绝对扩张、算法效率的持续优化、以及通过工程手段解锁模型潜能(Unhobbling)。
1.物理算力的扩张
物理算力是最直观、最易测量的驱动因子。它指的是用于训练模型的原始浮点运算量(FLOP, Floating Point Operations),这一指标与硬件投入、训练时长、模型规模直接相关。
GPT-2到GPT-3用时约1.5年,增长近2个OOM;GPT-3到GPT-4用时约2年,再增长1.5-2个OOM。总计4年增长3.5-4个OOM,平均增速约0.9 OOM/年。传统摩尔定律预测芯片性能每18-24个月翻倍(~0.2-0.3 OOM/年)。Epoch AI数据显示,前沿AI训练算力在过去10-15年的增速约0.5 OOM/年,是摩尔定律的2倍以上。
图片
Epoch AI趋势仪表板显示,2020年以来前沿语言模型训练算力年增长率达到5倍(0.7 OOM/年),高于长期趋势的0.6 OOM/年(2012-24年均值),表明竞争加剧带来的军备竞赛效应。
图片
2.算法效率的提升
算法效率是最容易被低估的驱动因子。它不增加一个FLOP,却能让每个FLOP产生更大的智能增益。Erdil & Besiroglu (2022) 开创性研究《Algorithmic Progress in Computer Vision》追踪ImageNet数据集上2012-2021年间所有SOTA模型,固定数据集和评估指标,仅测量"达到相同准确率所需算力"的变化,这种方法剔除了硬件进步的影响,纯粹测量算法创新。论文核心发现,过去10年算法效率提升速率,大约每9个月减半所需算力(95%置信区间:4-25个月),对应0.5 OOM/年。Epoch AI 2024年论文《Algorithmic Progress in Language Models》研究了•2012-2023年大规模语言模型,计算增强型算法进步每9个月减半物理算力需求,这一速率快于摩尔定律的硬件增益,是AI进步被严重低估的原因,这一测算与《Algorithmic Progress in Computer Vision》大致对应。
图片
在Epoch AI论文中,研究团队对语言模型中的算法进展进行系统全面的分析,重点关注了预训练中的算法改进。研究团队发现,要达到某一性能水平所需的计算量大约每 8 个月减少一半,其 95%置信区间为 5 到 14 个月。这代表了极快的进展,超越了计算领域许多其他领域的算法进展,以及摩尔定律所表征的计算机硬件改进的 2 年翻倍时间。Shapley 值分析表明,60-95%的收益来自计算和训练数据的增加,而新算法仅负责 5-40%的进步。此外,该分析表明,随着计算规模扩展在 2018 年左右加速,算法改进的相对重要性随着时间的推移而降低。总体而言,近年来大部分性能提升更多地源于计算的大规模扩展,而非根本性的算法进步。
图片
这种成本下降主要来自四个方向的算法创新:1)Chinchilla Scaling Law(2022):训练时数据量与模型参数应等比例增长(20:1 tokens-to-parameters比)。新范式:更小模型+更多数据 = 更低推理成本+同等性能。等效算力节省:~0.5 OOM;2)推理优化技术:例如Flash Attention、Paged Attention、Continuous Batching,量化技术(INT8/INT4)配合校准。推理吞吐量提升3-10倍,成本对应下降;3)蒸馏(Distillation):用大模型生成高质量训练数据,训练小模型,可保留80-95%性能,但推理成本下降10-100倍,GPT-4o mini、Claude 3 Haiku都是此类产品;4)Mixture of Experts (MoE):只激活模型的一部分参数(如GPT-4推测的8个experts取2个),总参数可达1.8T,但单次推理仅用~300B,等效"大模型性能+小模型成本"。
3. Unhobbling杠杆
Base Model就像未经训练的天才儿童,拥有原始智能,但不知如何与世界交互。Unhobbling是将这种潜能转化为实用能力的过程。目前行业的进步主要驱动力来自1)RLHF:从续写机到助手的质变。OpenAI团队InstructGPT论文的发现1.3B参数的InstructGPT(经RLHF训练)在人类评估员的评价下在多数常识类问题上反馈优于175B参数的GPT-3(仅预训练) ,等效算力放大>100倍(~2个OOM)。2)CoT,Wei et al. (2022) 论文《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》,由于Base Model训练时见过大量逐步推理的文本(Stack Overflow、教科书等),但默认模式是直接输出答案,而CoT提示激活了潜在的推理链路,等效算力放大~10x(1+OOM)。
图片
3)Scaffolding与Agent架构。Scaffolding指在模型外部构建任务分解、工具调用、记忆管理等框架,让模型作为"大脑"运行。实证案例1:HumanEval编程基准,GPT-4 (无scaffolding):67%通过率,GPT-3.5 (简单scaffolding:多轮迭代+测试反馈):~70%通过率,更弱的模型+工程 > 更强的模型单次输出。实证案例2:SWE-Bench软件工程基准,GPT-4 (直接生成patch):~2%,Devin (GPT-4 + agent scaffolding):14-23%,能力放大:7-10倍。实证案例3:METR Agentic Tasks(AI自主研究能力测试),同一GPT-4 base模型,不同配置:对话模式成功率5%,基础工具调用成功率20%,多智能体协作+长记忆成功率~40%。反映Agent工具调用提升也等效预训练Scaling。
4)Test-time Compute:推理侧的Scaling Law。预训练耗时数千万GPU-天,等效人类文明数万年阅读。推理侧生成数百tokens,等效人类思考数分钟,这种不对称意味着巨大的"test-time compute overhang"。AlphaGo的启示(Jones 2021论文) :Hex游戏实证增加1.2 OOM test-time compute(搜索更多步) ≈ 增加1 OOM training compute,推理时多思考可替代训练时多学习。人类类比快速回答(System I):等效当前LLM的标准推理,深度思考(System II):几小时、几天、几个月的专注工作。若解锁百万级tokens推理,从数百tokens CoT(成本<$1)提升至100万tokens深度规划(成本~$100-1000,但可替代数周人类专家工作),等效算力放大:2-3个OOM。
将上述所有杠杆叠加对2027年预测的含义,即使物理算力和算法效率增长放缓,仅靠深度Unhobbling(特别是test-time compute),就可能实现从"回答问题"到"执行长期项目",从"工具"到"同事",从"智能助手"到"自主AI研究员"。
图片
从资源分配的角度,投入资源提升算力以用于预训练Scaling Up+后训练Unhobbling仍然是最稳健且效率最高的方向,但算力供应面临一些物理瓶颈。
图片
按照这个趋势发展,2028年AI投资将突破2万亿美元,单个前沿集群规模将达到1000亿美元级别,包含1000万块H100等效GPU(按当前价格约500亿美元硬件成本),10 GW峰值电力需求(相当于一个中型国家的工业用电),配套冷却系统、高速互连网络、数据存储设施,这意味着AI算力的军备竞赛演变为能源供应的比拼,本质是土地供应、电网、能源供应等要素的竞争,这意味着很多国家、地区在先天禀赋方面就被排除出竞争。
图片
行业竞争动态:硬件协同及系统优化,模型面向Agent场景优化
前述推演的核心思路是,模型训练的过程本身是压缩即智能,而压缩的速度快于智能积累的速度,10年内主流大模型团队可能将人类社会累计数千年的知识和推理逻辑以参数+架构的模式存储,并以推理的形式输出。但正如一个常人接受完通识及学术教育并不意味着其立刻具备创造生产价值的能力。如今的预训练/后训练(主要是RL)范式尽可能贴近特定领域的真实反馈和行为轨迹,例如编程,但世界上非编程用户占比仍然更高,如果顶尖模型没有面向用户/面向特定任务的适配(例如Harness),其商业价值可能大打折扣。因此,前述推演忽略的重要假设是模型从 Inbox(被动接收指令与信息处理)向 Outbox(主动向外执行动作与端到端交付)的能力跨越,例如过去强调的Chatbot/Search Tool等,但生产力工具(尤其是面向企业/政府)更关注端到端的任务完成,而非逐步确认/反馈。
此外,智能的价值可能由1)替代劳动力/任务价值,例如对应白领工资;2)竞争性工具/AI的价格,性能接近模型的价格决定。Leopold Aschenbrenner的推论很大程度建立在赢家通吃的假设,即OpenAI/Anthropic等寡头垄断,从而持续稳定地获取超额利润,如果顶尖模型持续面临低价冲击,这个循环可能面临长期威胁,短期只要AI能够持续自动化任务,价值获取仍然大于投入。
为了在低价冲击下维持商业闭环,并将‘智能’真正转化为‘生产力’,大模型产业的竞争焦点正在从“更大参数 + 更大训练 FLOPs”的单一叙事,迁移到两条更可商业化、也更可被工程化度量的主线:
聚焦系统级优化与硬件协同(Operator/Memory/ASIC)
在训练端,“理论峰值算力”与“实际可用吞吐”的差距越来越由 MFU(Model FLOPs Utilization)决定;在推理端,LLM 的关键瓶颈在很多负载下已呈现两相结构:prefill 更偏 compute-bound,而 decode 更偏 memory-bound,导致“堆TFLOPs”对单位推理成本的边际收益下降,反而推动了 KV cache 分层、存储/网络下沉、以及专用加速器(DSA/ASIC)的机会窗口。
突破性的工作例如①打破内存与通信墙:以Flash Attention为代表的算子优化,通过Tiling和Recomputation极度优化GPU SRAM与HBM的IO读写 ;在分布式训练中,自研通信库(如NCCL魔改、All-to-All优化)直接决定了万卡集群的线性加速比。②架构创新的工程化:DeepSeek MTP(多Token预测)或长上下文记忆机制(如Engram),若仅停留在PyTorch原生算子层面会导致严重延迟。真正的壁垒在于算法团队与系统团队打通,使用CUDA/Triton手写高度融合算子(Fused Kernels),重构底层显存分配逻辑。
图片
具体展开可以分为两个方向:1)DeepSeek的MTP工程化:从算法创新到CUDA/Triton优化。首先是, MTP(Multi-Token Prediction)的架构突破。多token预测(MTP)最初是为了增强DeepSeek-V3和DeepSeek-R1的训练性能而引入的 ,其权重已经在相应DeepSeek模型的预训练中进行了优化。这节省了额外的训练资源,如GPU使用和数据集准备所需的时间。 MTP模块(廉价的单层头)顺序预测额外的token(t₆和t₇)。训练受益于更密集的监督,因为每个隐藏状态不仅用于预测下一个token,还用于预测未来的token。在推理时,这些模块可以重新用于推测解码:主模型并行验证多个草稿token,实现更高的吞吐量。在DeepSeek-V3中,由于MTP1的接受率超过80%,推测解码在生成吞吐量上达到约1.8倍的加速。
图片
其次,NVIDIA TensorRT-LLM的系统级优化。MTP是DeepSeek系列模型中使用的推测解码方法 。以前,内核仅限于MTP-0或MTP-1(最多预测一个草稿token)。由于MTP-3通常在低延迟场景中提供卓越性能,引入了优化以启用原生MTP-3支持。 内核融合是提高性能的标准优化技术。对于DeepSeek-V3.2,Nvidia团队实施了特定的融合策略:为索引器K缓存填充定制内核。由于原始PyTorch操作是瓶颈,这导致推理吞吐量显著提高32.64%–64.20%。 Nvidia团队利用最新的模型特性,如DeepSeek的多token预测(MTP)来加速token生成,改善每输出token时间(TPOT)。MTP作为推测解码优化的一部分,用于提升生成速度。
再次,从PyTorch到CUDA的工程化鸿沟。内核融合是关键优化,将多个操作融合到单个GPU内核中,最大限度地减少单个内核启动的开销并减少CPU间隙 。通过在芯片上执行这些合并的操作,内核融合显著减少了较慢的片外内存访问,从而实现更快的处理。DigitalOcean团队使用程序化依赖启动(Programmatic Dependent Launch)尽可能重叠内核,这隐藏了内核启动开销并减轻了短运行内核中的尾部效应。这通过约10%改善了低批量大小、低并发、高交互性工作负载的性能。
2)通用GPU在推理端(特别是Decode阶段)存在架构冗余,算力定制成为破局点。从通用计算到DSA(领域特定架构):推理阶段的瓶颈已转移至内存带宽(Memory-bound)。Groq LPU(全SRAM架构)或Cerebras(晶圆级芯片)等极端设计,专为极低延迟或超长文本等特定场景而生。典型案例包括Google TPU v6 (Trillium), TPU v6e Trillium在以下关键改进方面超越前几代v5e和v5p :训练性能提升超4倍;推理吞吐量增加高达3倍。Trillium TPU相比TPU v5e实现了每芯片峰值计算性能4.7倍的增长。Google TPU团队将高带宽内存(HBM)容量和带宽翻倍,还将芯片间互连(ICI)带宽相比TPU v5e翻倍。Trillium TPU的能效比TPU v5e高出67%以上 。
TPUv6突破点在于①打破“内存墙”,实现“零访存”中间计算 。传统 GPU 架构在每次乘加运算后,通常需要将中间结果写回 SRAM/HBM,导致巨大的功耗与延迟。而在 TPU 的脉动阵列中,所有中间结果通过极短的物理连线在相邻 MAC 单元间直接“接力”传递,全程无需往返内存。这种设计将内存带宽压力降至最低。②契合 LLM 推理的 Memory-bound 特性 。在大模型 Decode(生成)阶段,算力瓶颈往往不在计算单元,而在 HBM 带宽。TPU v6e 通过极高的数据复用率(256次)和片上直接传递,大幅降低了对昂贵 HBM 带宽的绝对依赖,从而在单位 Token 推理成本和功耗控制上建立起对通用 GPU 的非对称优势。③提升集群实际 MFU(模型算力利用率),由于减少了内存读写冲突与等待时间,TPU v6e 在跑满大规模批处理任务时,能够维持极高的计算单元利用率,确保“标称算力”能最大程度转化为“有效算力”。
TPU取得良好的市场反馈,百万芯片级部署。2025年10月,Anthropic宣布了迄今为止已知的最大AI基础设施交易 ,公司将采购多达100万个TPU芯片,价值数百亿美元,在2026年上线超过1000兆瓦的容量。Anthropic使用Google TPU、Amazon Trainium和Nvidia GPU的多元化方法训练其Claude模型(包括Claude Opus 4.5)。由于卓越的性价比,TPU处理大部分训练和推理工作负载(SemiAnalysis,2025年12月)。2025年10月发布的Claude Opus 4.5建立了编码能力的新基准,同时API定价降低了约67% 。 Anthropic承诺从2026年开始部署超过100万个Ironwood(TPU v7)芯片,展示了该架构的可靠性。该公司计划利用超过1000兆瓦的TPU容量专门用于训练和服务Claude模型。
Agent工程化(Harness/协议/编排/可观测性)与“可验证反馈闭环”
当前竞争要素在于能否把模型变成可靠系统,例如工具协议、身份与权限传递、错误语义、预算与重试策略、审计与回放等,正在从各家私有层上升为行业标准与开源基础设施。MCP 的扩张(~97M/月 SDK 下载、10,000+ 服务器)与随之而来的供应链 RCE(远程代码执行)风险(150M+ 总下载、约 200k 部署、14+ CVEs)共同说明:协议与运行时层不仅是‘价值密度’最高的位置,而且‘风险密度’最高。缺乏确定性安全护栏的Agent,在企业内无异于敞开的后门。
2026年,行业评价标准已从“哪个模型最聪明”转变为“你的Agent能在崩溃前自主工作多久”。Agent = Model + Harness 成为行业共识。大量企业Agent试点无法投产,根因并非模型智力不足,而是缺乏成熟的Harness(代理工具集与运行环境)。Harness不是Agent本身,而是管理Agent操作的完整基础设施(工具调度、安全护栏、反馈循环、可观测性层)。在Prompt中要求“遵循标准”是概率性的,而通过Harness接入Linter在违规时直接阻断PR,则是确定性的。下一个竞争前沿是向外延伸,企业不再构建更聪明的Agent去适应混乱的遗留系统,而是重新架构内部API、代码库和数据库,使其本质上对AI可读、可交互。
OpenAI研究员翁家翌2026年5月8日发布Learning Beyond Gradients ,提到启发式学习范式(Heuristic Learning),本质上就是人类learning by doing的翻版,初始基于经验或者随机假设一个规则,基于规则摸索实现目标,根据反馈不断修正初始规则,最终迭代出最优规则。这一范式本身并不新颖,重要的是Vibe Coding大幅降低了维护成本,使得启发式学习在小规模项目下的效果大幅提升(开发编译成本也大幅下降),后续规模扩大则需要结合深度学习。
图片
HNS 是 human-normalized score,也就是把每个游戏分数按人类基线归一化以后再比较。在完全无人工介入的批量运行里,native_obs 到 1M 步附近的 Atari median HNS 已经到 0.32,ram 是 0.26,明显高于图里 PPO2 / CleanRL EnvPool PPO 的早期曲线;到 9.7M 步附近,native_obs 是 0.81,ram 是 0.59。同一张对比里,OpenRL Benchmark 保存的 PPO2 / CleanRL EnvPool PPO median HNS 曲线到 10M 步大约是 0.88 / 0.92。
这一数据有力地证明:在Vibe Coding大幅降低代码修改成本的今天,‘直接修改代码/规则’的启发式学习(HL),其样本效率和最终性能在小样本场景可比肩甚至超越传统的深度强化学习(如PPO)。这意味着Agent的进化不再唯一依赖昂贵的梯度反向传播,‘代码即策略’成为低成本、高可控的Agent迭代新范式。
Claude Code的工程架构即ReAct循环+安全+压缩。Claude Code的核心是ReAct模式的while循环:组装上下文→调用模型→分发工具→检查权限→执行→重复。实现为AsyncGenerator,流式生成事件。一个npm源码地图泄露事件暴露了Claude Code的完整架构 :8层安全、4级消息压缩、成本感知的错误恢复,以及更多内容。内部包含超过4,600个源文件,跨越55+个目录。构遵循分层依赖模型:Presentation层了解组件和屏幕,但不了解API调用或工具执行;Application层协调流程:QueryEngine管理对话,命令路由用户意图,hooks注入生命周期行为;Domain层定义核心抽象:Tool是什么,AppState是什么样子,权限如何工作;Infrastructure层处理I/O:API调用、文件持久化、分析、MCP连接。后续发展增加了Claude.md/Skills/Hooks/Subagents等模块,这是Agent工程从"提示词"向"系统架构"演进的关键证据。
图片
工程架构的变化导致系统瓶颈从GPU转向CPU。在每次推理调用之间,CPU处理输出 ,决定agent是否完成,并要么提供下一个提示,要么移动到下一步。一旦所有子agent完成,CPU收集所有输出并将其发送到GPU进行反思推理循环。 在编排工作流中,CPU从配角变为指挥层。CPU性能最终决定了GPU的利用率 。Intel团队发现 ①工具处理在CPU上可能占总延迟的90.6%;②Agent吞吐量受CPU因素,一致性、同步和核心过度订阅或GPU因素——主内存容量和带宽的瓶颈;③CPU动态能耗在大批量大小时占总动态能耗的44% 。 
在每次推理调用之间,CPU处理输出,决定agent是否完成,并要么提供下一个提示,要么移动到下一步。一旦所有子agent完成,CPU收集所有输出并将其发送到GPU进行反思推理循环。一旦所有子agent完成,CPU收集所有输出并将其发送到GPU进行反思推理循环——本质上询问模型,"我们是否足够好地回答了原始问题?"如果没有,整个循环重新开始。CPU所需的关键特征 是:高单核时钟速度(以最小化编排延迟)、高核心数(并行运行多个agent)、快速内存访问和大缓存(管理所有上下文和中间状态)、强大的I/O连接(PCIe通道用于网络和存储,因为agent不断访问API和数据库) 。
图片
面向AI Agent应用场景,传统内存架构正面临显著的结构性制约。片上SRAM的容量需求高度依赖于具体部署环境(云端数据中心或端侧设备)及工作负载类型(模型训练或推理)。然而,无论何种场景,凡涉及AI训练或推理的计算任务,均须在计算单元近旁配置大容量SRAM,以保障数据供给效率。在实际数据流调度中,数据需自低速持久化存储(冷存储)逐级加载至片外高速内存(如DDR或HBM等“温存储”层),随后以极低延迟在片外内存与紧邻算力核心的片上SRAM之间进行高频双向搬运,从而满足计算单元对数据吞吐与访问延迟的严苛要求。
图片
Agent工作负载下的HBM需求特征,对于Qwen2.5-14B模型应用GQA后,每个token的内存占用约0.2MB。在200K token时,KV缓存约40GB,这在H100的80GB VRAM中已经紧张。在100万token时,约200GB,单GPU物理上不可能容纳。以H100为例,HBM带宽为3.35TB/s,每token计算约10μs。对于10GB模型和20GB KV缓存,从HBM移动30GB到GPU缓存可能需要约9ms,导致约99%的空闲时间(9ms ÷ [9ms + 0.01ms])。GPU利用率的瓶颈主要是HBM带宽,大约90%+的时间在等待内存数据。
Claude Code的Prompt模块导致缓存利用率不高。缓存写入有25%的额外费用 ,触发缓存的最小token阈值:Sonnet和Haiku为1,024,Opus可达2,048-4,096。低于此阈值,存储和查找缓存的开销不值得。Claude Code的系统提示词约4,000 token,所以总是超过最低阈值。Anthropic的缓存在约5分钟不活动后过期。每次缓存命中重置计时器。切换模型表面上看节约了成本,但实际上导致之前的缓存无用。本可以以缓存读取价格读取的上下文可能需要重新写入和计算。Prompt Cache按模型隔离。Opus、Sonnet和Haiku有不同的架构和权重,因此从相同文本计算的KV缓存不可互换。如果在Opus中建立长上下文后切换到Sonnet,Sonnet无法重用Opus的缓存。
图片
Agent工作负载= 执行循环 + 状态常驻。Claude Code / Cowork的本质是把 LLM 从 Inbox(被动生成)推向 Outbox(能做事):模型反复“计划→调用工具→回填→再推理”。这会把系统开销拆成三块:①Cold prefill:长 system prompt / 工具定义 / repo 指引首次编码(高 compute + 高 HBM 带宽);②Resume prefill:把工具输出追加到已缓存上下文后继续(强依赖 cache 命中与 KV 复用);③Short decode:每轮生成少量 token,但轮数多、对尾延迟敏感(往往更 memory-bound)。这类分解在 AgentServe 等系统研究 中被明确指出:agentic workload 会自然分离成 cold prefills、resume prefills 与短 decodes。与此同时,CPU 不再是“配角”:Intel/Georgia Tech 的研究对多种 agentic workload 做 profile,发现CPU 上的 tool processing 可占总延迟最高 90.6%。台积电1Q26电话会也把需求驱动说得很直白:从 query mode 到 agentic command-and-action mode,会带来 token consumption 的“又一次台阶式上升”,从而支撑对领先制程 silicon 的强需求。最终逻辑对应Agent 普及 → CPU 配置上移(更高核数/更大内存/更强 IO)→ 服务器 DRAM(尤其 DDR5 RDIMM)从“配套”变成“扩容必选项”。
Claude Code/Cowork这种“长会话 + 多轮工具回填”会让 KV 成为 HBM 的主角;HBM 不再只是“放权重的显存”,而是“承载活跃会话状态的昂贵内存”。 在许多推理负载下,prefill 相对 compute-heavy,但 decode 更偏 memory-bound(权重与 KV 的访存/带宽成为瓶颈),你给出的“两相结构”框架与 SPAD 的结论一致。多轮循环会让上下文不断增长,并且需要在回合之间“带着状态走”(工具输出、diff、测试日志、审计信息)。Llama3‑70B:KV cache 327 KB / token,128K tokens 约 40 GB KV,1M active sessions 的聚合 KV 足迹可达 40 PB(用于说明“为什么必须分层/外置”,不是单机需求) 。
图片
此外,Anthropic 官方对 Cowork 桌面架构的描述很明确:Cowork 在每台设备上有两套执行环境,其中shell 命令与 Claude 写的代码在“本地 Linux VM”里执行(macOS 用 Apple Virtualization.framework,Windows 用 Hyper‑V),并且 VM 有网络/系统调用限制与会话隔离。因此,Cowork 普及不仅吃云端 HBM,也会抬升终端侧的CPU DRAM 与本地 SSD最低门槛(VM、会话日志、repo 缓存、工具链)。
当前市场对于①HBM高景气度已经取得较高共识且反映到业绩层面,SK hynix 2026Q1营业利润率 72%(超过Nvidia的65%及台积电的58%),其中DRAM平均售价(ASP)环比上涨mid-60%,NAND ASP上涨mid-70%,受强劲定价支撑。SK Group会长崔泰源在2026年3月表示,全球芯片晶圆短缺可能持续到2030年 ,因为HBM需求持续超过供应并导致制造产能紧张。扩大晶圆产能可能需要至少四到五年时间,预计缺口超过20%。②CPU也正处于快速定价阶段,Intel/AMD个股年内涨幅超过100%+,且管理层明确提出CPU长期受益于AI带动TAM大幅提升,Intel 电话会给出 CPU:GPU 从 1:8→1:4→向 parity 的明确口径(agentic orchestration 驱动)。③可能尚未充分发掘的方向: NVMe/eSSD、DPU、CXL/分层内存软件栈。在KV分层/多agent并发下,会变成不可或缺的系统部件(Samsung offload、SNIA distributed KV 都在给它补叙事)。
模型侧,顶尖模型能力已趋同,但Agent商业化路径呈现结构性分化。国产模型在主流基准测试集上表现非常接近海外顶尖模型,但如果引入半私有/私有基准测试集,例如网络安全、编程、自然科学等领域,CAISI机构加权测试结果后发现国产模型当前表现对应于~8个月前的美国顶尖模型,反映国产模型普遍存在测试集泄露或基于测试集优化的情况,模型的真实场景表现往往落后于跑分。尽管如此,国产模型的价格远低于海外模型,从性价比的角度看国产模型具备优势,且大多数模型均有开源版本。
图片
Opus 4.7在SWE-Bench Pro上保持64.3% (vs GPT-5.5的58.6%)和MCP-Atlas上79.1% (vs 75.3%) 。Anthropic本身标记了SWE-bench部分问题的记忆化担忧,但通过MCP的工具编排领先是真实的,对于重构密集型和大型PR工作负载很重要。其中GPT-5.5优势在于Terminal-first Agent(Shell执行、DevOps自动化),Claude Opus 4.7优势在于Codebase-first Agent(PR审查、多语言重构)。需要注意,GPT-5.5使用72%更少的输出token,这在高容量Agent场景中是成本和速度的双重优势。
Gemini 3.5 Flash定位基本上可以看作Gemini 3.1 Pro+面向特定Agent任务优化的版本,但是基础Gemini 3.5模型参数量级应该更大,这一点从定价也能看出。Gemini 3.5 Flash定价为$1.50/每百万输入token和$9.00/每百万输出token 。这比Gemini 3 Flash的$0.50/$3.00大约增加3倍,定价策略也反映当前市场从低价抢份额,转向完成高质量任务(更好的模型解锁更高价值的任务,token对应的劳动力时薪更高)。
我们在Npm/Bloomberry渠道看到的下载/安装量,Npm方面Codex自从GPT-5.5发布后4月底已经超过Claude Code的新增下载/安装量,Bloomberry方面则看到Codex缩小跟Claude Code的差距。对于CSP的直接启示仍然是Microsoft/Oracle/CoreWeave等OpenAI合作方的机会,模型领先到份额变化存在3-6个月的滞后效应,且考虑算力供应/能源/IDC瓶颈,OpenAI布局领先Anthropic,我们认为Microsoft/Oracle/CoreWeave等存在一定叙事修正的机会。
图片
投资评价和建议
AI行业核心投资逻辑呈现两条主线:在硬件与基础设施端,大模型推理的“两相结构”与Agent编排工作流导致通用GPU的边际收益下降,算力军备竞赛正向能源与电网要素的竞争演变,并驱动服务器架构向高数据复用率的ASIC(如谷歌TPU)、高性能指挥层CPU(CPU:GPU配比迈向1:1)以及因扩容刚需价格暴涨的DDR5 DRAM发生结构性倾斜;在模型与云生态端,随着OpenAI GPT-5.5的发布,其Codex生态的下载安装量正缩小与Anthropic Claude Code的差距 ,鉴于模型技术领先到市场份额变化存在3-6个月的滞后效应 ,Microsoft、Oracle及CoreWeave等OpenAI阵营的算力与云合作方正迎来确定性的叙事修正与战略性份额扩张的投资机会。
图片
宏观经济与基础设施瓶颈风险:随着前沿AI集群规模向千亿美元及10 GW级峰值电力需求演进,AI算力的军备竞赛本质上已转化为土地供应、电网与能源等宏观生产要素的竞争。若宏观经济波动导致全行业资本开支收紧,或者由于物理资源禀赋与基础设施配套滞后导致电力电网供应面临刚性制约,前沿集群的部署进程可能被迫延期,这将导致AI有效算力的数量级(OOM)增速低于预期,进而直接冲击算力产业链的收入增速与当前市场的高估值支撑。
政策监管与安全合规风险:Agent技术从被动接收指令(Inbox)向端到端动作交付(Outbox)跨越的同时,也大幅抬升了协议与运行时层的风险与安全漏洞密度。目前模型上下文协议(MCP)的大规模扩张已经带来了供应链远程代码执行(RCE)等严重且具确定性的安全隐患。若各国政府因数据隐私、系统确权或漏洞防御而收紧安全监管护栏,缺乏确定性安全防线的企业级Agent试点将面临大面积叫停或合规成本飙升的风险。
行业竞争与商业闭环受阻风险:如果前沿顶尖模型持续面临低价冲击与开源生态的非对称竞争,行业可能无法实现预期的赢家通吃垄断,从而对长期获取超额利润的商业循环造成威胁。当前国产大模型利用高性价比和开源策略积极侵蚀市场,同时海外巨头的部分前沿模型也在特定场景下进行了大幅度的API降价。这种在公开基准测试驱动下的“价格战”可能导致智能价值的变现效率低于预期,导致企业难以覆盖高昂的研发与预训练算力投入。
公司经营与系统工程执行风险:大量企业级Agent试点无法投产的根因并非模型智力不足,而是缺乏管理Agent工具调度、安全护栏与成本感知恢复的成熟Harness基础设施。而在软硬件编排的实际执行中,CPU端的工具处理在个别工作负载下可占据总延迟的90.6%,系统瓶颈正在向CPU核心数与DDR5带宽发生结构性转移。若相关科技企业在打通算法与系统层、手写CUDA/Triton融合算子或异构外置存储协同重构上执行不力,将直接导致系统面临高延迟、高功耗或频繁崩溃的困境。
图片
于伯韬:海外研究首席分析师,FRM,香港大学金融学硕士,2020年加入中信建投海外研究团队,2018-2020年就职于长江证券研究所海外团队,2025/2024/2021/2020年新财富港股及海外方向第五名,2022年新浪金麒麟港股及海外市场最佳分析师第三名,2020年新浪金麒麟港股及海外市场新锐分析师第一名。
许悦:海外研究员,南洋理工大学硕士,专注于港股互联网及美股软件研究,2022年加入中信建投海外前瞻组,2023年新浪金麒麟港股及海外市场菁英分析师第二名,2023-24第十七届、十八届水晶球最佳分析师海外行业入围,2024年度证券时报·新财富杂志海外市场研究团队第五名。
证券研究报告名称:《有效算力框架下复盘AI演进:硬件结构性倾斜,云端生态格局重塑》
对外发布时间:2026年5月25日
报告发布机构:中信建投证券股份有限公司 
本报告分析师: 
于伯韬 SAC 编号:S1440520110001
SFC 编号:BRR519
许悦 SAC 编号:S1440523030001
文章标签算力大模型
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多