
AI最终是一场体系战
作者/ IT时报 郝俊慧
编辑/ 孙妍
2013年,科幻电影《她》结尾时,Samantha离开了西奥多,她进化得太快,最终进入了一个人类无法抵达的世界。13年后,这样的未来,可能不再只是想象。
9月,一个并不算新的概念突然成为全球AI圈的高频词——RSI(Recursive Self-Improvement,递归式自我改进),OpenAI、Anthropic等全球顶尖AI企业先后公布了自家的RSI研究进度。
RSI思想源头可追溯至20世纪60年代英国数学家I.J. Good提出的“智能爆炸”假设:如果一台超智能机器能够设计出比自己更好的机器,那么它也可以设计出自己的“下一代”,由此可能形成不断加速的智能迭代。
科幻已经照进现实。据Anthropic披露,截至2026年8月,Claude已在约26%的内部AI研发工作中扮演“Lead”角色,但并未实现完全自主;OpenAI则宣布已经实现“自动化研究实习生”目标,并且朝着2028年3月打造“自主AI研究员”的目标稳步推进。
无独有偶,9月22日,RSI也出现在了2026杭州云栖大会上。“Qwen团队正在进行RSI探索,并已经取得一定进展。”当天,阿里巴巴集团CEO吴泳铭给出了一个更为惊人的判断:未来机器思考的总量,将达到人类的1000倍以上,“机器动力不是简单的‘人造体力’,而是创造了完全不同的物种。”

然而,问题随之出现:如果这一天真的到来,如此庞大规模的“机器思考”,由谁来生产?如此聪明的机器智能,由谁来控制?
今年云栖大会上,阿里用AI模型、AI芯片和AI云回答了第一个问题,将其定义为“机器智能时代的三大基石”,并将长期坚定投入这三项基础设施建设;而对于第二个问题,吴泳铭说,“很难具体描绘未来是什么样的,但我始终认为,AI越强大,人类更强大。”


AI模型
让AI开始“造AI”
一年前的云栖大会,吴泳铭首次系统性阐述了ASI(超级人工智能)的三个演进阶段:智能涌现、自主行动、自我迭代,仅仅过了一年,通往ASI的技术路径变得更加清晰,“就是RSI”。
吴泳铭首先拆解了现在的“人工智能(Artificial Intelligence)”概念,他认为Artificial更强调“人造的智能”,言外之意是和人一样的智能,但事实上机器智能是完全不同的物种,随着ASI的逐步实现,机器正在成为思考的主力,智能将成为一种规模化的商品,“显然将未来称为‘机器智能时代’更加准确。”
AI模型是实现RSI的基石。吴泳铭认为,过去一年,通往ASI的技术路径逐渐清晰:模型可以从真实反馈中发现自己的短板,自主设计实验、构建数据、评价结果,再进入下一轮改进。
Qwen已有一定探索。据阿里披露,Qwen3.8-Max曾通过自主搭建训练流程,在人类“零参与”的情况下持续迭代超过一个月,完成33轮有效迭代。结合RSI和后训练等技术,新版本在Artificial Analysis上的得分提高了12.5%。
RSI不仅体现在AI自我训练上,在阿里芯片模型协同设计的一项实验中,Qwen3.8-Max仅基于一份真实的芯片模块规范,便在工业级EDA环境中进行了自主设计、验证和优化,模型连续自主运行超过60小时,调用EDA工具超过1万次,最终完成物理实现,并将模块面积减少42%。
阿里巴巴ATH事业群Token Foundry Qwen LLM项目负责人刘大一恒在现场演讲中也透露,Qwen3.8-Max的总参数量为2.4T,较2023年底开源的720亿参数Qwen-72B,总参数量增长约33倍,而基于新架构的Qwen4正在训练,后续Qwen4.5和Qwen5计划将总参数量推向5~10T,目标是完成更复杂、更长程的任务,向ASI迈进。
当然,这离严格意义上能够完全自主研发下一代AI的RSI还相当远。
9月中旬,由上海交通大学、清华大学、字节跳动、上海人工智能实验室等机构研究者合作在ArXiv发表的论文《由人类构建的最后一个人工智能:迈向真正的递归式自我改进(V2)》中提出了RSI的三个目标:扩展能力边界、提升资源效率、发现人类预设策略之外的新方案,并“以责任转移为判据”将RSI的自主性划分为L1~L5五个层级,而最高L5等级的判断标准是,“AI可以修改负责未来改进的机制本身,并用修订后的机制进行后续轮次”。
面对AI自主进化的未来,更多人类变得焦虑。OpenAI本月明确表示,完全自主的RSI今天尚未发生,“除非能够安全实现,否则我们不应追求它”,而安全措施与模型性能无法同步的矛盾,或将在全球爆发L5到来之前最为激烈的论战。
然而,“与人类的进化一样,人工智能的进化也将经历一段漫长而非凡的历史。迄今为止,人工智能所取得的成就,不过沧海一粟”,这也是今天AI基础设施厂商依然坚定投入的战略注脚。


算力
从一块芯片到一个系统
“之前阿里哪有硬件,现在全是硬件。”9月22日,2026杭州云栖大会算力馆,两位参会者边参观边感慨,磐久服务器、直流不间断电源模块、IT模块、冷却&配电模块……阿里云几乎将整个机房搬进了展馆,而且每个展项上都写着“自研”二字;而在展示阿里全部AI能力的智能馆,真武系列超节点永远是人气最旺的展区。
这是阿里第一次全面展现出自己的“算力肌肉”。在展区,记者看到了从计算、CPU、互联、网络到存储的一整套平头哥(阿里巴巴全资控股的半导体公司)芯片,其中真武系列承担AI计算,倚天系列承担CPU计算,ICN Switch负责高速互联,磐脉系列承担智能网卡,镇岳系列覆盖存储主控……组建超大规模AI集群所需的核心芯片已全面覆盖。
国产AI算力的竞争,正在从“拼一颗芯片”转向“拼一台计算机”,最终拼整个算力系统。
因此也更容易理解,为何阿里并没有公布真武V900单芯片的具体算力指标,只表示其性能是真武M890的3倍,却更强调了其搭载的显存是216GB,片间互联带宽达到1200GB/s,并原生支持FP8、FP4低精度计算。

如果将这几个数据拆解来看,216GB显存解决的是记忆常驻问题,更大的模型参数、上下文和KV Cache可以尽可能驻留在高速显存中,从而减少频繁的数据搬运;1200GB/s片间互联解决的则是为了降低模型被切分到多颗芯片之后的通信开销;而原生FP8/FP4解决的是成本,据平头哥(阿里巴巴全资控股的半导体公司)副总裁高慧透露,精度每降一档,一度电换来的Token数量基本可以翻一倍。

截至2026年6月,真武系列已服务超过650家企业客户。吴泳铭表示,随着平头哥芯片产品线成熟和客户扩大,AI芯片年出货量将大幅提升。
CPU也再次走上舞台。今年云栖大会上,平头哥首次公布了倚天服务器CPU的规划,据高慧透露,2027年将推出倚天720和倚天730两代服务器CPU,其中倚天720将实现单核性能、核密度与能效的全面提升;倚天730则首次基于平头哥全自研CPU微架构设计,单核SPECint2017/GHz性能将最高提升至倚天710的1.4倍。

所有这些布局最终都集中体现于阿里云当天发布的新一代AI Native超节点服务器——磐久AL64分布式SNPO光互连超节点,以及将在2028年推出的磐久AL144超节点。阿里提供的数据显示,磐久AL144超节点单柜支持650kw,ScaleUp规模可扩展至10368。

其中,一个值得关注的技术是SNPO(ScaleUp NPO,ScaleUp专用近封装光学)。按照阿里的说法,磐久AL64是全球首款实现SNPO光互连技术落地的超节点服务器,这意味着近封装光互连开始从原型概念进入AI云的真实工程部署。

在智能馆展区,记者看到了磐久AL144超节点,与磐久AL128对比可知,AL144进一步改变了超节点内部的布局方式:AL128将GPU Node、CPU Node和Switch Node分开部署,可以根据客户需求灵活组合不同计算、互联资源,更适合对硬件配置和部署方式有定制需求的专有云场景;AL144则将CPU和GPU集中到同一个Compute Node中,缩短CPU与GPU之间的数据传输距离,并结合SNPO光互连进一步提升Scale-Up互联密度。前者强调灵活组合,后者则更强调极致的计算密度和互联效率。

阿里给出的数据是,通过阿里云全新设计的智算中心网络架构,磐久单一集群可扩展至50万卡规模。

颇有意味的是,就在一周前,华为也刚刚宣布在新一代昇腾960超节点中引入NPO近封装光学技术,基于灵衢实现内存统一编址,可扩展至4096卡规模,二层CLOS四平面组网后,可支持最大51.2万卡,再结合多轨道拓扑最大支持100万卡集群。
当模型进入十万亿参数、集群迈向十万乃至百万卡之后,真正决定Token产能的,是几十万颗芯片能否像一台计算机一样工作。从这个角度来看,两家大厂几乎不约而同地选择了同一个方向,让“光”进入AI超节点。
这种殊途同归背后是一种共识,Agentic AI正在重新定义整个计算系统,Scaling Law将持续在AI基础设施厂商处奏效。

AI云
承载机器智能的“超级电网”
当然,芯片仍然不是最终答案。
AI云是阿里提出的第三个基石,随着可实现千卡Scale-Up以及50万卡级集群的下一代超节点逐步落地部署,云正从传统AI基础设施向Agentic Cloud演进。
云栖大会当日,阿里云宣布今年第四季度将在宁夏中卫地域新增灵骏真武 M890 超节点服务,而在40天前的8月12日,阿里云在内蒙古乌兰察布已经正式上线了同款AI服务。
官网显示,灵骏真武M890超节点实例支持 FP8/FP4 低精度计算,通过 ICN Switch 1.0 芯片Scale-up 互联规模达64卡,卡间互联提升至800GB/s。在模型训练、智能驾驶、具身智能等训练场景中,相比上一代性能提升三倍。
作为国产十万卡的云上超节点集群,位于乌兰察布的阿里云灵骏真武M890超节点已成功运行超2万亿参数大模型,Kimi K3和Qwen3.8 Max均已通过该算力形态对外提供服务,企业无需自建机房,即可跨入万亿参数大模型所需的高密度算力门槛。
“阿里云打造了业界领先的全栈AI Native基础设施,灵骏超节点正式上线30多天,就有上百家企业级客户陆续接入。”阿里云弹性计算负责人吴结生透露。

吴泳铭也表示,由于目前客户AI需求强劲,行业中长期需求远超供给能力,而全球AI数据中心相关供应链紧缺仍限制算力增长,同时他给出了一个阿里云规模增长的明确目标及时间节点:到2032年,阿里云运营的全球数据中心规模超过20GW。
阿里将AI云定义为“承载机器智能的超级电网”,一语双关。
全球云计算的计量单位正在发生变化,当Token成为新的计算商品,电力正在成为衡量AI算力规模的新单位,AWS、微软、阿里等科技公司越来越多地直接用GW描述其算力基础设施的规模。

那么,阿里的20GW是什么概念?可比数据是,2025年AWS新增3.9GW电力容量,并计划到2027年底将整体电力容量翻倍;按微软2026年9月最新规划,2032年容量将超38GW,是现在的三倍;OpenAI计划用5000亿美元修建的“星际之门”,目标是10GW……
如何把这些算力转化成企业可以直接调用的Token,成为支持RSI庞大算力需求的基础设施,才是AI云真正需要解决的问题。

阿里的筹码
AI最终是一场体系战
今年的杭州云栖大会是阿里整体AI体系第一次如此集中地在世人面前亮相,从中可以一窥阿里对“机器智能时代”即将到来的紧迫感,吴泳铭表示,“我们看到行业的中长期需求,远超我们的供给能力”。

ChatGPT出现之后,AI产业一直在寻找“杀手级应用”:搜索、办公、编程、视频生成、智能体……IDC预计,到2030年全球年度Token消耗量将达15万Peta,年复合增长率超3400%,但吴泳铭却把今天的AI Coding比作1882年首次被爱迪生点亮的电灯,仅仅是在替代现有工作,而不是创造一个时代,“机器智能时代真正具有代表性的产品,其实还没有出现”。
今天的人们很难预测,当机器智能爆发之后,会出现什么样的新产品、新发明,就像站在1882年的电灯下,人们很难想象出电气时代的完整图景,但唯一可确定的是,发电站和电网必不可少。
真正决定下一阶段竞争力的,是谁能拥有机器智能时代的“发电厂”和“电网”,将智能源源不断输送到千行百业,而这套机器智能生产系统,至少在国内,阿里的布局最为完整。
它手里同时握着国产头部AI开源大模型、自研全系列芯片和全球规模最大的云计算平台之一,并试图使三者形成一个彼此加速的飞轮:Qwen生产和进化智能,真武、倚天以及网络、存储芯片提升Token生产效率,超节点把越来越多芯片组织成一台巨型计算机,阿里云再把这些能力变成企业可以调用的Token和Agent服务,与此同时,真实模型和Agent负载又反向进入芯片、网络、存储和云平台的下一轮设计。

这便是阿里面向ASI的筹码。
排版/ 季嘉颖
图片/ IT时报 阿里云
来源/《IT时报》公众号vittimes
E N D








