
作者 | 山竹
出品 | 锌产业
9月22日,2026云栖大会正式开幕。
就像去年我们在云栖大会上看到阿里对于ASI一样,今年阿里有了新的判断。
阿里巴巴CEO吴泳铭这次给出的激进判断是:未来机器供给的思考总量将达到人类思考总量的1000倍以上,“思考”将像工业时代的动力一样,成为能够规模化供应的商品。
与此同时,在今年的云栖上,今年新组建的ATH事业群集体亮相,尤其是负责大模型的刘大一恒,成了关注焦点。
官方给出的信息是,刘大一恒目前任职阿里巴巴ATH事业群Token Foundry Qwen LLM项目负责人,他在大会上也给出了一些众人期待的阿里Qwen技术细节:
Qwen正在尝试通过递归式自我改进参与自身训练、推理优化和芯片设计;
基于下一代架构的Qwen4已经启动训练;
后续Qwen4.5和Qwen5计划扩展至5T到10T参数。
而这前后衔接的一场谈产业判断的演讲,一场给出工程进展的路线,两者合在一起,勾勒出阿里对下一阶段AI竞争的理解:
大模型接下来重点将从单个模型的参数和跑分,转向智能能否被更大规模、更低成本地生产和输送。
过去一年,大模型的变化不只体现在回答质量上,AI Coding开始从补全代码走向持续开发,办公智能体也不再满足于生成一份报告,而是尝试规划步骤、调用工具并完成长程任务。
模型每执行一项完整任务,都意味着更多推理、更长运行时间和更高Token消耗。
吴泳铭把这一变化概括为“机器智能时代”。

在他的表述中,机器智能不是对人类智能的简单模仿,如同蒸汽机和内燃机也不只是“人造体力”。
机器动力最初用于抽水、织布和搬运,后来却创造了火车、飞机和火箭,类似地,AI编程和写报告只是机器智能的早期用途,长期影响可能来自今天尚未出现的新产品。
由此,他作出了两个判断:
第一,未来机器思考总量将达到人类的1000倍以上。
吴泳铭认为,目前机器思考总量还不到人类的3%,如果未来机器承担99.9%的思考工作,其规模仍有数万倍增长空间。
供给侧,人类专家数量有限,培养周期漫长,罕见病等投入回报不明确的研究方向长期缺少智力资源。
如果模型达到专业研究所需的能力水平,理论上可以组织大量Agent持续模拟、验证不同方案,让原本稀缺的专业思考成为规模化商品。

需求侧,机器智能的消耗不再严格受人口数量限制。
一个人可以提出制造飞船、开发复杂软件等目标,再由大量Agent拆分和执行子任务,人的数量没有变化,能够调用的智力资源却可以继续扩张。
第二,机器智能时代的代表性产品尚未出现。
吴泳铭将今天的AI Coding比作电气时代早期的电灯,它已经实用,但主要替代人类已有的工作,真正改变产业结构的产品,往往要等到底层供给足够充沛后才会出现。
这一判断也构成阿里继续投入基础设施的理由。
吴泳铭指出,阿里将AI模型、AI芯片、AI云定义为机器智能时代的三块基石。
其商业假设是,如果智能成为商品,能够持续生产和输送Token的基础设施将首先受益。
在传统训练流程中,人负责发现问题、准备数据、设计实验,再根据结果调整模型。
随着模型进入更多真实任务,行业开始尝试把运行反馈接回训练流程,让AI参与发现自身缺陷并提出改进方案。
递归式自我改进,即RSI,正在从研究概念进入工程实验。
据刘大一恒透露,Qwen3.8-Max已经在模型训练中尝试RSI。

该模型可以根据内测日志和用户反馈定位能力缺陷,自主搭建数据生成流程、构造训练数据、设计实验并诊断错误,经过小模型验证后,再将有效数据用于Max模型训练。
刘大一恒指出,这套自动化流程连续运行超过一个月,完成了33轮有效迭代。
结合RSI与后训练技术,新版Qwen3.8-Max在Artificial Analysis智能指数上的得分从40升至45。
此外,Qwen的自我改进还被用于推理优化。
据刘大一恒透露,Qwen3.8-Max在此前没有接触过的平头哥新款GPU上,自主适配Qwen3.8-Flash的SGLang推理框架,使单实例推理吞吐量提升96%。
在另一项芯片设计实验中,模型只获得了一份总线模块规范,随后参与前端设计、验证和后端物理实现。
该项任务持续运行超过60小时,调用EDA工具超过1万次。刘大一恒称,最终方案在性能不下降的情况下,将芯片面积缩减42%。
模型参与设计芯片,芯片又承载模型训练和推理,这一下就形成了产业闭环,其实这也是阿里会上强调的“芯模协同”。
与自进化同时推进的是模型Scaling Law。
刘大一恒在大会上确认,采用新一代架构的Qwen4已经开始训练,规划中的Qwen4.5和Qwen5将迈向5T至10T参数。

Qwen3.8-Flash则提前验证了下一代架构,通过混合注意力、门控信息通路和N-gram Embedding等技术降低了训练与推理成本。
多模态是阿里大模型的另一条技术主线。
刘大一恒认为,一个足够聪明的“大脑”仍不够,模型还需要声音、图像和视频等感知与交互能力。
此次阿里更新了Qwen3.8-Omni、Qwen3.8-LiveTranslate和Qwen-Audio-3.1等模型。
其中,Qwen3.8-LiveTranslate将官方公布的平均延迟指标由2.8秒降至2.3秒,Qwen-Audio-3.1-TTS-Next则可以根据脚本同时生成对白和环境声。
从基础语言模型到语音、视觉和全模态模型,阿里试图让Qwen同时具备推理、感知、表达与工具执行能力。
对智能体而言,这些能力需要在同一任务中协同工作,而不只是分别完成一项模型演示。
如果说吴泳铭定义了机器智能需求,刘大一恒解释了模型如何进化,那么阿里云CTO李飞飞需要回答的则是另一个问题:
智能体时代,企业需要一朵怎样的"云"?
随着Agent从问答进入自主规划、实时决策和长程执行,传统云服务面临新的负载:
模型训练正在从预训练、后训练和Agentic RL走向RSI,推理侧则要承受更大的KV Cache、百万级并发和动态任务环境,企业还需要解决权限、身份、安全审计、失败重试和数据隔离等问题。
李飞飞认为,企业级Agent规模化落地需要四项能力:
通过全面、统一且持续更新的上下文建立全域认知;
支持自主运行和持续进化;
融入安全、控制、信任与身份认证;
从静态规则走向实时感知、动态推理和自主行动。
围绕这些需求,阿里云将Agentic Cloud划分为:AI Native Cloud、Agent Native Cloud和Context Engine。
AI Native Cloud面向模型生产,这又可以从计算、存储、推理三层来看:
计算层面,真武M890超节点已经承载Qwen3.8-Max等超2T参数模型的商业服务,即将在2027年第一季度商用的真武V900,芯片综合性能为M890的3倍,配备216GB显存和1200GB/s片间互联带宽,配套超节点采用200Pbps通信带宽和6微秒延迟的集群架构,单集群设计上限为50万卡。

存储层面,阿里云发布新一代CPFS,提供百TB/s级吞吐和亿级IOPS,单文件系统规模提升至100PiB,该系统可以使模型启动平均耗时降低50%、峰值算力利用率提升30%,并将AI存储成本降低69%。
推理层面,Tair KVCM统一调度内存、KV CacheStore和远端共享存储等多级缓存,缓存有效命中率可达99%,每Token成本下降50%。

Agent Native Cloud面向智能体运行,阿里云推出的企业级Agent构建治理平台AgentCore,将长任务、失败重试、断点恢复、异步执行、身份权限和审计能力做成托管服务,并统一管理模型、MCP Server和Skill等资产。
Agent Sandbox提供隔离执行环境,创建吞吐量达到每分钟10万个,深度休眠实例唤醒时间低于600毫秒,Agentic OS通过系统级优化降低30%以上Token消耗,并将沙箱部署密度提升3倍,Agentic Computer则为智能体提供长期在线、支持GUI操作且可审计的专属云电脑。
这些产品处理的是模型能力之外的问题:
任务失败后如何恢复、智能体能够访问哪些资源、工具调用如何审计,以及成百上千个Agent怎样在同一企业环境内可靠运行。
Context Engine面向实时决策,模型参数决定了基础能力,企业数据则决定着Agent是否理解此刻的业务状态。
李飞飞提出,将上下文从应用侧的一段临时缓存,升级为需要统一建设和治理的数据资产。
至此,阿里的全栈布局逐渐完整:
Qwen负责生产智能,真武芯片和超节点提高Token产能,Agentic Cloud承载模型与Agent运行,Context Engine提供实时业务信息,Qwen Intelligence再将能力送入手机等终端。
在大会上,吴泳铭还透露了一个阿里云长期目标:
到2032年,阿里云运营的全球数据中心容量将超过20GW。
这一目标意味着阿里准备为模型训练、推理和Agent常态化运行,投入更大规模的数据中心和能源资源。
如此看来,阿里押注的是一条从模型、芯片、网络、存储、云平台、企业数据延伸至终端的完整链路,这套战略能否成立,取决于三个条件:
模型能力能否继续提高,单位智能的生产成本能否持续下降,以及社会是否会产生足够多的真实任务来消耗这些Token。

机器思考达到人类1000倍仍是一个遥远预测,Qwen的RSI也处于工程探索阶段,Agentic Cloud的企业价值还需要更多生产案例验证,但阿里已经依据这一预测开始配置资源。
当行业仍在寻找机器智能时代的代表性产品时,这家互联网巨头选择先建设发电机、电厂、电网和智能体运行系统。
实际上,最终决定这场竞争结果的,将不是谁最先提出宏大叙事,而是谁能够以可承受的成本,把模型能力稳定地转化为企业和个人可以衡量的生产力。







