作者 | 金旺
来源 | 科技行者
2026年3月16日,阿里巴巴CEO吴泳铭在内部公告中宣布成立Alibaba Token Hub (ATH)事业群,围绕“创造Token、输送Token、应用Token”协同运作,阿里基于Token的战略变阵由此展开。
在这之后,阿里通义实验室升级为通义大模型事业部,通义大模型事业部又与未来生活实验室合并,成立了Token Foundry事业部。
9月22日,在今年云栖大会开幕式上,在吴泳铭系统介绍了阿里的AI战略后,刘大一恒以阿里巴巴ATH事业群Token Foundry Qwen LLM项目负责人的身份登台,从R SI自进化、模型新架构突破、全模态探索、Scaling Law四个方面讲述了当下阿里大模型的最新技术布局。
RSI自进化:把真实任务接回训练环路
当下大模型训练长期依赖预先收集的数据和设计好的评测题,但智能体进入软件开发、设计和工业环境后,真实任务会不断暴露训练阶段难以预见的问题:
它可能知道如何写一段代码,却无法完成整个项目,它能够解释一张图,却无法根据画面变化持续行动。
如何把这些失败和反馈转化为下一轮能力提升,正在成为模型研发的重要方向。
刘大一恒将真实生产场景放在Qwen路线图的第一位,他介绍,Qwen正在从通用问答走向专业工作,除编程外, 模型还被用于UI原型设计、量化策略分析、法律分析、3D建模和科研分析。
编程任务本身也在变化, 模型过去主要补全代码、回答技术问题,现在则被要求参与更复杂的软件工程。
此外,真实任务也在反过来改变模型的训练方式。
据刘大一恒在大会上透露,Qwen3.8-Max已在模型训练中初步运用递归自我改进 (RSI), 自主搭建训练流程、构造训练数据、设计实验并定位缺陷。
在人类“零参与”的情况下,这一流程持续运行超过一个月,完成33轮有效迭代。
他还称,结合RSI和后训练等技术优化,Qwen3.8-Max新版本在Artificial Analysis智能指数上的得分由40分升至45分,处于全球第一梯队。
在阿里的研究中,自我改进的探索还延伸至推理优化,Qwen3.8-Max在此前未接触过的平头哥新款GPU上,自主适配并优化了Qwen3.8-Flash新模型的推理框架,使单实例推理吞吐量提升96%。
芯片设计则提供了另一个持续运行的任务案例。按刘大一恒介绍, Qwen3.8-Max仅凭一份真实的总线模块规范,便在工业级EDA环境中展开前端设计、验证和后端优化。
该过程自主运行超过60小时,调用EDA工具超过万次,最终物理实现的芯片面积减少了42%。模型参与设计芯片,更强的芯片又可用于运行模型,这构成阿里所强调的“芯模协同”方向。
这些结果展示了RSI从训练流程向推理和硬件设计任务延伸的可能性。
新架构破题:智能体需要更便宜地运行
智能体的成本账与聊天机器人不同,一次问答可能只调用一次模型,一项长程任务却可能包含规划、检索、写代码、测试和修改,反复消耗Token,模型如果要进入大量日常工作,推理价格、长上下文处理速度和训练成本,都必须与能力同步改善。
Qwen在模型架构上的探索,正在尝试解决这些问题。
阿里Qwen3.8-Flash提前开源下一代千问大模型架构, 在注意力机制、模型内部信息传递、外部记忆和训练优化方面做了改动。
据刘大一恒介绍,新架构将稀疏注意力与线性注意力结合,并通过门控机制改善信息流和训练稳定性,N-gram Embedding则以较低计算代价扩展模型容量。
数字更能说明这次调整的目标,按照阿里披露的数据显示, Qwen3.8-Flash每个Token仅激活约6B参数,相比Qwen3.7-Plus,训练成本降至约九分之一。
刘大一恒在演讲中也给出了这样几个数据:
百万Token输入价格降至原来的四分之一,面对百万级长上下文,预填充吞吐提升8.6倍,在Artificial Analysis智能指数上,模型得分比Qwen3.7-Plus高14分。
与此同时,这套架构也承担着承上启下的角色,刘大一恒在大会上透露, 基于新一代架构的Qwen4已经开始训练。
这意味着Qwen一面继续向更高能力推进,一面尝试降低每次训练和推理所需的成本,对于需要持续运行的智能体,后者将直接影响它能否进入更多实际工作流程。
全模态探索:从看懂内容到完成任务
多模态模型过去常被用来描述图片、总结视频或转写语音,智能体的要求更进一步,它要从画面和声音中获取信息,再据此决定下一步操作,并在环境变化后继续调整。
刘大一恒在大会上展示了Qwen对数字世界与物理世界的探索。
在数字环境里,用户提出制作赛车模拟器的需求后,模型协同使用设计软件、建模工具和游戏引擎,把多个制作环节串联起来。
据悉,在连接机器狗后,模型可以结合现场视觉信息执行连续任务,连接智能眼镜后,则可以借助实时环境感知辅助任务执行。
音视频是这条路线的另一部分,此次亮相的Qwen3.8-Omni将不同模态纳入统一理解框架,面向音视频推理和智能体任务。
刘大一恒称, 通过智能密度优化,其整体成本较上一代降低90%以上。现场展示的应用包括从长篇电影素材中自动剪辑成片,以及根据一句话为音乐生成MV。
阿里近期还更新了与全模态能力相关的模型产品,包括图像生成模型Qwen-Image-3.1面向电商与设计等场景进行了优化,语音模型家族Qwen-Audio-3.1覆盖了转写、合成和实时交互,同声传译模型Qwen3.8-LiveTranslate也已亮相。
这些案例展现了阿里大模型改变当下工作方式的诸多尝试,这些模型在获取信息、调用工具后,会为用户直接交付结果。
持续Scaling Law:模型规模还要向上走
过去几年,大模型能力提升与算力、数据和参数规模扩张密切相关,如今,效率架构和自进化机制受到更多关注,但Scaling Law并未因此退出历史舞台。
对头部模型团队而言,在扩大规模的同时,能否让新增投入转化为足够明显的能力增长变得越来越重要。
刘大一恒给出的Qwen规划,就延续了这一路径。
他回顾称,Qwen2.5时代的旗舰模型规模为72B,Qwen3.8-Max的总参数量已达到2.4T,两年间增长了约33倍。
阿里下一步会继续延续大模型的Scaling Law更大, 基于新架构的Qwen4正在训练,后续Qwen4.5和Qwen5计划将总参数量推向5-10T。
据刘大一恒大会上给出的阿里大模型路线规划,Qwen4系列将以Max追求能力上限,以Flash和Plus兼顾效率与性价比,并提供面向本地部署的27B版本。
扩大模型规模之外,阿里还希望维持开源生态。
大会上,阿里官方表示,阿里已开源460余个Qwen官方模型,全球下载量突破30亿次,衍生模型超过30万个,Qwen3.8-27B也成为Hugging Face平台历史上获赞最多的开源大模型。
RSI自进化、模型新架构突破、全模态探索、Scaling Law,正是阿里Qwen如今在大模型领域正在推进的四条技术路线,通过更大的模型获得更强的能力,通过新架构压低使用成本,并通过真实任务与全模态应用产生的反馈,持续推动下一轮改进。
· FIN ·
科技行者团队出品
PEC 2026|后Coding时代,我们盘了盘AI原生产品落地的真问题
具身智能落地之战,被忽略的“机甲”战场








