Token导航 LogoToken导航

2026云栖大会主论坛吴泳铭谈机器智能

更新时间 2026-09-22来源 王智远正文 4818字阅读约 16分钟6 张图片

图片

今天,9月22日,一年一度阿里云栖大会。我来了现场,人山人海。

每年云栖大会都这样,开发者从全国各地赶过来,挤在主论坛的会场里,等着听点新鲜的,今年也不例外。今年有一点不一样,台上的人换了一种说法。

吴泳铭上台讲了一句话:

机器智能不是人类智能的替代品,是一个完全不同的物种。

嗯,有点儿意思。为什么?过去我们聊AI,总习惯问一个问题:它像不像人?能不能像人一样思考?图灵测试一度是衡量AI的金标准。吴泳铭说,这个思路就错了。

他打了个比方:

蒸汽机、内燃机刚出来时,替代人和马的体力活,抽水、织布、搬运。马力这个词就是那时候来的。很快,机器动力做到了人和马永远做不到的事。

再多的人和马也没法让火车飞奔,更没法让飞机和火箭上天,机器动力不止简单的人造体力,还创造了一个完全不同的物种。

机器智能也一样。今天AI帮人编程、写报告、做PPT,只是初级阶段,等机器智能的供给真的无限充沛了,它干的事会远超我们想象的脑力劳动替代。

吴泳铭给了一个数字,今天机器思考的总量还不到人类的3%,未来将是人类思考总量的1000倍以上。

图片

嗯,从3%到1000倍。听着夸张,不过你想想看,全世界顶级科学家和资深专家有多少?培养一个要几十年,还需要天赋和运气。

很多领域,比如:

新生儿早衰症,全球患者可能只有几百人,很少有公司愿意花几十年耗费巨资为几百人研发一种新药。

但当AI具备了专业研究需要的智力水平,只要算力够多够便宜,每个细分领域都有可能组织上百万个Agent持续研究、模拟和验证。

过去这些资源投入不足的方向,第一次获得大规模的智力供给,你看,顶级思考,从奢侈品变成了可以规模化供给的商品。

他还讲了一个对照:

1882年爱迪生建成珍珠街电站,点亮了400盏灯。为了卖电,爱迪生送半年电费。跟今天AI软件的打法一样,下载一个软件送一个月token。

真正改变世界的不是那400盏灯,是后来陆续出现的空调、洗衣机、冰箱、计算机。

机器智能时代也一样,今天送出去的token,最后会变成什么改变世界的东西,谁也说不准;但无论后来出现多少新发明,第一步都是建足够多的发电站,铺足够广的电网。

蔡崇信给了一个框架。芯片、云、模型、模型服务、智能体应用,五层全栈,这是他第一次用这个口径定义阿里。

翻译一下:我们不止是一家云公司了,我们还是一整个新物种的基建商。

......

新物种需要新基建,五层里面,最先被推到台前的是模型,过去一年,千问变了三轮。

第一轮,模型学会了自我进化。

过去训练模型,人喂数据,模型消化,出结果。现在千问搞了一套叫AISI的东西,全称递归式自我改进。

翻译成人话就是:模型自己找自己的毛病,自己设计实验,自己构建数据,自己评价结果,一轮一轮推着自己往前走。

它怎么找毛病?

从真实的内测日志和用户反馈里,自动定位自己哪里不行,然后,针对这些弱点构造新的训练数据。生成出来的数据先放到小模型上跑几轮验证,筛掉质量差的,剩下的才进大模型训练。

千问团队负责人刘大一恒说:这套系统已经跑了一个多月,累计完成33轮有效数据迭代。模型在自己训练自己。

效果也直接,千问3.8 Max,发布两个月,真实用户收入涨了8.5倍,Token消耗量暴涨12倍。模型越用越强,越用越多人用。

第二轮,效率打下来了。

光会自我进化还不够,还得便宜,千问3.8 Flash用了一套全新架构,激活参数降到上一代的1/3,训练成本降到1/9。百万token输入价格降到原来的1/4。

性能呢?在AA智能指数上,3.8 Flash比上一代3.7 Plus提升了14分。用更少的计算,训练出更聪明的模型。这笔账算得过来。

打个比方:以前造一辆车需要十条产线同时转,现在三条产线就够,产量还更高。架构变了,成本结构就变了。

第三轮,边界打开了。

千问不只处理文字了,千问Image 3.1做生产力级图像生成,服饰海报、电影分镜、学术原理图,直接出图直接交付,是能直接上线的成品。

Happy Sleep 1.1做音乐生成,不懂乐理的人一句话就能出一首完整的歌;Happy Oyster 2.0做交互式世界,物理规律、3D记忆、实时交互,越来越接近真实。

图片

淘天集团首席科学家郑波还透露了几个方向:

千问不只停留在屏幕里,链接机器狗就能执行物理世界的连续任务,连接智能眼镜就能实时感知环境,视频生成模型也在路上,11月出新版本。

他给了一个判断,三年之内会出现原生全模态统一生成模型,一个模型搞定图像、视频、音乐、交互,不是几个模型拼在一起,是一个模型的原生能力。

刘大一恒还透露了一个方向,未来计划把模型参数规模推向5到10万亿。

千问4系列也即将到来,4 Max追求智能上限,4 Flash和Plus追求效率,4 27B给本地开发者。他给了一条Scaling曲线,千问2.5时代旗舰模型72B,千问3.8已经到2.4T,两年参数规模涨了33倍。

到今天,千问模型全球下载量超过30亿次,产生了超过30万个衍生模型。

千问3.8 27B发布两个月就成了Hugging Face历史上点赞最多的模型,超越了DeepSeek R1和Llama。全球开发者在用脚投票。

......

模型证明完了自己。它跑在什么上面?吴泳铭说:Token是AI时代的电,芯片就是发电机。

平头哥副总裁高慧认为:

到了Agent时代,AI的活法变了。以前是训练为主,模型学完知识,考试交差;现在不一样了,学完之后才是正事,成千上万个Agent同时在真实任务里跑,推理消耗的算力会远超训练。

而且活法也变了,一问一答的时代过去了,一个任务拆成十几步才是常态,搜索、读文档、跑代码、汇总,每一步都要调工具、存状态,算力需求不是线性增长,是翻着跟头往上滚。

GPU、CPU、内存、网络,任何一个环节卡住,整个系统都得等,光有一颗好芯片不够了,得有一整套系统。

最有意思的变化是CPU角色的反转。

过去chatbot时代,GPU干活,CPU打杂。发个调度、做个请求、搬个数据,大部分时间CPU都在等活干。高慧说,到了Agent时代,情况彻底变了。

她举了个例子:

让Agent帮你做一份行业调研,要搜索、读文档、跑代码验证、汇总成报告。

模型推理只是其中一步,每一次搜索调用、每一个代码沙箱的启动、每一个中间状态的保存、多路结果的汇总,全落在CPU上。

一句话,CPU从配角回到了关键路径。

平头哥的做法是把倚天CPU分成两条产品线。倚天720,192核,走吞吐并发路线,几百几千个Agent同时跑的时候扛得住。

倚天730,第一代自研高性能核,单核性能跑到上一代的1.4倍,追求每一个微秒都不浪费。一个求快,一个求多,不试图用一颗芯片打天下。

GPU这边,基于M890的超节点实例已经在阿里云上架,成功跑通过2万亿参数以上的大模型推理,是国内极少数能做到这一点的算力。下一代,真武V900即将登场。

图片

单芯片算力是上一代M890的3倍。216GB显存,解决的是记忆常驻,成千上万个Agent的上下文和中间数据不用换出、不用重算。

1200GB/s互联带宽,解决的是切开的代价,模型再大、切得再散,通信也不再拖后腿。再叠加原生FP8和FP4,精度每降一档,一度电换来的Token数量基本翻倍。

高慧说,我们关心的从来不只是参数,还有每一次智能服务的真实成本与体验。

好,单颗芯片再强,也撑不起Agent时代的需求,有了好芯片,怎么连起来,是更大的问题。

超节点的意义在于消除物理边界,平头哥用自研的ICNlink协议和ICNswitch芯片构建了新一代超节点,8卡、64卡、1024卡,从单机互联一路扩展到千卡级跨机柜互联。

对上层框架来说,这不是1024颗独立的芯片,而是一台在系统语义上统一的机器。

高慧说,超节点从来不是一个营销词,是一套真正打磨过的工程标准。

配套的软件栈SEAL也已经开源,GitHub上星数超过1的主流AI仓库,SEAL覆盖了96%以上,代码下载下来直接编译就能跑通。

真武已经服务了20多个行业超过650家客户,智驾模型、具身机器人、金融风控,都在上面跑。

明年Q1真武V900登场,2028年还有J900,一年一代。我们画的每一条路线图,最后都兑现了。

......

芯片、模型、系统,三块拼起来了。还有一个问题,这些东西怎么变成真正的生产力?

阿里云CTO李飞飞在台上讲了一个很硬的指标,单任务平均非计划人工介入次数小于1次。

这个数字值得说一下:

Agent在企业工作流里跑,如果每跑一步都需要人盯着、人确认、人兜底,那就不是Agent,属于高级脚本。

小于1次的意思是,绝大多数任务Agent自己能跑完,人只需要在关键节点看一眼。这才叫生产力。

为了做到这件事,李飞飞团队做了三件事。

第一件,Agent沙箱。

冷启动180毫秒,热启动20毫秒,一分钟能瞬时创建10万个沙箱实例。

每个Agent有自己独立的运行环境,互不干扰。而且沙箱是带状态的,Agent跑到一半挂了,600毫秒就能从深度休眠里拉回来接着跑,不用从头开始。

第二件,统一身份认证。

打通了阿里云300多个云产品,Agent要调用数据库、访问存储、操作API,都有统一的身份鉴别,不越权不越界。

打个比方,就像给每个Agent发了一张工牌,能进哪些门、能操作哪些系统,写得清清楚楚。

第三件,Agent运行中枢。负责Agent的构建、运行和监控,让Agent运行成本下降70%,非计划人工介入降到1次以下。

三件事叠起来,Agent就从PPT走进了生产环境。对了,还有一层不容易被注意到,推理的成本结构也在被重写。

图片

李飞飞给了一个数字,推理过程中模型要记住大量中间数据,这部分存储的成本降到了原来的1/30。

怎么做到的?

把远端存储池化,借着超节点之间的高速通道,把大量中间数据的落盘需求推到远端。缓存命中率做到99%以上,每秒读写做到亿级,出第一个字的速度快了50%以上。

网络侧做了两层聚合架构,支撑推理流程的拆分,有效带宽提升2到3倍。

再往上,50万卡的广域超节点集群已经在规划中,通讯带宽200万亿比特每秒,延迟6微秒,撑得住10万亿参数的超大规模模型训练和推理。

最上面一层是上下文引擎,企业的数据正在从结构化走向全模态,从离线走向实时,从有限窗口走向长记忆;李飞飞团队用一系列数据产品把企业的资产盘活,让多个Agent之间能共享上下文。

你看,从芯片到网络到存储到上下文,整张网织起来了,Agent跑在上面,才真正跑得动。

......

市场端的信号已经很明确了,前面提过千问3.8 Max的收入和Token消耗数据,两个月翻了将近十倍,这是真金白银的市场投票。

刘大一恒还展示了一个案例:

让千问进入真实的工业级EDA环境,参与达摩院3D创新架构的芯片设计。

连续运行60多个小时,完成数万次工业级EDA工具调用,最终面积缩减42%。模型设计芯片,更强的芯片又反哺更强的模型,这个飞轮已经转起来了。

郑波给出了另一组数字,63%的视频营销人员已经在用AI视频工具,到2030年AI图像和视频生成的市场规模预计达到608亿美元。

杭州的数据也在印证,今年1到7月,全市AI核心产业营收3160亿元,同比增长26.5%,四个国家AI应用中试基地落地,数量全国城市第一。

市场跑起来了,算力跟不上怎么办?

吴泳铭说了实话:

客户的需求已经远超阿里云可以提供的供给能力,AI数据中心相关供应链全球性紧缺。阿里巴巴的选择是全力投入基础设施建设,到2032年,全球数据中心规模超过20GW。

20GW是什么概念?差不多20座核电站的装机容量。

终端这边,千问Intelligence也正式发布了,给合作伙伴提供移动端的AI解决方案;开源生态方面,千问累计开源了460多款官方模型,开发者生态还在加速膨胀。

吴泳铭收尾时讲了一段话:

工业革命让机器承担了越来越多的体力劳动,人类解放出来之后,发展出了足球、篮球、奥运会,这些都是工业革命之后的产物。

机器智能解放脑力之后,人类会发明什么?现在还说不准。但这一切,才刚刚开始。

图片

文章标签智能体算力
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多