Token导航 LogoToken导航TokenDH.com

智谱两周跑通10万张国产加速卡:GLM开始“帮自己修路”

更新时间 2026-09-18来源 AIGC开放社区正文 1522字阅读约 5分钟
专注AIGC技术的专业社区,关注大语言模型(LLM)的发展和应用落地,聚焦LLM及AI技术的市场研究和开发者生态,欢迎关注!

这次智谱没有发布新模型,也没有公布新的榜单成绩。

它晒出来的,是一场“模型帮自己修基础设施”的工程实战。

9月17日,智谱发布技术文章,介绍由GLM-5.3驱动的Infra Agent,如何参与搭建和优化GLM-5.3-Flash的推理系统。

智谱技术原文听起来有点像“AI开始制造AI”,但事情没有这么科幻。

10万张卡,难的不是把模型装进去

智谱称,GLM-5.3-Flash的生产推理服务运行在超过10万张中国制造的AI加速器上。

从模型第一次在新硬件上跑起来,到系统能够承载生产流量,用时不到两周。经过一系列优化后,端到端吞吐量提升到初始基线的约3倍,硬件利用效率和单Token成本达到与主流英伟达GPU相近的水平。

图 1:GLM-5.3-Flash 的端到端吞吐量演变

这些数字很容易成为标题,但真正麻烦的部分在后面。

芯片的内存和带宽有限,部分算子没有成熟支持,软件生态也不够完善。与此同时,系统还要处理长上下文和多模态请求。

对于一个大模型来说,“能运行”和“跑得稳定”之间,通常隔着一整套复杂的工程工作。

Infra Agent更像一个不会喊累的调试助手

在这套系统里,GLM-5.3被用来驱动Infra Agent。

它会分析日志、定位问题、修改代码、运行测试,然后根据测试结果继续调整。某个算子变慢了,就找原因;数值精度出了问题,就回到对应环节重新验证;局部优化没有带来整体提升,就换一种方案。

这不是让AI一次性生成一套推理框架,而是让它参与一轮又一轮的试错。

智谱把这套方法称为“密集反馈”。翻译成更直白的话,就是让AI每次改完代码后,都能尽快知道自己改对了没有、问题到底出在哪。

图 2:围绕密集反馈构建的基础设施代理优化循环。

这件事比“让大模型写代码”更难。推理服务涉及算子、通信、显存和调度,单点变快不代表整套系统一定变快,有时还可能拖慢其他环节。

“AI自己造AI”还没到时候

智谱把这次实践放进了递归自我改进(RSI)的讨论中,因此不少报道用了“AI开始优化自己”的说法。

但智谱原文其实很克制:目前还没有真正实现递归自我改进。

原因并不复杂。真正的RSI,意味着系统能够自主设计、训练并改进自己的后继模型。而这次案例中,AI参与的是推理基础设施的适配和优化,目标怎么定、哪些修改可以上线、哪些风险需要拦住,仍然由工程师负责。

澎湃新闻也将其描述为RSI方向的早期工程实践,而不是完整的AI自我进化。澎湃新闻报道称,更准确的说法是:AI开始参与优化承载自身运行的系统,但还没有自己造出下一代AI。

模型之外,才是下一轮算力竞争

过去谈大模型,大家更关注参数规模、训练数据和跑分。

但模型真正进入生产环境后,推理框架、算子库、通信效率、显存管理和集群调度,同样决定了用户最终能不能用得起、用得稳。

智谱这次公开的案例,恰好把镜头从模型本身移到了基础设施。

它说明,大模型公司的竞争可能正在发生变化:不只是比谁的模型更聪明,还要比谁能更快把模型部署起来,谁能在不同硬件上跑得更稳,谁能把每个Token的成本压得更低。

这场实验还有一个关键前提

智谱披露的10万张加速器、两周部署和约3倍吞吐提升,都是企业技术文章中的数据,目前还需要更多第三方在明确硬件、软件和负载条件下复现。

但即便不把这些数字当成行业通用结论,这个案例依然有价值。

因为它展示了AI参与基础设施研发的一种现实路径:人类设定目标和边界,AI负责大量分析、改代码和跑实验,双方通过持续反馈把系统一点点调优。

距离“AI自主研发下一代模型”还很远,但模型开始进入基础设施工程现场,这件事已经发生了。

文章标签GLM智谱大模型
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多