文/海峰看科技
聊起AI,大家谈的都是大模型、智能体、Agentic AI如何改变客服、营销、研发这些前台。但很少有人注意到,企业IT体系里有一个最不能出错的岗位——运维。
运维的日常是什么?是盯着满屏红绿交错的指标找一根出问题的光纤,是在业务宕机二十分钟后还没定位到故障根因。它是企业的幕后英雄,不出事无人感知,一出事全线停摆。
而现在,这个行业的底层逻辑正在被改写。在华为全联接大会2026期间,一场以“Agentic AI重塑行业运维运营新范式”为主题的论坛在上海世博中心举行。
华为ICT网络保障与运维服务部部长段学鹏透露:“今年,我们针对各行业运维实践的差异化诉求,并结合迅猛发展的技术趋势,进一步围绕平台智能升维、模式智能升维,运维运营一体化,推出全新的行业运维解决方案。”
三大升维方向已定,具体方案怎么落地?华为智能运维业务部部长陈钢在会上分享最新行业运维运营解决方案——用数字孪生和领域模型做双引擎,搭起从事前预防、事中排障到事后治理的完整闭环,同时把金融、政务、电力、交通四个行业的专属服务包全面升级。
在展会现场,笔者还了解到与智能运维相关的内容:华为从服务体系、风险预防能力,到核心技术大屏,再到向业务经营层延伸新尝试,构成一套从技术到落地的完整图景。
你是否也好奇,数字孪生、领域模型这些听起来很黑科技的词,能不能解决那些积年累月的老问题?当AI越来越能干,运维工程师是会被替代,还是会被解放?
传统运维,正在被自己的复杂度压垮
要理解华为为什么做这件事,得先看看运维行业现在面临的局面。
过去十年,ICT基础设施的架构发生天翻地覆的变化。云、网、边、端深度耦合,从业务层到物联终端,层层叠叠。运维对象从过去几百台设备,暴涨到几万甚至几十万的量级。
更麻烦的是,云化之后很多东西变成虚拟黑盒,网络看不到应用在跑什么,业务出了问题不知道该找谁。跨云、跨厂商的调用链路绕来绕去,排障就像在一团乱麻里找线头。
结果就是维护难度和运维诉求双升——活越来越难干,要求却越来越高。
具体来说,这种变化体现在三个层面:首先,过去运维是被动响应,告警来了才去处理,现在要主动预测;其次,过去考核的是系统稳不稳定,现在看的是业务体验好不好;最后,运维正在从花钱的成本中心,变成能创造价值的引擎。
可以看出,传统运维的困境主要是:看不见、反应慢、扛不住。看不见业务和网络之间的关联,反应慢于业务损失的速度,扛不住规模和复杂度的持续攀升。
给网络建数字克隆体,让AI像老专家一样思考
面对这些难题,华为用数字孪生和领域模型做双引擎,搭起一套T-1/T0/T+1的三段式运维闭环,简单来说:事前把隐患找出来,事中把故障快速搞定,事后把根因彻底解决。
其一,事前的T-1阶段,核心隐患Agent。它可以持续盯着告警、巡检记录、变更操作、系统日志这些数据,结合历史趋势和动态阈值,主动发现哪里可能出问题,比如光模块在慢慢劣化、冗余链路已经失效、某个隐患可能引发重大故障,发现之后还会给出修复建议。
在展会现场,笔者了解到,这套能力把巡检从定期查一遍变成实时盯着,网络故障减少一半。这背后靠的是Smart NOS系统,把六千多位专家的经验、一万多个项目的沉淀做成故障库,再加上数字孪生和Agent技术,让隐患从人去找问题变成问题来找人。
其二,事中的T0阶段,出了故障怎么办?华为先把系统全域可观测——从业务层、应用层、云服务、云资源到物理设备,每一层之间的交易关系、调用关系、部署关系、链接关系全部打通,数据全域采集、精准还原。
然后,多个排障Agent协同工作,云的问题找云排障Agent,网络的问题找网络排障Agent,存储的问题找存储排障Agent,再加上故障诊断作战室让人机协同、跨域会诊、根因推理。
多个排障Agent协同工作的效果很明显:跨域故障定界从原来半小时压缩到五分钟。笔者在展会现场也看到类似的能力,预案可以分钟级生成,不用再靠人去翻历史文档。
其三,事后的T+1阶段,解决的是同一个故障反复出现的问题。很多运维团队都有这种体验:一个问题处理完了,过段时间又来一遍,因为只处理了表象没解决根因。
华为对反复发生的故障做集中分析,找到根因后彻底消除,再做闭环验证,同时结合指标趋势和历史告警做分析,由问题治理Agent输出治理建议,使得重复告警降低30%。
支撑这一切的,就是笔者在前面提到的两个技术底座。一个是数字孪生(DTN),给物理网络建一个一模一样的数字克隆体,在这个克隆体里,可以模拟故障、验证变更、分析影响,不用在真机上冒险操作。另一个是领域模型(EDNS),把行业专家脑子里的经验,怎么判断故障、怎么处理问题、业务和网络之间是什么关系,沉淀成AI能理解、能推理的模型。
四个行业,四种"配方"
你肯定要说,每个行业的运维场景差异那么多,通用的技术框架肯定不够用,怎么办?笔者了解到,华为针对金融、政务、电力、交通四大行业,分别做了专属服务包升级。
金融行业的痛点在于多地多中心、分布式新核心架构下,业务链路长、告警海量但有效率低,跨域故障定界往往要半小时以上。为此,华为推出金融卓悦服务5.0,围绕ICT基础设施和分布式新核心两大场景,在MindOps平台部署业务感知排障、隐患识别、故障治理等多个智能体,把专家经验沉淀成两千多条应急决策树和诊断模块。
该方案带来哪些变化?笔者获悉,网络故障修复时间降了一半,跨域定界从三十分钟缩到五分钟,有的银行通过健康度驾驶舱实现风险实时识别,隐患导致的网络事故降低50%。
政务行业的痛点是云建好了但治云跟不上,端到端业务可视能力缺失,复杂故障定界要两个多小时,资源争抢与闲置并存,整体利用率不到30%。
而华为的政享服务3.0打出营维一体的思路,分启航、远航、领航三个服务层级,用数字孪生还原云网拓扑,AI做根因推荐,同时把运维和运营打通。
据笔者了解,某省政务云落地后,排障从半小时降到五分钟,综合资源使用率从30%提升到35%,原厂响应时间不到十分钟,应用可用率超过99.9%,非常显著。
电力行业的痛点是运维节点呈几何级增长,状态不可视,电力业务和通信网络之间断层,故障定位经常超过两小时,传统巡检一次要七个人干一天,如何应对?
华为电力专享服务3.0覆盖国干、骨干、配电通信网,通过跨域跨厂商智能分析和自动巡检编排,把三十多条故障关联规则和图谱、七维二十八项巡检场景全部自动化。
该服务带来最直观的变化是,智能巡检从7人/天降到0.25人/天,故障定界从一小时缩到十五分钟以内,某国干网客户的一级故障平均修复时间从四小时降到一小时。
交通行业的痛点是排障巡检成本高、操作窗口只有夜间两三小时、多代技术并存、告警多到看不过来。而华为交通专享服务3.0分轨道通信专网和公路ITS两块,通过跨域全网拓扑统一可视和多厂商告警智能分析,把五百多种告警自动诊断。
使用该方案后,某地铁项目运维效率提升140%,故障定界降到15分钟;海外一个公路项目把六类网管、一千多终端统一运维,交通治理分析从按周出变成按天出。
此外,笔者在展会现场了解到,这些行业服务包交付靠的是华为Hi-Care行业专享包体系,每个行业针对变更保障、专家现场、VIP技术支持等差异化定制,还有Co-Care体系,赋能合作伙伴打造自己的服务品牌,华为在背后提供原厂技术、备件、软件更新等支持。
笔者观察:运维的价值,正在被重新定价
看完这次发布会,笔者认为华为做了一件“把复杂变简单”的事。华为把数字孪生、领域模型、多Agent协同、T-1/T0/T+1闭环这些概念拧成一股绳,落到金融、政务、电力、交通四个行业真实场景里,也拿出可量化的效果数据,很有说服力。
我们可以看出,华为想做的不是一个运维工具,而是一套从技术底座、平台能力、行业方案到伙伴生态的完整运维操作系统,这里面有两个点值得展开说说。
一方面,AI进运维,替代的不是人,是重复劳动。告警筛查、日志比对这些耗时间但不需要太多判断的工作,Agent干得又快又好。但真正复杂的故障决策、跨部门协调、疑难杂症处理,还是得靠人。领域模型本质上是把老专家的经验规模化复制,让新人也能站在巨人的肩膀上。专家的角色会从亲手干活变成训练AI、审核决策、啃硬骨头。
另一方面,数字孪生落地说易行难。虽然它可以在虚拟世界里试,风险低、速度快,但前提是设备数据能采上来、拓扑能建起来、状态能同步上。对于存量网络里多厂商、多代技术并存场景,改造和适配的工作量不小。华为的优势在于自研设备、运维平台、专家服务三位一体,能从硬件到平台到服务形成闭环,这是纯软件厂商很难复制的。
云网千端织巨网,智能运维启新章。当数字孪生让每一条链路都有迹可循,当领域模型让每一次决策都有专家经验托底,当Agent把工程师从重复劳动中解放出来,运维将会变成业务的健康管家,整个运维行业也将站在从成本中心迈向价值引擎的拐点之上。








