出色的自主行动
精心策划的地图 人工智能驱动的自主操作、SRE和支持代理 --用于日志、代理修复、MCP连接器和基于浏览器的操作助手的图形RAG。
  

介绍
自主操作 是人工智能、可观察性和可靠性工程的融合。这不仅仅是关于聊天机器人回答问题,而是关于能够 诊断事故, 执行修复运行手册, 导航操作控制台,以及 跨工具链协调 配备适当的安全护栏。
此列表整理了人工智能驱动的SRE、DevOps和SecOps工作流的基本构建块:基于图表的日志和指标根本原因分析、故障排除和修复生产的代理系统、将操作工具安全地暴露给人工智能的模型上下文协议(MCP)服务器,以及让代理与仪表板和控制台交互的浏览器自动化框架。无论您是在构建智能随叫随到助理、自主事件响应者还是人工智能增强支持结构,这些项目都代表了最先进的技术。
目标是提供 参考架构 对于从业者来说:清晰、可组合、注重生产的工具,尊重现实世界操作的复杂性和关键性。
目录
- 入门指南
- 策展人的项目
- 日志和事件的RAG图和根本原因分析
- 代理修复和Runbook
- 用于自主操作的MCP服务器和网关
- 浏览器和桌面操作代理
- AI运维的合规性、治理和安全性
- 数据集、模拟器和实验室
- 如何使用此列表
- 资源
- 贡献
- 许可证
入门指南
自主运营新手?从这里开始:
- 入门指南 -在30分钟内构建您的第一个自主操作系统
- 工具比较 -并排比较工具以帮助您进行选择
- 参考架构 -只读、HITL和完全自主系统的成熟模式
- 术语表 -解释术语和概念
- 案例研究 -现实世界的实施和经验教训
- 路线图 -未来愿景和计划功能
策展人的项目
我是人工智能支持和自主操作系统的架构师,包括思科人工智能支持结构和ADAPT(自适应诊断和问题解决工具)框架。以下项目代表了构建生产级自主操作环境的参考实施和核心基础设施:
- AutoRCA核心(ADAPT-RCA) *(即将推出)* –用于自主可靠性的图形RAG和多信号根本原因分析引擎。结合时间序列相关性、依赖图和LLM推理,以识别日志、指标、跟踪和配置更改中的事件原因。
- 安全MCP网关 *(即将推出)* –用于操作工具(Jira、Splunk、Kubernetes、GitHub、PagerDuty)的安全第一模型上下文协议网关。提供基于策略的访问控制、对写入操作的人工在环审批,以及对AI代理与生产系统交互的全面审计跟踪。
- Ops代理桌面 *(即将推出)* –用于自主SRE和支持代理的可视化任务控制UI。代理调查和补救的实时可视化,通过浏览器自动化显示与操作控制台和仪表板的实时交互。
- 自适应代理 *(即将推出)* –用于常见操作场景的诊断和故障排除代理模块库。设计用于与AutoRCA Core一起进行根本原因分析,与Secure MCP Gateway一起进行安全工具访问。
- 安全的AI支持结构 *(即将推出)* –动手自主操作实验室和参考实施。展示端到端的人工智能事件响应,从检测到诊断再到补救,具有适当的安全边界和人工监督。
日志和事件的RAG图和根本原因分析
通过操作遥测执行检索增强生成、基于图的推理和相关性分析以识别事件根本原因的工具。
- AutoRCA核心(ADAPT-RCA) *(即将推出)* –代理RCA引擎,对日志、指标、跟踪和配置更改进行基于图的推理。自主可靠性工作流程的参考实施。
- LangGraph –构建有状态、基于图的AI工作流的框架。可用于通过循环推理协调多步骤诊断和补救过程。
- txtai -嵌入数据库,用于对日志和文档进行语义搜索。启用RAG工作流以进行事故故障排除和知识检索。
- 干草堆 –用于建设RAG管道的端到端框架。可适用于日志分析和事故文档搜索。
代理修复和Runbook
AI代理自主执行或协调补救措施、运行手册和操作程序的系统。
- 库比亚 –DevOps工作流的对话式AI代理。与Kubernetes、Terraform和CI/CD管道集成,实现自动化操作。
- 圆甲板 –Runbook自动化和操作编排平台。可以与AI代理集成,用于智能修复工作流程。
- StackStorm –用于自动修复的事件驱动自动化平台。跨基础设施和工具连接传感器、触发器和操作。
- 可靠的规则手册 –使用Ansible的事件驱动自动化。基于可观察性信号和警报启用反应性补救。
- 罗布斯塔 –Kubernetes故障排除和自动化平台。提供诊断手册和自动修复功能。
- KubeStellar控制台 –开源AI驱动的多集群Kubernetes仪表板,内置AI聊天功能,用于自主集群故障排除、基于任务的操作和AI指导的补救。20多个CNCF集成(Argo、Kyverno、Prometheus、Falco、OPA/Gatekeeper)。CNCF沙盒项目(Apache 2.0)。
用于自主操作的MCP服务器和网关
模型上下文协议服务器和网关,将操作工具、票务系统、可观察性平台和基础设施API暴露给具有适当安全控制的AI代理。
- 安全MCP网关 *(即将推出)* –专为自主操作设计的安全第一MCP网关。具有基于策略的访问控制、用于写操作的人工循环审批工作流、全面的审计日志记录以及Jira、Splunk、Kubernetes、GitHub和PagerDuty的预构建连接器。安全AI代理访问生产系统的参考实现。
- Kubernetes的MCP服务器 –Kubernetes资源的MCP兼容接口。使AI代理能够查询集群状态,并(在有适当防护栏的情况下)执行kubectl命令。
- PulseMCP –MCP服务器的社区目录,包括以运维为重点的可观察性和基础设施工具的实现。
- 很棒的mcp服务器 –跨域MCP服务器的整理列表。针对运维相关集成的可观察性、基础设施和DevOps类别进行筛选。
- **** –用于访问GitHub API的GitHub官方MCP服务器。可用于自动创建事故单和基于PR的补救工作流程。
浏览器和桌面操作代理
浏览器自动化框架和桌面代理,让人工智能导航缺乏编程API的操作控制台、仪表板和基于网络的工具。
- Ops代理桌面 *(即将推出)* –自主SRE代理的视觉任务控制。将浏览器自动化与调查和补救工作流程的实时可视化相结合。代理行为可观察性的参考实现。
- 浏览器使用 –用于构建控制web浏览器的AI代理的框架。可用于导航缺少API的仪表板和控制台。
- 斯凯文 –使用计算机视觉和LLM的浏览器自动化框架。使代理能够与复杂的web UI交互,而无需脆弱的选择器。
- 拉瓦格 –AI驱动的web代理框架,用于自动化浏览器交互。可适用于操作控制台导航。
- 剧作家 –具有强大API的浏览器自动化库。构建与web仪表板交互的自定义运维代理的基础。
AI运维的合规性、治理和安全性
用于围绕在生产环境中运行的AI代理建立护栏、审批工作流程、政策执行和审计跟踪的工具和框架。
- 负责任的人工智能合规蓝图 *(即将推出)* –自主运营系统中的治理、风险管理和合规性综合框架。
- 开放策略代理(OPA) -基于策略的控制框架。可用于定义和执行生产中AI代理操作的策略。
- 法尔科 –云原生环境的运行时安全监控。可用于检测异常代理行为和策略违规。
- NeMo护栏 –为LLM应用程序添加可编程护栏的框架。适用于约束运维工作流中的代理行为。
- LangKit 的 –LLM可观察性和监控工具包。为AI代理提供安全指标和护栏监控。
数据集、模拟器和实验室
用于开发、测试和基准测试自主操作系统的数据集、模拟环境和实践实验室。
- ADAPT数据 *(即将推出)* -用于培训和评估RCA和诊断试剂的合成和匿名操作数据集。
- 安全的AI支持结构 *(即将推出)* –用于自主操作的完整实验室环境。包括仪表化应用程序、可观察性堆栈和示例事件场景。
- 混沌网格 –Kubernetes的混沌工程平台。可用于生成真实的故障场景以测试自主修复。
- 小妖精 –混沌工程工具和故障注入。允许对代理对生产事件的响应进行受控测试。
- OpenTetry演示 –具有完整可观察性仪器的微服务演示。为测试诊断代理提供真实的遥测数据。
- LogHub –用于研发的大量真实世界系统日志。可用于训练日志分析和异常检测模型。
如何使用此列表
此列表按以下方式组织 可组合参考架构 对于人工智能驱动的自主操作:
从可观察性和RCA开始:使用Graph RAG和根本原因分析工具,使您的代理能够了解系统中发生的事情。AutoRCA Core、txtai和LangGraph等工具构成了诊断基础。
添加安全工具访问权限:部署MCP服务器和网关,通过适当的安全控制将操作工具(Kubernetes、Jira、Splunk、GitHub)暴露给您的代理。安全MCP网关提供了一个具有策略执行和人在环审批的参考实施。
协调补救措施:集成代理补救框架(StackStorm、Rundeck、Robusta),让代理根据其诊断结果执行运行手册和恢复程序。
仅处理控制台工具:对于没有API的系统,使用浏览器自动化框架(浏览器使用、Skyvern、Playwright)让代理浏览web仪表板和遗留界面。
加强治理:在合规和安全工具(OPA、NeMo Guardrails、Falco)中分层,以约束代理行为、执行策略和维护审计跟踪。
测试和迭代:在生产部署之前,使用仿真环境和数据集(Chaos Mesh、ADAPT Data、OpenTetry Demo)开发和验证您的自主运维工作流程。
我们的目标不是构建一个单一的“人工智能操作平台”,而是将小型、定义良好、可互操作的组件组合成一个与您的操作环境和风险承受能力相匹配的系统。
资源
文档
社区
规划与愿景
贡献
欢迎投稿!请看 贡献.md 有关提出新条目、报告问题或建议改进的指导方针。
许可证
该项目根据MIT许可证获得许可。看 许可证 了解详情。
______________________________________________________________________
策展 尼克·卡莱 ·首席工程师兼建筑师·人工智能驱动的自主操作和可靠性
