Token导航 LogoToken导航TokenDH.com
K8s Gpu MCP Server logo
运维云端stdio官方级别未说明来源级核验

K8s Gpu MCP Server

MCP Server

k8s-gpu-mcp-server@latest

一个用于Kubernetes集群中NVIDIA GPU硬件实时诊断的轻量级代理工具,支持AI辅助故障排查和深度硬件访问。

工具数

9

提示词数

0

GitHub Stars

4

资源数

0
KubernetesClaude云端部署Claude DesktopClaudeCursorVS Code

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

ArangoGutierrez

提供方

ArangoGutierrez

最后核验

2026/5/17 20:20

运行时

Node.js

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

命令预览

npx k8s-gpu-mcp-server@latest

详细介绍

k8s gpu mcp服务器

Kubernetes上NVIDIA GPU集群的实时SRE诊断代理

](https://go.dev/) ![License](LICENSE) ![CI Status](https://github.com/ArangoGutierrez/k8s-gpu-mcp-server/actions) ](https://github.com/ArangoGutierrez/k8s-gpu-mcp-server/issues) ](https://github.com/ArangoGutierrez/k8s-gpu-mcp-server) ![MCP](https://modelcontextprotocol.io/)

______________________________________________________________________

概述

k8s-gpu-mcp-server 是一个 短暂诊断剂 其提供外科手术, 通过以下方式对Kubernetes集群进行实时NVIDIA GPU硬件自检 模型上下文协议(MCP).

与传统的监控系统不同,此代理旨在 人工智能辅助 故障排除 通过SRE调试标准的复杂硬件故障 Kubernetes API无法检测。

✨ 主要特点

  • 🎯 占地面积小,始终可用 -持久HTTP服务器(~15-20MB空闲)仅在调用工具时执行GPU工作
  • 🔌 HTTP传输 -HTTP/SSE上的JSON-RPC 2.0(生产默认)
  • 🔍 深度硬件访问 -GPU诊断的直接NVML集成
  • 🤖 人工智能原生 -专为Claude Desktop、Cursor和MCP兼容主机构建
  • 📋 MCP提示 -预构建的GPU诊断工作流程,用于指导故障排除
  • 🔒 缺省巩固安全 -具有显式运算符模式的只读操作
  • 生产就绪 -真正的特斯拉T4测试,550多项测试通过

______________________________________________________________________

🚀 快速开始

一键安装

![Install MCP Server](https://cursor.com/install-mcp?name=k8s-gpu-mcp&config=eyJtY3BTZXJ2ZXJzIjp7Ims4cy1ncHUtbWNwIjp7ImNvbW1hbmQiOiJucHgiLCJhcmdzIjpbIi15IiwiazhzLWdwdS1tY3Atc2VydmVyQGxhdGVzdCJdfX19Cg==)

单击上面的按钮在Cursor中自动安装。

单线安装

# Using npx (recommended)
npx k8s-gpu-mcp-server@latest

# Or install globally
npm install -g k8s-gpu-mcp-server

📋 Manual Configuration: Cursor / VS Code

增添 ~/.cursor/mcp.json (光标)或VS代码MCP配置:

{
  "mcpServers": {
    "k8s-gpu-mcp": {
      "command": "npx",
      "args": ["-y", "k8s-gpu-mcp-server@latest"]
    }
  }
}

📋 Manual Configuration: Claude Desktop

macOS: ~/Library/Application Support/Claude/claude_desktop_config.json\ 窗户: %APPDATA%\Claude\claude_desktop_config.json

{
  "mcpServers": {
    "k8s-gpu-mcp": {
      "command": "npx",
      "args": ["-y", "k8s-gpu-mcp-server@latest"]
    }
  }
}

从源代码安装

# Clone and build
git clone https://github.com/ArangoGutierrez/k8s-gpu-mcp-server.git
cd k8s-gpu-mcp-server
make agent

# Test with mock GPUs (no hardware required)
cat examples/gpu_inventory.json | ./bin/agent --nvml-mode=mock

# Test with real GPU (requires NVIDIA driver)
cat examples/gpu_inventory.json | ./bin/agent --nvml-mode=real

部署到Kubernetes

# Deploy with Helm OCI (recommended)
helm install k8s-gpu-mcp-server \
  oci://ghcr.io/arangogutierrez/charts/k8s-gpu-mcp-server \
  --namespace gpu-diagnostics --create-namespace

# Or from local chart
helm install k8s-gpu-mcp-server ./deployment/helm/k8s-gpu-mcp-server \
  --namespace gpu-diagnostics --create-namespace

# Find agent pod on target node
NODE_NAME=
POD=$(kubectl get pods -n gpu-diagnostics \
  -l app.kubernetes.io/name=k8s-gpu-mcp-server \
  --field-selector spec.nodeName=$NODE_NAME \
  -o jsonpath='{.items[0].metadata.name}')

# Start diagnostic session
kubectl exec -it -n gpu-diagnostics $POD -- /agent --mode=read-only
注: GPU访问需要 runtimeClassName: nvidia 配置如下 GPU操作员或nvidia ctk。对于没有RuntimeClass的集群,使用回退: --set gpu.runtimeClass.enabled=false --set gpu.resourceRequest.enabled=true

使用kubectl配置Claude Desktop(高级)

对于已部署的代理,请添加到您的Claude Desktop配置中:

{
  "mcpServers": {
    "k8s-gpu-agent": {
      "command": "kubectl",
      "args": ["exec", "-i", "deploy/k8s-gpu-mcp-server", "-n", "gpu-diagnostics", "--", "/agent"]
    }
  }
}

然后问克劳德: *“GPU的温度是多少?”*

📖 完整快速入门指南→ | Kubernetes部署→

______________________________________________________________________

📊 建筑

┌─────────────────────────────────────────────────────────────────────┐
│                    MCP Client (Claude/Cursor)                        │
└────────────────────────────┬────────────────────────────────────────┘
                             │ stdio / HTTP
                             ▼
┌─────────────────────────────────────────────────────────────────────┐
│                    Gateway Pod (:8080)                               │
│       Router → Circuit Breaker → HTTP Client                         │
└────────────────────────────┬────────────────────────────────────────┘
                             │ HTTP (pod-to-pod)
         ┌───────────────────┼───────────────────┐
         ▼                   ▼                   ▼
┌─────────────────┐  ┌─────────────────┐  ┌─────────────────┐
│  Agent (Node 1) │  │  Agent (Node 2) │  │  Agent (Node N) │
│  9 MCP Tools    │  │  9 MCP Tools    │  │  9 MCP Tools    │
│  NVML → GPU     │  │  NVML → GPU     │  │  NVML → GPU     │
└─────────────────┘  └─────────────────┘  └─────────────────┘

设计原则:

  • HTTP优先:网关通过HTTP路由到代理Pod(延迟约50ms)
  • 低占地面积:持久HTTP服务器,~15-20MB内存
  • 可观察对象:断路器、普罗米修斯指标、分布式跟踪
  • 接口抽象:可测试、灵活、便携(538次测试)

📖 架构文档→

______________________________________________________________________

🛠️ 可用工具

工具描述类别状态
get_gpu_inventory硬件清单+遥测NVML✅ 可用
get_gpu_healthGPU健康监测与评分NVML✅ 可用
analyze_xid_errors从内核日志中解析GPU XID错误代码NVML✅ 可用
get_nvlink_topologyNVLink互连拓扑和健康状况NVML✅ 可用
get_gpu_timeline来自飞行记录器的历史GPU指标NVML+Blackbox✅ 可用
describe_gpu_node具有K8s元数据的节点级GPU诊断K8s+NVML✅ 可用
get_pod_gpu_allocation通过资源请求实现GPU到Pod的相关性K8s✅ 可用
explain_failureGPU工作负载失败的根本原因分析K8s+事件✅ 可用
get_incident_report详细的事件报告,包括时间线和快照K8s+事件✅ 可用
kill_gpu_process终止GPU进程操作员🚧 M4(操作员)
reset_gpuGPU重置操作员🚧 M4(操作员)

📋 可用提示

MCP Prompts提供编排多个工具的指导性诊断工作流程。 看 pkg/prompts/prompts.go 以获得快速定义。

提示描述
gpu-health-check全面的GPU健康评估及建议
diagnose-xid-errors使用修正指南分析NVIDIA XID错误
gpu-triage标准SRE分诊工作流程:库存→ 健康→ XID分析

Claude的用法示例:

You: "Run the GPU triage workflow for node gpu-worker-5"

Claude: [Executes gpu-triage prompt]
        → Calls get_gpu_inventory, get_gpu_health, analyze_xid_errors
        → Returns structured triage report with recommendations

🔒 操作模式

模式标志描述
只读 (默认)--mode=read-only所有诊断工具,无突变
操作员--mode=operator启用未来的变异操作(杀死进程、重置GPU)

只读模式是默认模式,建议用于大多数用例。操作员模式 支持在GPU上执行写入操作的未来M4工具。

📼 飞行记录器

该代理包括一个内置的飞行记录器(pkg/blackbox)持续不断 将GPU遥测数据(温度、功耗、利用率、内存)捕获到每个GPU中 环形缓冲器。这使得以下工具成为可能 get_gpu_timelineget_incident_report 查询故障发生时的历史GPU指标。

飞行记录器随代理自动启动,无需额外操作 配置。数据保留在配置窗口的内存中(默认值:30分钟)。

📖 MCP使用指南→

______________________________________________________________________

📈 项目状态

当前里程碑: M3:Kubernetes集成

进展: 约90%完成(HTTP传输✅, 网关✅, K8s工具✅)

已完成的里程碑

- 真正的NVML集成,在特斯拉T4上测试 - GPU健康监测、XID错误分析 - npm/Helm发行版

最近更新(2026年1月)

  • 1月17日:MCP提示支持-3个内置GPU诊断工作流程
  • 1月16日对外部贡献者进行360度文档审查
  • 1月15日:K8s工具完成(describe_gpu_node, get_pod_gpu_allocation)
  • 1月14日:HTTP传输Epic完成-延迟改善150倍
  • 1月14日:跨节点网络修复(Calico VXLAN)
  • 1月13日:带断路器和普罗米修斯指标的网关模式

📊 查看所有里程碑→

______________________________________________________________________

🧪 测试

单元测试(无需GPU)

make test                   # Run all unit tests (538 tests passing)
make coverage               # Generate coverage report
make coverage-html          # View coverage in browser

集成测试(需要GPU)

make test-integration       # Run on GPU hardware
# Or manually:
go test -tags=integration -v ./pkg/nvml/

最新测试结果:

✓ 538 total tests passing
✓ Race detector enabled (-race)
✓ Coverage: 58-80% by package

Integration tested on Tesla T4:
  - GPU: Tesla T4 (15GB)
  - Temperature: 29°C
  - Power: 13.9W
  - All NVML operations verified

______________________________________________________________________

🏗️ 构建

# Build for local platform
make agent

# Build for Linux (with real NVML)
CGO_ENABLED=1 GOOS=linux GOARCH=amd64 make agent

# Build container image
make image

# Multi-arch release builds
make dist

二进制大小:

  • 模拟模式: 430万桶 (CGO禁用)
  • 真实模式: 7.9毫巴 (CGO已启用)

______________________________________________________________________

📦 安装

使用npm(推荐)

# Run directly with npx
npx k8s-gpu-mcp-server@latest

# Or install globally
npm install -g k8s-gpu-mcp-server

来源

git clone https://github.com/ArangoGutierrez/k8s-gpu-mcp-server.git
cd k8s-gpu-mcp-server
make agent
sudo mv bin/agent /usr/local/bin/k8s-gpu-mcp-server

使用Go

go install github.com/ArangoGutierrez/k8s-gpu-mcp-server/cmd/agent@latest

容器图像

docker pull ghcr.io/arangogutierrez/k8s-gpu-mcp-server:latest

Helm图表(OCI)

# Install from GHCR OCI registry
helm install k8s-gpu-mcp-server \
  oci://ghcr.io/arangogutierrez/charts/k8s-gpu-mcp-server \
  --namespace gpu-diagnostics --create-namespace

______________________________________________________________________

🤝 贡献

我们欢迎捐款!请查看我们的 开发指南 了解详情。

快速贡献指南

  1. 检查 问题
  2. 分叉并创建特征分支: git checkout -b feat/my-feature
  3. 进行更改,添加测试
  4. 运行检查: make all
  5. 向DCO承诺: git commit -s -S -m "feat(scope): description"
  6. 带有标签和里程碑的公开公关

📖 完整开发指南→

______________________________________________________________________

📚 文档

______________________________________________________________________

🔧 技术栈

______________________________________________________________________

🎯 用例

1.调试卡住的培训工作

SRE: "Why is the training job on node-5 stuck?"
Claude → k8s-gpu-mcp-server → Detects XID 48 (ECC Error)
Claude: "Node-5 has uncorrectable memory errors. Drain immediately."

2.热管理

SRE: "Are any GPUs thermal throttling?"
Claude → k8s-gpu-mcp-server → Checks temps and throttle status
Claude: "GPU 3 is at 86°C and thermal throttling. Check cooling."

3.拓扑验证

SRE: "Is NVLink properly configured for multi-GPU training?"
Claude → k8s-gpu-mcp-server → Inspects NVLink topology
Claude: "All 8 GPUs connected via NVLink, 600GB/s bandwidth."

4.僵尸进程狩猎

SRE: "GPU memory is full but no pods are running"
Claude → k8s-gpu-mcp-server → Lists GPU processes
Claude: "Found zombie process PID 12345 using 8GB. Kill it?"

______________________________________________________________________

🏆 成就

  • 转到1.25 -最新Go版本
  • 真实NVML -在特斯拉T4上测试
  • 550+测试通过 -种族检测器已启用,覆盖率为58-80%
  • HTTP优先架构 -比exec路由快150倍
  • 网关+断路器 -生产级可靠性
  • MCP提示 -SRE故障排除的指导性诊断工作流程
  • 普罗米修斯指标 -每节点延迟跟踪
  • ~8MB二进制文件 -84%低于50MB目标
  • MCP 2025-06-18 -最新协议版本

______________________________________________________________________

📄 许可证

Apache许可证2.0-请参阅 许可证 了解详情。

______________________________________________________________________

🙏 致谢

______________________________________________________________________

📞 联系

维护人员: @阿兰戈古铁雷斯\ 问题: \ 讨论:

______________________________________________________________________

⭐ 把我们放在GitHub上——这很有帮助!

报告Bug · 请求功能 · 查看路线图

目录标签

目录标签

KubernetesClaude云端部署Go本地部署GPU诊断AI辅助硬件监控SRE工具

支持客户端

Claude DesktopClaudeCursorVS Code

接入字段

传输方式(transport,传输协议)

stdio

鉴权方式(authType,认证方式)

session

运行时(runtime,运行环境)

Node.js

来源包(packageName,安装包名)

k8s-gpu-mcp-server@latest

工具数量(toolCount,工具数)

9

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

stdiosession部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

来源信息

继续浏览同类 MCP