Token导航 LogoToken导航TokenDH.com
Pyspark MCP Server logo
数据服务stdio官方级别未说明来源级核验

Pyspark MCP Server

MCP Server

PySpark MCP Server是一个轻量级的Model Context Protocol(MCP)服务器实现,用于Apache Spark,主要功能是提供查询优化和数据分析支持。

工具数

15

提示词数

0

GitHub Stars

18

资源数

0
数据分析PythonClaudeClaude

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

SemyonSinchenko

提供方

SemyonSinchenko

最后核验

2026/5/17 20:21

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

命令预览

pip install pyspark-mcp

详细介绍

hi#PySpark MCP服务器

描述

PySpark MCP Server是Apache Spark模型上下文协议(MCP)的轻量级服务器实现。

此MCP服务器的主要目的是使用AI系统促进查询优化。它提供了从Spark到AI系统的逻辑和物理查询计划,以及额外的查询计划信息。此外,服务器公开目录和表信息,从而在Spark支持的数据湖中实现数据发现功能。

快速开始

安装

pip install pyspark-mcp

运行服务器

安装后,使用 pyspark-mcp 启动服务器的命令:

pyspark-mcp --master "local[*]" --host 127.0.0.1 --port 8090

CLI会自动处理 spark-submit 配置。支持所有标准spark提交选项:

# With additional Spark configuration
pyspark-mcp --master "local[*]" --conf spark.driver.memory=4g

# YARN cluster mode
pyspark-mcp --master yarn --deploy-mode client --num-executors 4

# With additional JARs
pyspark-mcp --master "local[*]" --jars /path/to/connector.jar

# Preview the spark-submit command without running
pyspark-mcp --master "local[*]" --dry-run

# With GraphFrames package
pyspark-mcp --master "local[*]" --packages io.graphframes:graphframes-spark3_2.12:0.10.1

CLI选项

选项默认值描述
--masterlocal[*]Spark主URL
--host127.0.0.1MCP服务器主机地址
--port8090MCP服务器端口号
--spark-submitspark-submit触发提交可执行文件的路径
--dry-run-不执行打印命令

所有spark提交选项(--conf, --jars, --packages, --executor-memory等等)自动通过。

将正在运行的MCP添加到Claude代码中

# Must run one server on a different port per Claude instance
claude mcp add --transport http pyspark-mcp http://127.0.0.1:8090/mcp

依赖项

  • Python>=3.11,\=2.10.6
  • 日志
  • pyspark>=3.5

捆绑式MCP工具

PySpark MCP服务器中包含以下工具:

MCP工具说明
获取PySpark的版本从当前PySpark会话中获取版本号
获取查询的分析计划从提供的SQL查询中提取分析的逻辑计划
获取查询的优化计划从提供的SQL查询中提取优化的逻辑计划
获取查询结果的大小估计从查询计划解释中提取大小和单位
从查询计划中获取表从查询计划解释中提取所有表(关系)
获取当前Spark目录获取当前SparkSession的默认目录
检查数据库是否存在检查当前目录中是否存在具有给定名称的数据库
获取当前默认数据库从默认目录中获取当前默认的数据库
列出当前目录中的所有数据库列出当前目录的所有可用数据库
列出可用目录列出当前SparkSession中可用的所有目录
列出当前目录中的表列出当前Spark目录中的所有可用表
获取表的注释提取表的注释或返回空字符串
获取表模式获取目录中表的spark模式
返回SQL查询结果的模式运行查询,获取结果,获取结果的模式,并返回模式的JSON值
读取文本文件的前N行以纯文本形式读取文件的前N行。有助于确定格式

目录标签

目录标签

数据分析PythonClaude查询优化本地部署Spark扩展AI集成

支持客户端

Claude

接入字段

传输方式(transport,传输协议)

stdio

鉴权方式(authType,认证方式)

none

工具数量(toolCount,工具数)

15

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

stdionone部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

来源信息

继续浏览同类 MCP