Token导航 LogoToken导航TokenDH.com
Databricks Docs MCP logo
搜索检索stdio官方级别未说明来源级核验

Databricks Docs MCP

MCP Server

通过模型上下文协议(MCP)为AI助手提供Databricks文档的语义搜索服务,包括爬取、缓存、索引和搜索功能。

工具数

10

提示词数

0

GitHub Stars

0

资源数

0
搜索PythonClaudeClaudeCursor

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

yang0733

提供方

yang0733

最后核验

2026/5/17 20:21

运行时

Python

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

命令预览

uv run python -m databricks_docs_mcp crawl --fast

详细介绍

jms文档MCP服务器📚

通过模型上下文协议(MCP)使人工智能助手可以立即访问copula文档

![License: MIT](https://opensource.org/licenses/MIT) ![Python 3.12+](https://www.python.org/downloads/) ![FastMCP](https://github.com/jlowin/fastmcp)

⚠️ 免责声明:这是 一个官方的copula产品 由Databricks支持。这是一个社区项目,它抓取和索引公开可用的copula文档,以提供MCP集成。使用风险自负。如需官方支持,请直接联系copula。

此MCP服务器为Claude、GPT-4等AI助手提供了对完整的copula AWS文档(约3200页)的语义搜索访问。它通过MCP工具和资源抓取、缓存、索引和提供文档。

✨ 特性

  • 🔍 语义搜索:使用自然语言查询查找相关文档
  • 📦 全覆盖:访问超过3181页的copula AWS文档
  • 快速异步爬行器:比传统爬虫快5-10倍(在~5-7分钟内抓取完整文档)
  • 🗄️ 本地高速缓存:本地存储的爬网页面,用于离线访问和快速查询
  • 🧠 向量搜索:由ChromaDB和句子转换器嵌入提供支持
  • 🔄 自动刷新:可选的每日文档刷新
  • 🛠️ 10个MCP工具:以编程方式搜索、推荐和浏览文档
  • 📖 MCP资源:直接浏览文档
  • 🎯 AI IDE兼容:适用于Cursor、Claude Code和其他MCP客户端

🚀 快速开始

先决条件

  • Python 3.11或更高版本
  • 紫外线 (推荐)或pip

安装

# Clone the repository
git clone https://github.com/YOUR-USERNAME/databricks-docs-mcp.git
cd databricks-docs-mcp

# Quick start script (installs dependencies, crawls docs, starts server)
chmod +x start_server.sh
./start_server.sh

⏱️ 初始设置时间预期:

  • 第一次爬行:~5-7分钟(3181页,带快速异步爬虫)
  • 嵌入生成:约10-15分钟(为所有页面创建向量嵌入)
  • 首次运行总计:约15-22分钟
  • 后续启动:~5-10秒(使用缓存数据)

服务器将在第一次运行时自动抓取和索引文档。喝杯咖啡! ☕

手动安装

# Install uv (if not already installed)
curl -LsSf https://astral.sh/uv/install.sh | sh

# Install dependencies and create virtual environment
uv sync --group dev

# Crawl documentation (fast mode) - Takes ~5-7 minutes
uv run python -m databricks_docs_mcp crawl --fast

# Start MCP server (first start: ~10-15 min for indexing, subsequent: ~5-10 sec)
uv run python -m databricks_docs_mcp.server --no-scheduler
💡 小贴士:The --fast flag使用异步爬虫进行5-10倍的爬行。服务器在首次启动时自动创建嵌入。

📖 用法

可用的MCP工具

服务器为AI助手提供了10个MCP工具:

  1. search_docs -使用语义搜索搜索文档
  2. get_page -检索特定文档页面
  3. list_categories -列出所有文档类别
  4. search_by_category -在特定类别内搜索
  5. get_page_sections -获取页面目录
  6. recommend_related -查找相关文档页面
  7. suggest_docs -根据上下文获取建议
  8. get_quickstart -查找主题的快速入门指南
  9. explore_category -浏览类别中的所有页面
  10. get_popular_topics -获取最受欢迎的文档主题

AI IDE中的示例查询

"Search Databricks docs for Lakeflow Connect with Salesforce"
"How do I use MLflow to track experiments?"
"Show me Unity Catalog best practices"
"What are Delta Lake optimization techniques?"

CLI命令

# Crawl documentation
python -m databricks_docs_mcp crawl --fast --max-pages 1000

# Check statistics
python -m databricks_docs_mcp stats

# Reindex existing data
python -m databricks_docs_mcp index

# Refresh documentation
python -m databricks_docs_mcp refresh

# Start server
python -m databricks_docs_mcp server --no-scheduler

🔧 配置

在AI IDE中配置

光标

添加到 ~/.cursor/mcp.json:

{
  "mcpServers": {
    "databricks-docs": {
      "url": "http://localhost:8100/mcp"
    }
  }
}

克劳德桌面版

添加到 ~/Library/Application Support/Claude/claude_desktop_config.json:

{
  "mcpServers": {
    "databricks-docs": {
      "command": "python",
      "args": ["-m", "databricks_docs_mcp", "server", "--no-scheduler"],
      "cwd": "/path/to/databricks_docs_mcp",
      "env": {
        "PYTHONPATH": "/path/to/parent/directory"
      }
    }
  }
}

🏗️ 建筑

databricks_docs_mcp/
├── crawler/            # Web scraping and parsing
│   ├── scraper.py     # Original sequential crawler
│   ├── async_scraper.py   # Fast async crawler (5-10x faster)
│   ├── parser.py      # HTML to Markdown conversion
│   └── scheduler.py   # Daily auto-refresh scheduler
├── embeddings/        # Vector search components
│   ├── embedder.py    # Sentence-transformer embeddings
│   ├── vector_db.py   # ChromaDB wrapper
│   └── search.py      # Semantic search engine
├── resources/         # MCP resources
│   └── docs_resources.py
├── storage/           # Data models and caching
│   ├── models.py      # Pydantic data models
│   ├── cache.py       # Local cache management
│   └── data/          # Cached documentation
├── tools/             # MCP tools
│   ├── search.py      # Search tools
│   └── recommend.py   # Recommendation tools
├── tests/             # Unit tests
├── server.py          # FastMCP server
└── __main__.py        # CLI entry point

📊 演出

  • 爬行速度:3181页约5-7分钟(异步模式)
  • 索引速度:约5-6分钟用于完整文档
  • 搜索延迟:语义查询小于100ms
  • 存储:缓存页面约50MB,嵌入约200MB

🛠️ 发展

运行测试

pytest tests/

代码风格

# Format code
black .

# Lint
flake8 .

# Type check
mypy .

📝 文档

🤝 贡献

欢迎投稿!请查看 贡献.md 作为指导方针。

📄 许可证

此项目根据MIT许可证获得许可-请参阅 许可证 文件以获取详细信息。

🙏 致谢

📬 支持

目录标签

目录标签

搜索PythonClaude语义搜索本地部署文档索引AI助手快速爬取向量搜索

支持客户端

ClaudeCursor

接入字段

传输方式(transport,传输协议)

stdio

鉴权方式(authType,认证方式)

none

运行时(runtime,运行环境)

Python

工具数量(toolCount,工具数)

10

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

stdionone部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

来源信息

继续浏览同类 MCP