](https://mseep.ai/app/askjohngeorge-mcp-doc-scraper)
文档刮刀MCP服务器
](https://smithery.ai/server/@askjohngeorge/mcp-doc-scraper)
提供文档抓取功能的模型上下文协议(MCP)服务器。此服务器使用jina.ai的转换服务将基于web的文档转换为markdown格式。
特性
- 从任何web URL中删除文档
- 将HTML文档转换为markdown格式
- 将转换后的文档保存到指定的输出路径
- 与模型上下文协议(MCP)集成
安装
通过Smithery安装
通过以下方式自动安装Claude Desktop的Doc Scraper 史密瑟里:
npx -y @smithery/cli install @askjohngeorge/mcp-doc-scraper --client claude- 克隆存储库:
git clone https://github.com/askjohngeorge/mcp-doc-scraper.git
cd mcp-doc-scraper- 创建并激活虚拟环境:
python -m venv venv
source venv/bin/activate # On Windows, use: venv\Scripts\activate- 安装依赖项:
pip install -e .用法
服务器可以使用Python运行:
python -m mcp_doc_scraper工具说明
服务器提供了一个工具:
- 名字:
scrape_docs - 描述:从URL中删除文档并另存为markdown
- 输入参数:
- url:要抓取的文档的URL - output_path:应保存markdown文件的路径
项目结构
doc_scraper/
├── __init__.py
├── __main__.py
└── server.py依赖项
- 意图tp
- 主控程序
- 媒染剂
发展
设置开发环境:
- 安装开发依赖项:
pip install -r requirements.txt- 服务器使用模型上下文协议。一定要熟悉 MCP文件.
许可证
MIT许可证
