Token导航 LogoToken导航TokenDH.com
MCP Doc Reader logo
文档知识stdio官方级别未说明来源级核验

MCP Doc Reader

MCP Server

一个基于MCP协议的服务,支持从PDF、Excel和Word文档中提取内容,适用于需要处理多种文档格式的AI助手。

工具数

3

提示词数

0

GitHub Stars

2

资源数

0
文档处理多格式支持PythonClaude跨平台Claude DesktopClaudeCursor

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

aardpro

提供方

aardpro

最后核验

2026/5/17 20:22

运行时

Python

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

命令预览

uvx mcp-doc-reader

详细介绍

MCP文档阅读器

英语 | 中文

A. 模型上下文协议(MCP) 服务器,使AI助手能够从PDF、Excel和Word文档中读取和提取内容。

特性

  • PDF阅读:使用从PDF文件中提取文本内容 pdfminer.six
  • Excel读取:阅读 .xlsx.xls 带有格式化表格输出的文件
  • 读字:从中提取文本和表格 .docx 文件
  • 交叉平台的:适用于Windows、Linux和macOS
  • Unicode支持:完全支持非ASCII字符(中文、日文等)

安装

使用uvx(推荐)

uvx mcp-doc-reader

使用pip

pip install mcp-doc-reader

来自源头

git clone https://github.com/yourusername/mcp-doc-reader.git
cd mcp-doc-reader
pip install -e .

配置

将以下内容添加到MCP客户端配置中(例如,Claude Desktop、Cursor):

选项1:使用uvx(推荐)

{
  "mcpServers": {
    "DocReader": {
      "command": "uvx",
      "args": ["mcp-doc-reader"]
    }
  }
}

选项2:使用pip安装命令

{
  "mcpServers": {
    "DocReader": {
      "command": "mcp-doc-reader"
    }
  }
}

选项3:支持Unicode的Windows

对于具有非ASCII文件路径(例如,中文字符)的Windows系统:

{
  "mcpServers": {
    "DocReader": {
      "command": "cmd",
      "args": [
        "/c",
        "chcp 65001 >nul && uvx mcp-doc-reader"
      ]
    }
  }
}

选项4:带Python模块的Linux/macOS

{
  "mcpServers": {
    "DocReader": {
      "command": "python",
      "args": ["-m", "docreader"]
    }
  }
}

可用工具

read_pdf

从PDF文件中读取文本内容。

参数:

  • file_path (string,必填):PDF文件的绝对路径

例子:

{
  "name": "read_pdf",
  "arguments": {
    "file_path": "/path/to/document.pdf"
  }
}

read_excel

从Excel文件(.xlsx或.xls)读取内容。

参数:

  • file_path (字符串,必填):Excel文件的绝对路径

例子:

{
  "name": "read_excel",
  "arguments": {
    "file_path": "/path/to/spreadsheet.xlsx"
  }
}

read_word

从Word文件(.docx)读取文本内容。

参数:

  • file_path (string,必填):Word文件的绝对路径

例子:

{
  "name": "read_word",
  "arguments": {
    "file_path": "/path/to/document.docx"
  }
}

使用示例

配置后,您可以要求您的AI助手:

  • “阅读/path/to/report.pdf的内容”
  • “从/path/to/data.xlsx提取数据”
  • “文档/path/to/memo.docx包含什么?”

发展

设置开发环境

git clone https://github.com/yourusername/mcp-doc-reader.git
cd mcp-doc-reader
pip install -e ".[dev]"

运行测试

pytest

构建包

pip install build
python -m build

发布到PyPI

pip install twine
twine upload dist/*

项目结构

mcp-doc-reader/
├── src/
│   └── docreader/
│       ├── __init__.py
│       ├── __main__.py
│       ├── server.py
│       └── readers/
│           ├── __init__.py
│           ├── pdf_reader.py
│           ├── excel_reader.py
│           └── word_reader.py
├── examples/
│   ├── mcp_config_pip.json
│   ├── mcp_config_uvx.json
│   ├── mcp_config_windows.json
│   └── mcp_config_linux.json
├── pyproject.toml
├── README.md
└── LICENSE

故障排除

Windows:Unicode/中文文件名问题

如果在Windows上的文件路径中遇到非ASCII字符问题,请使用将代码页设置为UTF-8的Windows特定配置:

{
  "mcpServers": {
    "DocReader": {
      "command": "cmd",
      "args": ["/c", "chcp 65001 >nul && mcp-doc-reader"]
    }
  }
}

.doc文件不受支持

Word阅读器仅支持 .docx 格式。阅读 .doc 文件,请将其转换为 .docx 首先使用微软Word或LibreOffice。

许可证

MIT许可证-请参阅 许可证 了解详情。

贡献

欢迎投稿!请随时提交拉取请求。

目录标签

目录标签

文档处理多格式支持PythonClaude跨平台本地部署文本提取AI助手工具

支持客户端

Claude DesktopClaudeCursor

接入字段

传输方式(transport,传输协议)

stdio

鉴权方式(authType,认证方式)

none

运行时(runtime,运行环境)

Python

工具数量(toolCount,工具数)

3

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

stdionone部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

来源信息

继续浏览同类 MCP