Token导航 LogoToken导航TokenDH.com
MCP Pdf Reader V3 logo
文档知识stdio官方级别未说明来源级核验

MCP Pdf Reader V3

MCP Server

一个基于FastMCP的PDF文件阅读服务器,支持PDF文本提取、OCR识别和图像提取,提供内置的Web调试器以便测试。

工具数

3

提示词数

0

GitHub Stars

0

资源数

0
PDF处理Python文本提取

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

galacoder

提供方

galacoder

最后核验

2026/5/17 20:20

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

命令预览

pip install pymupdf mcp

详细介绍

📄 MCP PDF服务器

基于.NET的PDF文件读取服务器 FastMCP.

通过MCP协议支持PDF文本提取、OCR识别和图像提取,内置web调试器便于测试。

______________________________________________________________________

🚀 特性

  • read_pdf_text\

从PDF中提取普通文本(逐页)。

  • read_by_ocr\

使用OCR识别扫描或基于图像的PDF中的文本。

  • read_pdf_images\

从指定的PDF页面中提取所有图像(Base64编码输出)。

______________________________________________________________________

📂 项目结构

mcp-pdf-server/
├── pdf_resources/        # Directory for uploaded and processed PDF files
├── txt_server.py         # Main server entry point
└── README.md             # Project documentation

______________________________________________________________________

⚙️ 安装

推荐Python版本:3.9+

pip install pymupdf mcp
注意:要使用OCR功能,您可能需要一个支持OCR的MuPDF版本或外部OCR库。

______________________________________________________________________

🔦 启动服务器

运行以下命令:

python txt_server.py

您应该看到以下日志:

Serving on http://127.0.0.1:6231

______________________________________________________________________

🌐 Web调试界面

打开浏览器并访问:

http://127.0.0.1:6231
  • 从左侧面板中选择工具
  • 在右侧面板上填写参数
  • 点击“运行”以测试该工具

无需编码——通过web UI轻松调试和测试。

______________________________________________________________________

🛠️ API工具清单

工具描述输入参数返回
read_pdf_text从PDF页面中提取普通文本file_path, start_page, end_page页面文本列表
read_by_ocr通过OCR识别文本file_path, start_page, end_page, language, dpiOCR提取文本
read_pdf_images从PDF页面提取图像file_path, page_number图像列表(Base64编码)

______________________________________________________________________

📝 示例用法

从第1页到第5页摘录文本:

mcp run read_pdf_text --args '{"file_path": "pdf_resources/example.pdf", "start_page": 1, "end_page": 5}'

在第1页执行OCR识别:

mcp run read_by_ocr --args '{"file_path": "pdf_resources/example.pdf", "start_page": 1, "end_page": 1, "language": "eng"}'

从第3页提取所有图像:

mcp run read_pdf_images --args '{"file_path": "pdf_resources/example.pdf", "page_number": 3}'

______________________________________________________________________

📢 备注

  • 文件必须放置在 pdf_resources/ 必须提供目录或绝对路径。
  • OCR功能需要环境中适当的OCR支持。
  • 处理大文件时,根据需要调整内存和超时设置。

______________________________________________________________________

📜 许可证

该项目根据MIT许可证获得许可。\ 对于商业用途,请注明原始来源。

______________________________________________________________________

目录标签

目录标签

PDF处理Python文本提取本地部署OCR识别图像提取Web调试

接入字段

传输方式(transport,传输协议)

stdio

鉴权方式(authType,认证方式)

none

工具数量(toolCount,工具数)

3

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

stdionone部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

来源信息

继续浏览同类 MCP