Token导航 LogoToken导航TokenDH.com
Local Read MCP logo
文档知识stdio官方级别未说明来源级核验

Local Read MCP

MCP Server

Local Read MCP Server是一款本地文档处理服务,支持从PDF、Office文档、HTML、ZIP归档中提取结构化内容,并可进行图像分析。

工具数

2

提示词数

0

GitHub Stars

3

资源数

0
文档处理本地服务PythonClaudeClaude

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

ansatzX

提供方

ansatzX

最后核验

2026/5/17 20:20

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

命令预览

pip install "local-read-mcp[mineru]"

详细介绍

本地读取MCP服务器

用于本地文档处理的MCP服务器——从PDF、Office文档、HTML、ZIP存档和可选图像分析中进行结构化提取。旨在补充代理的内置读取工具,而不是复制它。

工具

工具暴露是启动时间的条件:

  • 始终可用: process_binary_file
  • 仅当视觉配置存在时可用(VISION_API_KEYOPENAI_API_KEY): analyze_image
工具何时使用
process_binary_file在读取之前,将支持的二进制/文档/存档文件转换为结构化输出。保存到 .local_read_mcp/.
analyze_image通过Vision API(豆宝、GPT-4o等)分析图像。结果保存到 .local_read_mcp/analysis/.

快速开始

git clone https://github.com/ansatzX/Local_Read_MCP.git
cd Local_Read_MCP

uv venv .venv && source .venv/bin/activate
uv pip install -e .

在中配置MCP ~/.claude/settings.json:

{
  "mcpServers": [{
    "command": "uv",
    "args": ["--directory", "/path/to/Local_Read_MCP", "run", "python", "-m", "local_read_mcp.server"]
  }]
}

视觉API(可选)

创建 .env 在存储库根目录中:

VISION_API_KEY=sk-xxx
VISION_BASE_URL=https://ark.cn-beijing.volces.com/api/v3
VISION_MODEL=doubao-seed-1-8-251228

启动时,服务器加载存储库根目录 .env 然后读取环境变量。 现有流程环境变量优先于 .env 价值观。 analyze_image 仅当服务器在启动时看到vision API密钥env vars时才注册。 更改env值后,重新启动MCP服务器。

MinerU VLM-HYBRID后端(可选)

对于具有布局分析、公式识别和表格检测的高质量PDF解析:

pip install "local-read-mcp[mineru]"

# Download models into the project directory
mineru-models-download --models-dir ./models

# Configure model paths
cp mineru.json.template mineru.json
# Edit mineru.json if models are elsewhere

下载的型号(总计约4.5GB):

  • models/pipeline/ --布局检测、OCR、公式识别、表格结构
  • models/vlm/ --微调Qwen2 VL用于文档理解

运作原理

process_binary_file(file.pdf)
  ├─ format detection → backend selection
  │
  ├─ SIMPLE (local converters, no model/API dependency)
  │   └─ Built-in converters + MarkItDown fallback: PyMuPDF / mammoth / openpyxl / python-pptx
  │
  ├─ VLM-HYBRID (MinerU required, PDF only)
  │   └─ MinerU hybrid-auto-engine: VLM layout + pipeline OCR/formula/table
  │
  └─ chapter_split (auto for large PDFs)
      ├─ Detect sections via TOC / heading scan / fixed chunks
      ├─ Process each chunk independently (with page overlap)
      └─ Merge output.md + structural_toc.json

所有结果保存到 .local_read_mcp/_/:

  • intermediate.json --结构化块表示法
  • output.md --已转换的降价
  • index.json --节/表/图索引
  • images/ --提取的图像(在需要时)

图形提取策略(当前):

  • PDF图像提取首先是有意回忆:它提取嵌入的光栅和可疑的矢量/图像区域。
  • 不应用重复数据删除。
  • TODO:页面级真实性判断(页面是否真正包含数字)和重复辨别质量评估。

发展

uv run pytest          # Run tests
uv run ruff format .   # Format code
uv run ruff check .    # Lint

许可证

麻省理工学院

目录标签

目录标签

文档处理本地服务PythonClaude本地部署结构化提取PDF解析图像分析

支持客户端

Claude

接入字段

传输方式(transport,传输协议)

stdio

鉴权方式(authType,认证方式)

none

工具数量(toolCount,工具数)

2

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

stdionone部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

来源信息

继续浏览同类 MCP