pdf文本提取mcp
MCP服务器,使LLM能够读取PDF文件。从PDF中提取文本、表格和结构化内容,并将其以纯文本、Markdown或CSV格式返回。
建立在 pdf文本摘录 和那个 模型上下文协议.以零运行时依赖性的单个二进制文件形式发布。
安装
安装脚本(macOS/Linux)
curl -fsSL https://raw.githubusercontent.com/yosephbernandus/pdf-text-extract-mcp/master/install.sh | sh货物(需要防锈)
cargo install pdf-text-extract-mcp手动下载
从以下网址下载适用于您平台的二进制文件 发布 页面:
| 平台 | 二进制 |
|---|---|
| Linux x86_64 | pdf-mcp-linux-x86_64 |
| Linux ARM64 | pdf-mcp-linux-aarch64 |
| macOS英特尔 | pdf-mcp-darwin-x86_64 |
| macOS苹果硅 | pdf-mcp-darwin-aarch64 |
| Windows x86_64 | pdf-mcp-windows-x86_64.exe |
然后使其可执行并将其移动到PATH:
chmod +x pdf-mcp-*
sudo mv pdf-mcp-* /usr/local/bin/pdf-mcp使用Claude代码进行设置
claude mcp add pdf-text-extract -- pdf-mcp如果将二进制文件安装到自定义位置:
claude mcp add pdf-text-extract -- /path/to/pdf-mcp工具
pdf_to_text
将PDF中的所有文本提取为纯文本(具有标题、段落和表格的布局感知)。
{ "file_path": "/path/to/file.pdf" }pdf_to_markdown
使用Markdown从PDF中提取所有文本 # 标题和 | 桌子。最适合报告和发票等结构化文档。
{ "file_path": "/path/to/file.pdf" }pdf_to_csv
将PDF中的所有文本提取为CSV。最适合银行对账单和交易列表等表格PDF。
{ "file_path": "/path/to/file.pdf" }pdf_page_count
获取PDF中的页数。
{ "file_path": "/path/to/file.pdf" }pdf_extract_page
以指定格式提取单个页面。适用于需要一次处理一页的大型PDF。
{ "file_path": "/path/to/file.pdf", "page": 0, "format": "markdown" }page为0索引format接受"text","markdown",或"csv"
从源头构建
git clone https://github.com/yosephbernandus/pdf-text-extract-mcp.git
cd pdf-text-extract-mcp
cargo build --release二进制文件将位于 target/release/pdf-mcp.
许可证
麻省理工学院
