MCP PDF调制解调器服务器
一个MCP(模型上下文协议)服务器,通过封装优秀的 pdf2json 图书馆。
归因
该项目使用 pdf2json 由张创建的图书馆。原始图书馆可以在以下网址找到:
- github:https://github.com/modesty/pdf2json
- npm:https://www.npmjs.com/package/pdf2json
所有PDF解析功能均由pdf2json提供。这个项目只是将其封装在MCP服务器接口中。
特性
- 从PDF文件中提取文本内容
- 从PDF文件中提取表单字段
- 多种输出格式:纯文本、JSON或详细元数据
- 零依赖PDF解析(继承自pdf2json v3.1.6+)
安装
来自npm(发布时)
npm install mcp-pdf-modesty来源
- 克隆存储库:
git clone https://github.com/lh/mcp-pdf-modesty.git
cd mcp-pdf-modesty- 安装依赖项并构建:
npm install
npm run build
npm link用法
克劳德密码
从源代码构建和链接后,将服务器添加到Claude Code:
claude mcp add mcp-pdf-modesty mcp-pdf-modesty然后重新启动Claude Code,使服务器可用。
在克劳德桌面
添加到您的 claude_desktop_config.json:
{
"mcpServers": {
"pdf": {
"command": "node",
"args": ["/path/to/mcp-pdf-modesty/dist/index.js"]
}
}
}或者如果从npm安装:
{
"mcpServers": {
"pdf": {
"command": "npx",
"args": ["mcp-pdf-modesty"]
}
}
}可用工具
提取文本
从PDF文件中提取文本内容。
参数:
path(必填):PDF文件的路径format(可选):输出格式
- "text" (默认):纯文本输出 - "json":具有文本和元数据的结构化数据 - "detailed":完整的PDF数据结构
例子:
extract_text({ path: "/path/to/document.pdf", format: "text" })提取表单字段
从PDF文件中提取表单字段。
参数:
path(必填):PDF文件的路径
例子:
extract_form_fields({ path: "/path/to/form.pdf" })发展
# Install dependencies
npm install
# Build
npm run build
# Run in development mode
npm run dev许可证
此MCP包装器根据MIT许可证获得许可。看 许可证 文件以获取详细信息。
底层pdf2json库有自己的许可证。请参阅 pdf2json存储库 关于其许可条款。
致谢
特别感谢Modesty Zhang创建和维护pdf2json库,使这个MCP服务器成为可能。
