PDFBox MCP服务器
使用Apache PDFBox提供PDF处理功能的模型上下文协议(MCP)服务器。
特性
- 提取文本 -使用可选的页面范围支持从PDF文件中提取文本内容
- 获取元数据 -提取PDF元数据(标题、作者、创建日期等)
- get_page_count -获取PDF文件中的总页数
依赖项
- Java 17+
- Apache PDFBox 3.0.5
- MCP SDK 0.10.0
- Maven用于构建管理
用法
构建项目:
mvn compile运行服务器:
mvn exec:java工具
提取文本
从PDF文件中提取文本内容。
参数:
file_path(必填):PDF文件的路径page_range(可选):页面范围(例如“1-5”或“全部”)
获取元数据
从PDF文件中提取元数据,包括标题、作者、创建日期等。
参数:
file_path(必填):PDF文件的路径
get_page_count
获取PDF文件中的页数。
参数:
file_path(必填):PDF文件的路径
状态
目前正在开发中。实现了核心功能,但编译需要对MCP SDK API进行调整。
