解析纸张MCP
模型上下文协议(MCP)服务器,用于解析大型学术论文(PDF文件),并优化文本和图像提取,以供LLM使用。
特性
- 提取针对LLM优化的Markdown格式的文本
- 以可配置的质量级别提取和压缩图像
- 智能压缩:在保持可读性的同时减少85%以上的大小
- 支持逐页提取
- 丰富的PDF元数据提取
Claude Code的安装
使用uvx(推荐)
添加到您的 .mcp.json 文件:
{
"mcpServers": {
"parse-paper-mcp": {
"command": "uvx",
"args": ["--from", "git+https://github.com/bgyooPtr/parse-paper-mcp", "parse-paper-mcp"]
}
}
}重新启动Claude Code以加载服务器。
本地开发
- 克劳德代码
claude mcp add parse-paper-mcp -s project -- uvx --from git+https://github.com/bgyooPtr/parse-paper-mcp parse-paper-mcp可用工具
parse_paper
用文本和图像解析整篇论文。使用 pages 用于处理特定页面的参数(例如。, [0,1,2] 前3页)。
关键参数:
pdf_path(必填):PDF文件的路径output_dir(可选):保存图像的目录quality(可选):"high","medium"(默认),"low"extract_images(可选):是否提取图像(默认值:true)pages(可选):要提取的页码列表(从0开始)max_chars(可选):限制文本长度
extract_text_only
Markdown格式的快速纯文本提取(无图像)。
extract_images_only
仅从PDF中提取和压缩图像。
get_paper_metadata
获取PDF元数据(标题、作者、页数、文件大小等)。
Claude代码中的用法
Parse /path/to/paper.pdf with medium quality, saving images to /tmp/outputExtract text from /path/to/paper.pdf pages 0-5Get metadata for /path/to/paper.pdf质量等级
- 高:最大1500px,90质量,200 DPI-最适合详细图表
- 中等 (默认):最大1024px,85质量,150 DPI-平衡质量/大小
- 低:最大768像素,75质量,100 DPI-最大压缩
许可证
麻省理工学院
