arXiv txt MCP服务器
MCP服务器 arxiv-txt.org,提供法学硕士友好的纯文本摘要和从TeX源代码呈现的arXiv论文的全部内容。
特性
- 论文摘要:检索任何arXiv论文的纯文本摘要。
- 全文内容:以纯文本格式获取论文的全部内容。
- 自助主机支持:可以配置为指向自托管
arxiv-txt通过环境变量创建实例。
工具
get_summary(arxiv_id: str) -> str
获取给定arXiv ID的论文摘要(例如“1706.03762”)。
get_full_paper(arxiv_id: str) -> str
获取给定arXiv ID的完整纸张内容。
安装和使用
- 克隆存储库:
git clone
cd - 安装依赖项:
pip install -r .- (可选)配置自托管实例:
创建一个 .env 根目录中的文件,用于指定自定义 arxiv-txt 网址:
ARXIV_TXT_URL=http://localhost:8000- 在本地运行服务器:
python arxiv_txt_server.py- 从MCP客户端连接:
对于支持它的客户端,请在配置文件中添加服务器条目:
"mcpServers": {
"arxiv-txt": {
"command": "python",
"args": [
"/path/to/your/main.py"
]
}
}例子
安装后,您可以询问您的法学硕士助理:
- “arXiv论文1706.03762的摘要是什么?”
- “获取论文《注意力是你所需要的一切》(1706.03762)的全文。”
客户端将自动调用相应的工具,并在响应中使用内容。
为什么选择此服务器?
更适合我的使用场景(云端vps上的librechat),我将我的mcp服务器预先放入librechat的 api 图像。
大多数arXiv MCP服务器依赖于本地OCR库,如 PyMuPDF,导致:
- Alpine Linux上的构建失败:
PyMuPDFAlpine的musl-libc缺少预构建的轮子,迫使源代码编译速度缓慢,在编译过程中经常失败docker build. - 精度差,资源量大:本地OCR是资源密集型的,产生的文本提取质量较低。
通过将解析委托给 arxiv-txt.org:
- 轻量级:没有OCR依赖关系,只是
requests和fastmcp. - 零构建问题:可在任何操作系统上无缝工作,包括Alpine Linux。
- 较好质量:使用针对干净、LLM友好的arXiv文本提取而优化的服务。
非常适合低资源环境(例如VPS部署)或 glibc 不可用
许可证
该项目根据MIT许可证获得许可。
致谢
- 内置于 FastMCP.
- 文本内容由 arXiv-txt.org 服务。
- 该项目根据MIT许可证获得许可。
