Token导航 LogoToken导航TokenDH.com
Academic Paper Scraper logo
搜索检索未说明官方级别未说明来源级核验

Academic Paper Scraper

MCP Server

一款从Semantic Scholar和arXiv搜索并获取学术论文的工具,支持批量搜索、论文ID查找和引用图遍历,适用于AI/LLM构建者、系统综述团队和研究人员。

工具数

0

提示词数

0

GitHub Stars

1

资源数

0
PythonClaude批量处理ClaudeWindsurf

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

labrat-0

提供方

labrat-0

最后核验

2026/5/17 20:22

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

详细介绍

学术论文刮刀

从Semantic Scholar(226M多篇论文)和arXiv搜索和检索学术论文。以干净的JSON格式获取标题、摘要、人工智能摘要、引用计数、DOI和开放获取PDF。在一次运行中跨多个查询进行批量搜索。没有API密钥,没有浏览器,没有代理。

它有什么作用?

学术论文抓取器查询语义学者图API和arXiv API来查找、检索和分析学术文献。它将两个来源的结果统一到一个一致的模式中——无论论文来自哪里,都是相同的字段。

v1.1.0版本: 添加了批量搜索(queriesList)--在单个作业中运行多个查询,并按纸张ID自动进行重复数据删除。

谁用这个

  • AI/LLM构建者 --收集特定主题的摘要、TLD和元数据,以构建RAG管道、微调模型或为研究助理提供动力,而无需手动下载论文
  • 系统评价和荟萃分析团队 --在一次运行中通过多个搜索查询收集数百篇论文,进行重复数据消除并准备进行筛选
  • 制药和生物技术研究人员 --绘制药物发现文献,跟踪临床试验出版物,按领域和日期范围提取基因组学论文
  • 研究情报小组 --监控竞争对手和学术界发表的内容;按引文速度追踪新兴主题
  • 开发人员构建研究工具 -通过REST API、Python/JS客户端或用于AI代理集成的MCP对学术文献进行编程访问

特性

  • 3种刮擦模式: 关键字搜索、按ID查找论文、引文图遍历
  • 批量搜索: 在一个作业中运行多个查询--结果按纸张ID进行合并和重复数据消除
  • 语义学者发表2.26亿篇论文 --涵盖所有学术领域,具有引用指标和人工智能生成的TLD
  • 通过arXiv预印本超过240万张 --全开放存取,最适合物理、计算机科学、数学和邻近领域
  • 过滤器: 出版年份范围、研究领域、仅开放获取、arXiv类别
  • 引文图: 获取引用某一作品的所有论文,或任何论文的完整参考文献列表
  • 人工智能总结(TLDR): 一句话人工智能为约40%的语义学者论文生成了摘要
  • 开放访问链接: 直接PDF URL(如果可用)
  • 不需要API密钥 --针对公共API的开箱即用
  • 无代理成本 -基于API,无浏览器渲染,无机器人程序检测问题

______________________________________________________________________

报废模式

模式1:按关键字搜索

{
    "mode": "search",
    "query": "transformer attention mechanism",
    "yearFrom": 2020,
    "openAccessOnly": true,
    "maxResults": 50
}

模式1b:批量搜索(v1.1.0)

在单个作业中运行多个查询--在所有查询中对结果进行合并和重复数据消除:

{
    "mode": "search",
    "queriesList": ["CRISPR gene editing", "base editing", "prime editing"],
    "yearFrom": 2022,
    "fieldsOfStudy": ["Biology"],
    "maxResults": 150
}

queriesList 覆盖 query 如果提供。非常适合系统评价、竞争格局分析和多主题监测。

模式2:通过ID获取纸张

通过DOI、arXiv ID、PubMed ID或Semantic Scholar ID查找任何论文。参与者会自动检测ID类型。

{
    "mode": "get_paper",
    "query": "10.48550/arXiv.1706.03762"
}

接受的ID格式: 10.1234/... (DOI), 2301.12345 (arXiv), PMID:12345678 (PubMed),40字符十六进制(语义学者)。

模式3:引文图

获取引用给定论文的所有论文(citing),或它引用的所有论文(cited_by):

{
    "mode": "citations",
    "query": "1706.03762",
    "citationDirection": "citing",
    "yearFrom": 2023,
    "maxResults": 100
}

模式1c:arXiv类别搜索

{
    "mode": "search",
    "query": "large language models",
    "source": "arxiv",
    "arxivCategories": ["cs.AI", "cs.CL"],
    "sortBy": "date",
    "maxResults": 50
}

______________________________________________________________________

输入参数

参数类型默认值说明
mode字符串searchsearch, get_paper,或 citations
querystring必填关键字(搜索模式)或论文ID(获取/引用模式)
queriesListstring\[\][]多个搜索查询--合并和重复数据消除。覆盖 query。仅搜索模式。
source字符串autoauto, semantic_scholar,或 arxiv
citationDirection字符串citingciting (由谁引用)或 cited_by (其参考文献)。仅引用模式。
yearFrominteger--筛选器:今年或之后发布
yearTointeger--筛选器:今年或之前发布
fieldsOfStudystring\[\][]按字段筛选: Computer Science, Medicine, Physics, Biology等等。(仅S2)
openAccessOnly布尔值false仅提供带免费PDF的退回文件
arxivCategoriesstring\[\][]按arXiv类别筛选: cs.AI, cs.LG, q-bio.NC等等。(仅限arXiv来源)
maxResults整数100最多可退回的纸张数量(1-500)。免费等级上限为25。
includeAbstract布尔值true在输出中包含完整摘要
includeTldr布尔值true包括人工智能生成的摘要(仅S2)
includeCitationCounts布尔值true包括引文、参考文献和有影响力的引文计数
sortBy字符串relevancerelevancedate (最新优先)
requestIntervalSecs编号3.0API请求之间的秒数(0.5–10)

______________________________________________________________________

输出

结果将保存到默认数据集。从“输出”选项卡下载JSON、CSV、Excel或XML格式。

纸场

字段类型描述
titlestring论文标题
authorsstring\[\]作者姓名
yearinteger出版年份
publication_datestring完整日期(YYYY-MM-DD)
venuestring会议或期刊名称
journalstring带有卷号和页码的日记
abstractstring完整摘要文本
tldrstringAI生成一句话摘要(仅S2,~40%覆盖率)
doistring数字对象标识符
arxiv_idstringarXiv预印本ID
pubmed_idstringPubMed ID
semantic_scholar_idstring语义学者论文ID
corpus_idinteger语义学者语料库ID
fields_of_studystring\[\]学术领域(例如。 Computer Science, Medicine)
publication_typesstring\[\]类型: JournalArticle, Conference, Preprint等等。
citation_countinteger收到的引用总数
reference_countinteger论文中的参考文献数量
influential_citation_countinteger对引用论文有重大影响的引用
is_open_accessboolean是否有免费的全文PDF
open_access_pdf_urlstring直接PDF链接(如果可用)
external_urlsobject指向语义学者、arXiv、DOI解析器的链接
sourcestring哪个API提供了此结果: semantic_scholararxiv
scraped_atstringISO 8601 UTC时间戳

输出示例

{
    "schema_version": "1.0",
    "type": "academic_paper",
    "title": "Attention is All you Need",
    "authors": ["Ashish Vaswani", "Noam Shazeer", "Niki Parmar", "Jakob Uszkoreit"],
    "year": 2017,
    "publication_date": "2017-06-12",
    "venue": "Neural Information Processing Systems",
    "journal": "",
    "abstract": "The dominant sequence transduction models are based on complex recurrent or convolutional neural networks...",
    "tldr": "A new simple network architecture, the Transformer, based solely on attention mechanisms, dispensing with recurrence and convolutions entirely.",
    "doi": "10.48550/arXiv.1706.03762",
    "arxiv_id": "1706.03762",
    "pubmed_id": "",
    "semantic_scholar_id": "204e3073870fae3d05bcbc2f6a8e263d9b72e776",
    "corpus_id": 13756489,
    "fields_of_study": ["Computer Science"],
    "publication_types": ["JournalArticle", "Conference"],
    "citation_count": 140000,
    "reference_count": 41,
    "influential_citation_count": 12000,
    "is_open_access": true,
    "open_access_pdf_url": "https://arxiv.org/pdf/1706.03762",
    "external_urls": {
        "semantic_scholar": "https://www.semanticscholar.org/paper/204e3073870fae3d05bcbc2f6a8e263d9b72e776",
        "doi_url": "https://doi.org/10.48550/arXiv.1706.03762",
        "arxiv_abs": "https://arxiv.org/abs/1706.03762",
        "arxiv_pdf": "https://arxiv.org/pdf/1706.03762"
    },
    "source": "semantic_scholar",
    "scraped_at": "2025-03-01T12:00:00+00:00"
}

______________________________________________________________________

数据源

语义学者(默认)

  • 2.26亿篇论文 横跨各个学术领域
  • 引用次数、参考次数和 有影响力的引文计数
  • 人工智能生成的TLDR摘要 约40%的论文
  • 接受DOI、arXiv ID、PubMed ID和语义学者ID进行直接查找
  • 速率限制:无API密钥时为1 req/sec(内置符合性)

arXiv

  • 240万+预印本 物理、数学、计算机科学、定量生物学、金融、统计学和工程学
  • 所有论文均可通过直接PDF链接公开访问
  • 最适合在同行评审之前找到最新的预印本
  • 类别筛选: cs.AI, cs.LG, physics.hep-th, q-bio.NC等等。
  • 无引用数据(使用Semantic Scholar获取引用指标)

何时使用每个: 使用 auto (默认)。当您指定时,它会选择Semantic Scholar进行一般查询,并选择arXiv arxivCategories.覆盖到 arxiv 当您需要预打印或特定类别的过滤时,可以明确地进行过滤。

______________________________________________________________________

成本

此演员使用 按事件付费(PPE)定价 --你只为你得到的结果付费。

  • 每1000个结果0.50美元 (每篇0.0005美元)
  • 无代理成本 -基于API,无需浏览器,无需住宅代理
  • 免费等级:每次运行25个结果 --无需订阅
  • 付费级别:每次运行最多500个结果

典型运行:100篇论文大约需要10秒。成本: $0.05.

______________________________________________________________________

MCP集成

此参与者通过Apify的托管MCP服务器作为MCP工具工作。AI代理可以直接查询学术文献,无需自定义服务器设置。

  • 端点: https://mcp.apify.com?tools=labrat011/academic-paper-scraper
  • 认证: Authorization: Bearer
  • 运输: 流式HTTP
  • 适用于: Claude桌面,光标,VS代码,Windsurf,Warp,Gemini CLI

Claude桌面/光标配置:

{
    "mcpServers": {
        "academic-paper-scraper": {
            "url": "https://mcp.apify.com?tools=labrat011/academic-paper-scraper",
            "headers": {
                "Authorization": "Bearer "
            }
        }
    }
}

代理提示示例:

  • “查找自2021年以来发表的关于CRISPR碱基编辑的20篇被引用最多的论文”
  • “搜索关于‘检索增强生成’和‘知识图’的论文——合并结果”
  • “查阅DOI 10.1038/s41586-021-03819-2的论文,并总结其主要发现”
  • “哪些论文引用了‘注意力是你所需要的一切’?让我看看2023年以后引用次数排名前30位的论文”
  • 在arXiv中搜索最近关于指令调优的cs.AI和cs.CL论文,按日期排序
  • “收集2020年至2024年关于mRNA疫苗疗效的所有开放获取论文进行文献综述”

______________________________________________________________________

技术细节

  • Python 3.12,异步 httpx.AsyncClient
  • 语义学者图API v1(无需证书)
  • 带有XML解析的arXiv Atom API(xml.etree.ElementTree)
  • 自动纸张ID检测:DOI、arXiv ID、PubMed ID、语料库ID、S2 ID
  • 带可配置速率限制的分页取数
  • 批量推送(25个项目)以提高内存效率
  • Apify平台迁移中可恢复运行的状态持久性

______________________________________________________________________

局限性

  • S2速率限制 可能会减缓大型请求。scraper遵守1个请求/秒的限制,但Semantic Scholar可能会在高峰时段进行限制——内置的指数回退重试功能可以处理这一点。
  • arXiv没有引用数据。 引文计数、参考计数和TLDR摘要仅可从Semantic Scholar获得。
  • TLDR覆盖率约为40%。 不适用于Semantic Scholar中的所有论文。
  • arXiv上的年份过滤是客户端 -arXiv的API不支持原生年份范围,因此scraper在本地获取额外的页面和过滤器。
  • 每次运行最多500个结果 -Semantic Scholar的API对未经验证的批量访问施加了实际限制。
  • get_papercitations 模式需要单个查询 --批量通过 queriesList 仅适用于搜索模式。

______________________________________________________________________

常见问题解答

我应该使用哪个来源?

使用 auto (默认设置)。设置时,它会选择Semantic Scholar进行一般搜索,并选择arXiv arxivCategories.覆盖到 arxiv 仅当您需要预印本或arXiv特定类别过滤时。

批量搜索是如何工作的?

queriesList 到一系列搜索词。参与者按顺序运行每个查询,并将结果合并到一个数据集中,删除语义学者论文ID、arXiv ID、DOI或标题匹配的重复项。这是系统评价(一次运行所有PICO术语)和研究监测(在计划的每日运行中跟踪多个主题)的推荐方法。

我可以按作者搜索吗?

是--在查询中包含作者姓名: "Yann LeCun deep learning"语义学者的相关性排名考虑了作者姓名。要进行精确的作者搜索,请在引号中添加姓名: "\"Yoshua Bengio\" neural networks".

我如何查找特定的论文?

使用 get_paper 具有任何标识符的模式:DOI(10.1038/...),arXiv ID(2301.12345),PubMed ID(PMID:12345678),或语义学者ID(40个字符十六进制)。演员会自动检测格式。

有什么区别 citingcited_by?

  • citing --返回以下文件 引用 你的目标(后来谁引用了它)
  • cited_by --返回您的目标文件 引用 (自己的参考书目)

使用 citing 寻找后续工作并衡量影响。使用 cited_by 追溯一篇论文的思想渊源。

我可以将其与Apify API一起使用吗?

对。通过Apify REST API调用参与者,轮询结果,并以JSON、CSV、Excel或XML下载。适用于Apify Python和JavaScript客户端库。

______________________________________________________________________

反馈

发现错误或有功能请求?在Apify控制台的“问题”选项卡上打开问题。

目录标签

目录标签

PythonClaude批量处理云端部署学术搜索论文抓取AI摘要开放获取

支持客户端

ClaudeWindsurf

接入字段

传输方式(transport,传输协议)

未说明

鉴权方式(authType,认证方式)

token

工具数量(toolCount,工具数)

0

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

未说明token部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

仍需确认:installCommand

来源信息

继续浏览同类 MCP