mcp服务器抓取器
](https://www.npmjs.com/package/mcp-server-scraper) ](https://www.npmjs.com/package/mcp-server-scraper)   
从任何URL提取干净、可读的内容。返回标记文本、链接和元数据。没有API密钥,没有配置。用于抓取文档、博客和文章的Firecrawl的免费替代品。
npx mcp-server-scraper适用于Claude Desktop、Cursor、VS Code Copilot和任何MCP客户端。不需要帐户或API密钥。
MCP server for web scraping, content extraction, and URL metadata
使用构建的演示 远程自述工具包
为什么
当你使用人工智能助手,需要引用文档页面、博客文章或API引用时,你通常会手动复制内容。像Firecrawl这样的工具解决了这个问题,但需要付费的API密钥。这个服务器免费做同样的事情。它获取一个URL,通过Mozilla Readability(Firefox Reader View背后的同一引擎)运行它,并返回干净的标记。它适用于服务器呈现的内容,如文档网站、博客文章和文章。它不会处理JavaScript繁重的SPA,但对于最常见的用例“阅读此文档页面并对其进行总结”,它可以完成这项工作。
工具
| 工具 | 它做什么 |
|---|---|
scrape_url | 从URL中提取干净的文本内容(可读性驱动) |
extract_links | 获取所有带有href和锚文本的链接 |
extract_metadata | 获取标题、描述、OG标签、规范、favicon |
search_page | 在页面中搜索查询字符串,返回匹配的行 |
scrape_multiple | 批量抓取多个URL,每个URL获取标题+摘录 |
快速开始
光标
添加 .cursor/mcp.json:
{
"mcpServers": {
"scraper": {
"command": "npx",
"args": ["-y", "mcp-server-scraper"]
}
}
}克劳德桌面版
添加 claude_desktop_config.json:
{
"mcpServers": {
"scraper": {
"command": "npx",
"args": ["-y", "mcp-server-scraper"]
}
}
}VS Code
添加到MCP设置中(例如。 .vscode/mcp.json):
{
"mcp": {
"servers": {
"scraper": {
"command": "npx",
"args": ["-y", "mcp-server-scraper"]
}
}
}
}例子
- “从中抓取API文档https://docs.example.com并对其进行总结”
- “提取此页面的所有链接”
- “此URL的OG图像和描述是什么?”
- “在此页面上搜索“身份验证”的提及”
- “删除这5个网址,并给我每个网址的摘要”
运作原理
发展
npm install
npm run typecheck
npm run build
npm test另见
更多MCP服务器和开发工具 投资组合.
作者

 ](https://github.com/ofershap)
______________________________________________________________________
README构建于 README生成器
