Token导航 LogoToken导航TokenDH.com
Open Crawler MCP Server logo
安全风控未说明官方级别未说明来源级核验

Open Crawler MCP Server

MCP Server

Open Crawler MCP Server 是一个用于网页爬取和内容提取的服务器,支持多种输出格式(文本、Markdown、XML、JSON),并具备智能内容提取、robots.txt 合规性和速率限制等功能。

工具数

2

提示词数

0

GitHub Stars

1

资源数

0
网页爬取TypeScript内容提取

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

elchika-inc

提供方

elchika-inc

最后核验

2026/5/17 20:22

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

详细介绍

打开爬网程序MCP服务器

![license](https://github.com/elchika-inc/open-crawler-mcp-server/blob/main/LICENSE) ](https://www.npmjs.com/package/open-crawler-mcp-server) ](https://www.npmjs.com/package/open-crawler-mcp-server) ](https://github.com/elchika-inc/open-crawler-mcp-server)

一种模型上下文协议(MCP)服务器,用于从具有多种输出格式的网页中抓取和提取内容。

特性

  • 多种输出格式:将内容提取为文本、markdown、结构化XML或JSON
  • 智能内容提取:CSS选择器支持目标内容提取
  • Robots.txt合规性:自动robots.txt检查和合规性
  • 速率限制:内置速率限制(请求之间至少1秒)
  • 尺寸保护:最大页面大小限制(10MB),以防止内存问题
  • 结构化内容:分别提取标题、段落、链接、图像和列表
  • 错误处理:不同故障场景的综合错误代码

MCP客户端配置

将此服务器添加到MCP客户端配置中:

{
  "mcpServers": {
    "open-crawler": {
      "command": "npx",
      "args": ["@elchika-inc/open-crawler-mcp-server"]
    }
  }
}

可用工具

crawl_page

通过自动robots.txt合规性检查以多种格式从网页中提取内容。

参数:

  • url (必需):要爬网的目标URL
  • selector (可选):用于特定内容提取的CSS选择器
  • format (可选):输出格式- text, markdown, xml,或 json (默认值: text)
  • text_only (可选):用于纯文本提取的传统参数(已弃用,请使用 format 相反)

输出格式:

  • text:干净、纯文本内容,空白已规范化
  • markdown:格式良好的Markdown,保留了标题、链接、图像和列表
  • xml:结构化XML,标题、段落、链接、图像和列表有单独的部分
  • json:包含分类内容元素的结构化JSON对象

示例:

基本文本提取:

{
  "name": "crawl_page",
  "arguments": {
    "url": "https://example.com",
    "format": "text"
  }
}

使用CSS选择器提取Markdown:

{
  "name": "crawl_page",
  "arguments": {
    "url": "https://example.com",
    "selector": "article",
    "format": "markdown"
  }
}

结构化JSON提取:

{
  "name": "crawl_page",
  "arguments": {
    "url": "https://example.com",
    "format": "json"
  }
}

check_robots

验证是否允许根据网站的robots.txt文件抓取URL。

参数:

  • url (必填):用于检查爬网权限的URL

例子:

{
  "name": "check_robots",
  "arguments": {
    "url": "https://example.com/page"
  }
}

错误处理

常见错误场景:

  • 网络连接问题
  • HTML无效或缺少内容
  • Robots.txt限制
  • 请求超时或速率限制
  • 内容大小太大(>10MB)

许可证

麻省理工学院

目录标签

目录标签

网页爬取TypeScript内容提取本地部署多格式输出robots.txt合规速率限制

接入字段

传输方式(transport,传输协议)

未说明

鉴权方式(authType,认证方式)

none

工具数量(toolCount,工具数)

2

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

未说明none部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

仍需确认:installCommand

来源信息

继续浏览同类 MCP