Web抓取MCP服务器
Web刻划页面MCP服务器。正常HTML页面和JavaScript/SPA/React同时支持站点。
机能
📄 fetch_page_content
正常HTML从页面获取内容。又快又轻。
特徴:
- 简单的HTTP请求
- BeautifulSoup根据HTML分析
- 自动排除页眉、页脚和导航
- 自动检测主内容
使用例:
「https://example.com/article のページ内容を取得して」🎭 fetch_page_content_与剧作家合作
JavaScript/SPA/React从站点获取内容。对应于动态渲染的页面。
特徴:
- Playwright使用实际浏览器渲染
- JavaScript执行后的内容获取
- Shadow DOM対応
- 自动处理隐私同意对话框
- 自动提取邮件和电话号码
使用例:
「https://example.com/spa-page のページ内容をPlaywrightで取得して」🗺️ extract_site_links
从官方网站header/footer/nav的链接,并创建虚拟站点地图。
特徴:
- 从页眉、页脚和导航中提取链接
- 自动删除重复阵列
- 自动获取每页标题(h2/h3)
- 仅适用于同一域中的链接
使用例:
「https://example.com のサイト構造を教えて」🗺️ 提取器_网站链接_带剧作家
JavaScript/SPA/React从站点动态提取链接。
使用例:
「https://example.com のサイトマップをPlaywrightで取得して」安装
🚀 1命令安装(推荐)
⚠️ 重要: Windows用户一定PowerShell来修改标记元素的显示属性。curl命令是Windows中描述的场景,使用以下步骤创建明细表,以便在概念设计中分析体量的体积。macOS/Linux
curl -fsSL https://raw.githubusercontent.com/Readify-App/scraping-mcp-server/main/install.sh | bashWindows(PowerShell)
PowerShell的双曲正切值请执行以下命令:
irm https://raw.githubusercontent.com/Readify-App/scraping-mcp-server/main/install.ps1 | iex注意: - Windows那么curl命令不可用。上述的PowerShell命令(irm),模板名称将采用不同的格式。 -irm啊PowerShell 3.0以后可用(Windows8以后标准可用)。 - 如果irm如果无法使用,请使用以下替代命令: ``powershell Invoke-WebRequest -Uri https://raw.githubusercontent.com/Readify-App/scraping-mcp-server/main/install.ps1 -UseBasicParsing | Invoke-Expression``
安装后Claude Desktop重新启动来修改标记元素的显示属性。
🔧 手动安装
手動インストール手順を表示
1.克隆存储库
git clone https://github.com/Readify-App/scraping-mcp-server.git
cd scraping-mcp-server2. uv安装依赖关系
uv sync3. Playwright安装浏览器
uv run playwright install chromium4. Claude Desktop编辑配置文件
macOS:
nano ~/Library/Application\ Support/Claude/claude_desktop_config.jsonLinux:
nano ~/.config/claude-desktop/claude_desktop_config.json窗户:
notepad %APPDATA%\Claude\claude_desktop_config.json添加以下内容(/path/to/scraping-mcp-server替换为实际路径):
{
"mcpServers": {
"scraping-mcp-server": {
"command": "uv",
"args": [
"--directory",
"/path/to/scraping-mcp-server",
"run",
"scraping-mcp-server"
]
}
}
}5. Claude Desktop重新启动
用法
Claude Desktop请提问:
📄 正常HTML获取页面
「https://example.com/article のページ内容を取得して」🎭 JavaScript/SPA获取页面
「https://example.com/spa-page のページ内容をPlaywrightで取得して」🗺️ 分析站点结构
「https://example.com のサイト構造を教えて」工具选择指南
工具|用途|例| |--------|------|-----| | fetch_page_content 安静的HTML页面|博客文章、新闻网站、Wikipedia按钮关闭对话框 | fetch_page_content_与剧作家合作 动态页面React/Vue/Angular制的SPA、具有验证对话框的页面 | extract_site_links |静态网站结构分析|企业网站、官方网站导航| | 提取器_网站链接_带剧作家 动态站点结构分析SPA导航,动态菜单
故障排除
❌ Playwright挂怀
# ブラウザを再インストール
uv run playwright install --force chromium
# システムの依存関係を確認(Linux)
uv run playwright install-deps📝 检查日志
# インストールディレクトリで
tail -f debug.log🔄 重置设置
请重新运行安装脚本:
⚠️ 重要: Windows用户一定PowerShell来修改标记元素的显示属性。
macOS/Linux:
curl -fsSL https://raw.githubusercontent.com/Readify-App/scraping-mcp-server/main/install.sh | bashWindows(PowerShell):
irm https://raw.githubusercontent.com/Readify-App/scraping-mcp-server/main/install.ps1 | iex制限事项
- ⚠️ PDF不支持文件
- ⚠️ 不支持需要登录的页面
- ⚠️ 同时刻划多页有限制(最多5个浏览器)
许可证
麻省理工学院
开发人员信息
文件配置
scraping-mcp-server/
├── .gitignore # 固定(ログファイル除外)
├── pyproject.toml # 固定(パッケージ設定)
├── server.py # ツール定義(メインロジック)
├── main.py # 固定(エントリーポイント)
├── install.sh # macOS/Linux自動インストーラー
├── install.ps1 # Windows自動インストーラー
└── uv.lock # 自動生成本地开发
# 依存関係のインストール
uv sync
# サーバーをテスト実行
uv run scraping-mcp-server
# Playwrightブラウザのインストール
uv run playwright install chromium