淘宝刮板MCP服务器
用于从中抓取产品数据的MCP(模型上下文协议)服务器 淘宝/天猫 和 京东 (京东)。提供8个工具,可以直接在Claude Desktop或Claude Code中使用。
平台:Windows(需要Chrome浏览器) 语言:Python 3.10+
特性
- 多平台刮擦 -淘宝、天猫、京东合一工具
- 8个MCP工具 -报废、任务管理、通知、系统控制
- 热门搜索词 -发现热门关键词和市场洞察
- Excel导出 -自动将结果另存为
.xlsx文件 - 通知推送 -微信(ServerChan/PushPlus)和电子邮件提醒
- 双重运输 -stdio(本地)和SSE(远程)协议
- 三语言图形用户界面 -中文/英文/韩文界面(可选)
建筑
Claude Desktop / Claude Code
|
MCP Server (stdio or SSE)
|
FastAPI Backend (:8000)
|
Selenium + Chrome (:9222)快速开始
1.先决条件
- Python 3.10+
- 谷歌Chrome浏览器
- Windows操作系统
2.安装
git clone https://github.com/jhongjun1981/taobao-scraper-mcp.git
cd taobao-scraper-mcp
# Install MCP server dependencies
pip install -r requirements_mcp.txt
# Install API backend dependencies
pip install -r requirements_api.txt3.配置
cp .env.example .env
# Edit .env to set your SCRAPER_API_KEY4.使用调试端口启动Chrome
# Close all Chrome instances first, then:
START_GUI.bat
# Or manually:
chrome.exe --remote-debugging-port=9222 --user-data-dir="%LOCALAPPDATA%\Google\Chrome\Debug Profile"5.登录淘宝(仅限第一次)
打开Chrome浏览器,登录您的淘宝账户。Cookie将保留在调试配置文件中。
6.启动API后端
python run_api.py7.配置MCP服务器
克劳德代码 -添加到 .claude/settings.json:
{
"mcpServers": {
"taobao-scraper": {
"command": "python",
"args": ["run_mcp.py"],
"cwd": "/path/to/taobao-scraper-mcp"
}
}
}适用于克劳德桌面 -添加到 claude_desktop_config.json:
{
"mcpServers": {
"taobao-scraper": {
"command": "python",
"args": ["run_mcp.py"],
"cwd": "C:\\path\\to\\taobao-scraper-mcp"
}
}
}SSE模式(远程):
python run_mcp.py --transport sse --port 8001{
"mcpServers": {
"taobao-scraper": {
"type": "sse",
"url": "http://your-server:8001/sse"
}
}
}工具参考
报废工具
scrape_products
从电子商务平台上抓取产品数据。
| 参数 | 类型 | 默认值 | 说明 |
|---|---|---|---|
keyword | 字符串 | *必需的* | 搜索关键字 |
platform | 字符串 | "taobao" | "taobao" / "jd" / "multi" |
pages | int | 3 | 要抓取的页数 |
sort_by | 字符串 | "sale" | 排序方法 |
tmall_only bool的。 false | 仅限天猫产品 | ||
exact_match bool的。 false | 关键字完全匹配 | ||
price_min | 浮子 | 0 | 最小价格过滤器 |
price_max | 浮子 | 0 | 最高价格过滤器 |
wait_for_result bool的。 true | 等待完成 | ||
timeout | int | 300 | 超时时间(秒) |
示例:“从淘宝和京东上报废跑鞋”
scrape_hotwords
删除趋势/相关搜索关键字以进行市场分析。
| 参数 | 类型 | 默认值 | 说明 |
|---|---|---|---|
keyword | 字符串 | *必需的* | 基本关键字 |
wait_for_result bool的。 true | 等待完成 | ||
timeout | int | 120 | 超时时间(秒) |
任务管理工具
list_tasks
列出最近的抓取任务及其状态(待定/正在运行/已完成/失败)。
| 参数 | 类型 | 默认值 | 说明 |
|---|---|---|---|
limit | int | 20 | 要返回的最大任务数 |
get_task
获取特定任务的详细状态。集 include_result=true 以获得完整的结果。
| 参数 | 类型 | 默认值 | 说明 |
|---|---|---|---|
task_id | 字符串 | *必需的* | 任务ID |
include_result bool的。 false | 包括结果数据 |
cancel_task
取消正在运行或挂起的任务。
| 参数 | 类型 | 默认值 | 说明 |
|---|---|---|---|
task_id | 字符串 | *必需的* | 要取消的任务ID |
导出工具
list_files
列出所有导出的Excel数据文件,包括文件名、大小和修改时间。
通知工具
send_notification
通过微信或电子邮件发送推送通知。
| 参数 | 类型 | 默认值 | 说明 |
|---|---|---|---|
channel | 字符串 | *必需的* | "wechat" / "email" / "test" |
title | 字符串 | "" | 通知标题 |
content | 字符串 | "" | 通知正文 |
wx_type | 字符串 | "server_chan" | "server_chan" 或 "pushplus" |
系统工具
system_status
检查系统运行状况或重新启动Chrome。
| 参数 | 类型 | 默认值 | 说明 |
|---|---|---|---|
action | 字符串 | "check" | "check" 或 "restart_chrome" |
环境变量
| 变量 | 默认值 | 描述 |
|---|---|---|
SCRAPER_API_KEY | changeme-your-secret-key | API身份验证密钥 |
SCRAPER_API_URL | http://localhost:8000 | FastAPI后端URL |
SCRAPER_CHROME_PORT | 9222 | Chrome调试端口 |
MCP_SSE_HOST | 0.0.0.0 | SSE监听地址 |
MCP_SSE_PORT | 8001 | SSE监听端口 |
MCP_HTTP_TIMEOUT | 30 | HTTP请求超时 |
数据输出
报废数据会自动保存为Excel文件,其中包含:
- 产品名称、图片URL、价格
- 月销售量、回顾数
- 店铺名称、店铺类型、店铺区域
- 产品URL,抓取时间戳
重要提示
- 淘宝需要登录 -您必须先在Chrome中登录自己的淘宝帐户
- 京东无需登录即可工作 -JD抓取不需要身份验证
- 一次一个任务 -Chrome只能同时处理一个抓取任务
- 仅限Windows -Chrome自动化层使用Windows特定的API
- 遵守费率限制 -过度刮擦可能会触发反机器人保护
许可证
MIT许可证-请参阅 许可证 文件。
