mcp通用爬虫
MCP服务器,将Futuremedia爬行逻辑作为助手的工具公开。
它的作用
- 从Futurepedia搜索API获取随机人工智能工具
- 打开工具详细信息页面
- 提取结构化字段(描述、是什么、关键特征、优缺点、用户、图像)
- 返回干净的JSON供下游助手使用
MCP工具
未来媒体特定:
futurepedia_random_tool()--获取一个带有解析元数据的随机工具futurepedia_tools(count=3)--在一次调用中获取多个随机工具
通用爬虫:
crawl_url(url, timeout_sec=30)--解析通用网页(文本+标题+链接)crawl_many(urls, timeout_sec=30)--批量抓取最多20个URLcrawl_sitemap(sitemap_url, limit=20, timeout_sec=30)--从sitemap.xml中提取URLcrawl_file(source, timeout_sec=30)--解析本地/远程txt/md/html/pdf/docxextract_structured(url, schema_json, timeout_sec=30)--按模式提取CSS选择器
快速开始
python -m venv .venv
source .venv/bin/activate
pip install -e .
python -m universal_crawler_mcp.server服务器通过stdio(默认MCP模式)运行。
克劳德桌面/MCP客户端配置
{
"mcpServers": {
"universal-crawler": {
"command": "python",
"args": ["-m", "universal_crawler_mcp.server"],
"cwd": "/absolute/path/to/mcp-universal-crawler"
}
}
}环境
可选:
PROXY_URL--用于HTTP请求的代理URL
备注
爬虫逻辑改编自 litvan007/AI-slop-tg (src/futurepedia.py)并包装以供MCP使用。
