MCP服务器刮刀入门
此项目允许您抓取和提取 MCP网络服务器 从 glama.ai。按照以下步骤高效地设置和运行刮板。
📦 先决条件
- Node.js
- npm
🔧 安装
- 克隆存储库:
git clone https://github.com/Neche-Stephen/mcp_web_scrapper
cd mcp_web_scrapper- 安装依赖项:
npm install______________________________________________________________________
🗃 检查现有数据
在进行新的刮除之前:
- 检查是否
servers-json文件夹 存在.
- 如果它包含文件,则意味着数据之前已被抓取。
- 为了运行新批次, 删除 这
servers-json文件夹:
rm -rf servers-json______________________________________________________________________
步骤1:删除MCP服务器链接
运行scraper从网站收集所有MCP服务器链接:
node scraper.js- scraper将启动一个无头浏览器并开始收集数据。
- 请耐心等待,这可能需要几分钟的时间。
- 一旦你看到消息 “关闭浏览器”,刮擦完成。
- 然后,您可以使用以下命令安全地终止该进程
CTRL + C.
输出:一个名为的文件server-links.json将在文件夹中生成servers-json包含所有抓取的链接。
______________________________________________________________________
步骤2:处理和提取服务器数据
现在,从每个服务器链接获取并处理详细信息:
node process-links.js- 脚本读自
server-links.json并访问每个链接以抓取必要的数据。 - 脚本运行时,终端中将显示进度报告。
- 当您看到指示完成的成功消息时,按
CTRL + C以终止该过程。
所有抓取的数据都将存储在 servers-json 以mcp服务器命名的不同文件中的目录
