参考模型
scpr 是一个简单直接的网络抓取CLI工具,用于抓取页面作为markdown内容,并开发用于人类和编码代理(无论是作为 MCP服务器 或作为a 技能).
安装
使用Go安装(需要v1.24+):
go install github.com/AstraBert/scpr使用NPM安装:
npm install @cle-does-things/scprWindows安装的额外说明
如果您使用的是Windows, scpr 全局安装后可能无法立即使用 npm。在这种情况下,您可能需要采取额外的步骤:
- 查找
node可执行文件存储在您的计算机上:
Get-Command node这将打印目录,其中 node.exe 存储: scpr 将安装在 .\bin\scpr.exe 在该文件夹中。
\[!注意\] _如果您正在使用nvm对于Windows,node.exe将在C:\Users\nvm4w\nodejs_
- 添加
{NODE_FOLDER}\bin(如果是nvm:C:\Users\nvm4w\nodejs\bin)PATH环境变量。跟随 本指南 有关如何设置PATH环境变量的说明。 - 重新启动计算机
- 测试
scpr --help从您的终端。执行可能会受到防病毒软件的挑战,但是,由于可执行文件不包含任何有害代码,防病毒软件最终会允许它执行
用法
作为CLI工具
基本用法(抓取一页):
scpr --url https://example.com --output ./scraped这将抓取页面并将其另存为markdown文件 ./scraped 文件夹。
递归刮擦
要抓取同一域内的页面和所有链接页面,请执行以下操作:
scpr --url https://example.com --output ./scraped --recursive --allowed example.com --max 3平行刮擦
使用多线程加速递归抓取:
scpr --url https://example.com --output ./scraped --recursive --allowed example.com --max 2 --parallel 5附加选项
--log-设置日志记录级别(信息、调试、警告、错误)--max-要跟踪的最大页面深度(默认值:1)--parallel-并发线程数(默认值:1)--allowed-允许递归抓取的域(可以多次指定)
有关更多详细信息,请运行:
scpr --help作为stdio MCP服务器
使用以下命令启动MCP服务器:
scpr mcp并使用以下方式在代理中配置它:
{
"mcpServers": {
"web-scraping": {
"type": "stdio",
"command": "scpr",
"args": [
"mcp"
],
"env": {}
}
}
}_上面的JSON片段被报告为Claude Code使用的,在使用之前请将其调整到您的代理_
贡献
欢迎投稿!请阅读 贡献指南 开始吧。
许可证
该项目根据 MIT许可证
