无刮擦MCP服务器
欢迎访问官方无刮取模型上下文协议(MCP)服务器 ——一个强大的集成层,使大型语言模型(LLMs)、人工智能代理(AI Agents)和人工智能应用能够实时与网络进行交互。
基于开放的MCP(机器学习平台/中间件通信协议等,具体含义需根据上下文确定)标准,Scrapeless MCP服务器能够无缝连接各种模型,如 ChatGPT, 克劳德,以及诸如……之类的工具 光标 和 风帆冲浪 涵盖广泛的外部能力,包括:
- 谷歌服务集成 (搜索,趋势)
- 浏览器自动化 用于页面级别的导航和交互
- 刮擦;铲除 动态、JavaScript 密集型网站——导出为 HTML、Markdown 或截图
无论你是在构建一个AI研究助手、一个代码协作者,还是自主网页代理,这台服务器都能为你提供工作流程所需的动态上下文和真实世界的数据——没有被屏蔽.
使用示例
- 使用Claude实现网页自动化交互与数据提取
使用无刮取MCP浏览器,克劳德可以通过对话指令执行复杂的任务,如网页导航、点击、滚动和数据抓取,并能实时预览网页交互结果 live sessions。
- 绕过Cloudflare以获取目标页面内容
使用无刮取MCP浏览器服务,可以自动访问Cloudflare页面,处理完成后,提取页面内容并以Markdown格式返回。
- 提取动态渲染的页面内容并写入文件
使用Scrapeless MCP通用API,抓取上述目标页面的JavaScript渲染内容,以Markdown格式导出,并最终写入名为(文件名)的本地文件中 text.md。
- 自动化搜索引擎结果页面(SERP)抓取
使用无刮取MCP服务器,在谷歌搜索中查询关键词“网络爬虫”,获取前10个搜索结果(包括标题、链接和摘要),并将内容写入名为 serp.text。
以下是一些使用这些服务器的额外示例:
| 示例 | | --------------------------------------------------------------------------------------------------------------------------------- | 通过谷歌搜索查找无刮削(或:无需刮取)的内容。 | 查找过去一年中“AI”的搜索兴趣。 (此行无实际内容,若需翻译前文,则“|”在此上下文中无实际意义,不作翻译处理) | 使用浏览器访问 chatgpt.com(注:此为网址,直接翻译为中文无实际意义,但可表述为“ChatGPT的官方网站”或保持原样作为网址使用)搜索“今天天气怎么样?”,并总结搜索结果。 | | 抓取HTML内容 scrapeless.com 可以翻译为“无刮取网站”或根据具体语境简化为“防刮取网站”,但通常直接保留原域名以体现其专有性和品牌识别度。在中文语境下,我们可能更多地会直接提及这个域名,而不一定需要翻译,除非是在解释其含义时。因此,一个较为通用的表述是“scrapeless.com(无刮取网站/防刮取网站)” 页面。 | | 抓取Markdown内容 scrapeless.com 翻译为中文可以是“无刮取(或无抓取)网站”。不过,这个翻译比较直译,具体翻译可能还需要根据该网站的实际内容和功能来调整,以更准确地传达其含义。如果“scrapeless”指的是该网站不进行数据抓取或爬取的行为,那么上述翻译是合适的 页面。 | | 获取截图的 scrapeless.com 翻译为中文可以是“无刮取(或防抓取)网站.com”,但通常我们不会直接翻译网址,而是保留原样或根据上下文简要说明其含义。在这里,如果要简洁地表达其含义,可以说明为“一个强调防网页抓取的网站”。不过,直接提及网址时,一般还是保持原样(这个句子本身是空的,没有实际内容,所以无法提供具体的翻译。如果这是一个占位符或者示意,可以理解为“(此处留空/待填写)”。)
设置指南
- 获取无刮削密钥
- 登录 前往无刮削仪表盘(提供免费试用)
- 然后点击“设定“在左边 -> 选择”API密钥管理" -> 点击 "创建API密钥最后,点击您创建的API密钥 复制 它
- 配置您的MCP客户端
无刮擦MCP服务器支持两者 Stdio(注:在中文语境中,"Stdio"通常不直接翻译,因为它是一个特定的编程或技术术语,可能指标准输入输出库或相关概念,具体含义需根据上下文确定。此处保留原样以体现其专业性。) 和 可流式传输的HTTP 运输方式。
🖥️ Stdio(本地执行)
{
"mcpServers": {
"Scrapeless MCP Server": {
"command": "npx",
"args": ["-y", "scrapeless-mcp-server"],
"env": {
"SCRAPELESS_KEY": "YOUR_SCRAPELESS_KEY"
}
}
}
}🌐 Streamable HTTP(托管API模式)
{
"mcpServers": {
"Scrapeless MCP Server": {
"type": "streamable-http",
"url": "https://api.scrapeless.com/mcp",
"headers": {
"x-api-token": "YOUR_SCRAPELESS_KEY"
},
"disabled": false,
"alwaysAllow": []
}
}
}高级选项
使用可选参数自定义浏览器会话行为。这些参数可以通过环境变量(针对Stdio)或HTTP头(针对Streamable HTTP)进行设置:
| Stdio(环境变量) | 可流式传输的HTTP(HTTP头) | 描述 | |
|---|---|---|---|
| BROWSER_PROFILE_ID | x-browser-profile-id | 指定一个可重用的浏览器配置文件ID,以实现会话连续性。 | |
| BROWSER_PROFILE_PERSIST | x-browser-profile-persist | 启用对cookie、本地存储等的持久化存储。 (此行无实际内容,若作为分隔线可译为) | (表示一个分隔或分隔线) |
| BROWSER_SESSION_TTL | x-browser-session-ttl | 定义浏览器会话的生存时间(Time To Live) 最大会话超时时间 几秒钟后。此会话将在此无活动时长后自动过期。 |
与Claude桌面版的集成
- 开放 Claude Desktop(可译为“Claude桌面版”或保持原样,根据上下文判断是否需要更具体的翻译)
- 导航至:
Settings→Tools→MCP Servers - 点击 “添加MCP服务器”
- 粘贴以下任意一项
Stdio或者Streamable HTTP上述配置 - 保存并启用服务器
- 现在,克劳德将能够使用Scrapeless进行网页查询、提取内容并与网页进行交互
与 Cursor IDE 的集成
- 开放 光标
- 新闻界
Cmd + Shift + P并搜索:Configure MCP Servers - 使用上述格式添加无刮削MCP配置
- 保存文件并重启Cursor(如需)
- 现在你可以向Cursor询问诸如:
1. "Search StackOverflow for a solution to this error" 1. "Scrape the HTML from this page"
- 并且它将在后台使用Scrapeless技术。
支持的MCP工具
| 名称 | 描述 |
|---|---|
| google_search | 全面的信息搜索引擎。 |
| google_trends | 从Google Trends获取热门搜索数据。 |
| browser_create | 使用Scrapeless创建或重用一个云浏览器会话。 |
| browser_close | 通过断开云浏览器连接来关闭当前会话。 |
| browser_goto | 将浏览器导航到指定的URL。 |
| browser_go_back | 在浏览器历史记录中返回上一步。 |
| browser_go_forward | 在浏览器历史记录中前进一步。 |
| browser_click | 点击页面上的特定元素。 |
| 浏览器类型 | 在指定的输入框中输入文本。 |
| browser_press_key | 模拟按键按下。 |
| browser_wait_for | 等待特定页面元素出现。 |
| browser_wait | 暂停执行固定时长。 |
| browser_screenshot | 捕获当前页面的截图。 |
| browser_get_html | 获取当前页面的完整HTML。 |
| browser_get_text | 从当前页面获取所有可见文本。 |
| browser_scroll | 滚动到页面底部。 |
| browser_scroll_to | 将特定元素滚动到视图中。 |
| scrape_html | 抓取一个URL并返回其完整的HTML内容。 |
| scrape_markdown | 抓取一个URL并返回其Markdown格式的内容。 |
| scrape_screenshot | 捕获任意网页的高质量截图。 |
安全最佳实践
当使用无刮取MCP服务器与大型语言模型(如ChatGPT、Claude或Cursor)时,务必谨慎处理所有刮取或提取的网页内容。 网页数据默认不可信,而处理不当可能会使您的应用程序面临提示注入或其他安全漏洞的风险。
✅ 推荐做法
- 永远不要直接将原始抓取的内容作为大型语言模型(LLM)的提示输入。 原始HTML、JavaScript或用户生成的文本中可能包含隐藏的注入载荷。
- 对所有提取的内容进行消毒处理和验证。 在将内容用于下游逻辑或AI模型之前,剥离或转义潜在有害的标签和脚本。
- 相较于自由格式的文本,更倾向于结构化提取。 使用诸如……之类的工具
scrape_html,scrape_markdown,或针对性的browser_get_text使用已知安全的选择器,仅提取您信任的内容。 - 应用域名或选择器白名单 在抓取动态生成的网页时,应限制数据流仅来自已知且可信任的来源。
- 记录并监控所有出站请求 通过浏览器或抓取工具生成,尤其是当您处理敏感数据、令牌或内部网络访问时。
🚫 避免
- 将抓取的HTML直接注入到提示中
- 允许用户指定任意URL或CSS选择器而不进行验证
- 存储未过滤的抓取内容以供将来提示使用
社区
联系我们
如有任何问题、建议或合作意向,请随时通过以下方式联系我们:
- 电子邮件: market@scrapeless.com(可译为:“无刮取市场支持邮箱:market@scrapeless.com”,但通常直接保留原样作为邮件地址使用)
- 官方网站: https://www.scrapeless.com(该网址可直接翻译为“https://www.无刮取.com”,但实际使用中网址通常不进行翻译,保持原样即可,这里仅为说明翻译方法)
- 社区论坛:https://discord.gg/Np4CAHxB9a
