Firecrawl 本地 MCP 服务器
一个用于与自托管的Firecrawl实例交互的MCP(模型上下文协议)服务器。此服务器通过您本地的Firecrawl部署提供网页抓取和爬取功能。
特性
- 网络抓取从单个网页中提取Markdown格式的内容
- 网页抓取使用可定制的深度和过滤功能爬取整个网站
- 网站地图生成网站上所有可访问URL的列表
- 作业监控跟踪爬取任务的状态
- 无需API密钥直接与自托管的 Firecrawl 实例配合工作
安装
npm install
npm run build配置
服务器使用(某种方式)连接到您的Firecrawl实例 FIRECRAWL_URL 环境变量。默认情况下,它会连接到 http://localhost:3002---
要更改Firecrawl的URL,请设置 FIRECRAWL_URL 在你的MCP配置中设置环境变量。
用法
使用Claude桌面版
添加到您的Claude Desktop配置文件中(claude_desktop_config.json---
{
"mcpServers": {
"firecrawl-local": {
"command": "node",
"args": ["/absolute/path/to/firecrawl-local-mcp/dist/index.js"],
"env": {
"FIRECRAWL_URL": "http://localhost:3002"
}
}
}
}与克林一起
将此添加到您的Cline MCP配置文件中:
{
"mcpServers": {
"firecrawl-local": {
"command": "node",
"args": ["dist/index.js"],
"cwd": "/absolute/path/to/firecrawl-local-mcp",
"env": {
"FIRECRAWL_URL": "http://localhost:3002"
}
}
}
}可用工具
firecrawl_scrape
抓取单个网页并以Markdown格式返回其内容。
参数:
url(必填):要抓取的网址formats输出格式(默认:\["markdown"\])onlyMainContent仅提取主要内容(默认:true)includeTags要包含的HTML标签excludeTags要排除的HTML标签
firecrawl_crawl
从一个URL开始爬取网站,并返回多个页面的内容。
参数:
url(必填):要爬取的起始网址includes要包含的URL模式(支持通配符)excludes要排除的URL模式(支持通配符)maxDepth最大爬取深度(默认值:2)limit要抓取的最大页面数(默认:10)allowBackwardLinks允许爬取反向链接(默认:false)allowExternalLinks允许抓取外部链接(默认:false)
firecrawl爬取状态
检查爬取任务的状态。
参数:
jobId爬取请求返回的作业ID
firecrawl_map
映射一个网站以获取所有可访问的URL列表。
参数:
url(必填):要映射的URLsearch用于过滤URL的搜索查询ignoreSitemap忽略网站的网站地图(默认:false)includeSubdomains包含子域名(默认:否)limit返回的最大URL数量(默认:5000)
测试
测试服务器功能:
node test.js这将测试工具列表和一个样本抓取操作。
示例用法
一旦在Claude Desktop中进行配置,您就可以使用如下自然语言命令:
- 从https://example.com抓取内容
- 爬取文档网站 https://docs.example.com,爬取深度为3
- “将 https://example.com 上的所有 URL 进行映射”
- 检查爬虫任务abc123的状态
要求
- Node.js 18+
- 一个运行中的Firecrawl自托管实例(见 Firecrawl 自托管指南)
- 访问Firecrawl实例的网络权限
故障排除
- 连接问题验证您的Firecrawl实例是否正在运行且可访问
- 超时错误调整超时值
src/index.ts针对网站加载缓慢的情况 - 认证错误确保
USE_DB_AUTHENTICATION=false在你的 Firecrawl .env 文件中
