Firecrawl Lite MCP服务器

A. 隐私第一,独立 MCP服务器,使用本地浏览器自动化和您自己的LLM API密钥提供web抓取和数据提取工具。 不需要外部依赖项或API密钥
🎯 是什么让Firecrawl Lite与众不同
🔒 隐私优先架构
- 本地处理 -所有网络抓取和数据提取都在您的机器上进行
- 您的数据保留在本地 -内容在本地处理,不发送给第三方
- 无外部服务锁定 -不需要云API
- 完全控制 -您拥有自己的数据和基础设施
💰 经济高效且透明
- 仅为LLM使用付费 -无需额外订阅或API费用
- 您的法学硕士提供者 -兼容OpenAI、xAI、Anthropic、Ollama等。
- 可预测成本 -基于您选择的LLM费率的透明定价
⚡ 性能和简单性
- 闪电般快速启动 -轻量化设计意味着快速初始化
- 单个集装箱 -支持Docker的简单部署
- 最小资源使用 -针对效率和低内存占用进行了优化
🛠️ 可用工具
✅ scrape_page -从单个网页提取内容
- 用例:获取LLM要阅读的网页内容
- 参数:
url,onlyMainContent
✅ batch_scrape -在单个请求中删除多个URL
- 用例:高效处理多个页面
- 参数:
urls[],onlyMainContent
✅ extract_data -使用LLM提取结构化数据
- 用例:使用自然语言提示从页面中提取特定数据
- 参数:
urls[],prompt,enableWebSearch
✅ extract_with_schema -使用JSON模式提取数据
- 用例:使用预定义的模式提取结构化数据
- 参数:
urls[],schema,prompt,enableWebSearch
✅ screenshot -对网页进行截图
- 用例:捕获页面的视觉表示
- 参数:
url,width,height,fullPage
🚀 快速入门(推荐)
克劳德桌面
增添 ~/Library/Application Support/Claude/claude_desktop_config.json:
{
"mcpServers": {
"firecrawl-lite": {
"command": "npx",
"args": ["-y", "@ariangibson/firecrawl-lite-mcp-server"],
"env": {
"LLM_API_KEY": "your_llm_api_key_here",
"LLM_PROVIDER_BASE_URL": "https://api.x.ai/v1",
"LLM_MODEL": "grok-code-fast-1"
}
}
}
}克劳德代码(CLI)
claude mcp add firecrawl-lite npx -- -y @ariangibson/firecrawl-lite-mcp-server --env LLM_API_KEY=your_key --env LLM_PROVIDER_BASE_URL=https://api.x.ai/v1 --env LLM_MODEL=grok-code-fast-1光标
添加到光标MCP配置中:
{
"mcpServers": {
"firecrawl-lite": {
"command": "npx",
"args": ["-y", "@ariangibson/firecrawl-lite-mcp-server"],
"env": {
"LLM_API_KEY": "your_llm_api_key_here",
"LLM_PROVIDER_BASE_URL": "https://api.x.ai/v1",
"LLM_MODEL": "grok-code-fast-1"
}
}
}
}⚙️ 配置
所需的环境变量
# Your LLM API key (xAI, OpenAI, Anthropic, etc.)
LLM_API_KEY=your_api_key_here
# LLM provider base URL
LLM_PROVIDER_BASE_URL=https://api.x.ai/v1
# LLM model name
LLM_MODEL=grok-code-fast-1LLM提供者示例
# xAI (Grok)
LLM_PROVIDER_BASE_URL=https://api.x.ai/v1
LLM_API_KEY=xai-your-key-here
LLM_MODEL=grok-code-fast-1
# OpenAI
LLM_PROVIDER_BASE_URL=https://api.openai.com/v1
LLM_API_KEY=sk-your-key-here
LLM_MODEL=gpt-4o-mini
# Anthropic
LLM_PROVIDER_BASE_URL=https://api.anthropic.com
LLM_API_KEY=sk-ant-your-key-here
LLM_MODEL=claude-3-haiku-20240307
# Local LLM (Ollama)
LLM_PROVIDER_BASE_URL=http://localhost:11434/v1
LLM_API_KEY=your-local-key
LLM_MODEL=llama2🌐 远程部署
对于远程服务器或Docker部署,请确保启用至少一个HTTP端点(取决于您计划使用的传输协议)-默认情况下不启用这些端点:
码头工人
docker run -d \
-p 3000:3000 \
-e ENABLE_HTTP_STREAMABLE_ENDPOINT=true \
-e ENABLE_SSE_ENDPOINT=true \
-e LLM_API_KEY=your_key_here \
-e LLM_PROVIDER_BASE_URL=https://api.x.ai/v1 \
-e LLM_MODEL=grok-code-fast-1 \
ariangibson/firecrawl-lite-mcp-server:latest克劳德代码(远程)
claude mcp add firecrawl-lite-remote http://your-server:3000/mcp -t http克劳德桌面(远程)
方法1:连接器(推荐-仅HTTPS) 远程MCP服务器的官方Claude Desktop方法:
- 转到克劳德桌面→ 设置→ 连接器
- 添加连接器:
https://your-server.com:3000/mcp - 需要:具有有效SSL证书的HTTPS服务器
方法2:mcp代理(HTTP/HTTPS回退) 对于没有SSL证书的服务器:
pip install mcp-proxy添加到claude_desktop_config.json:
{
"mcpServers": {
"firecrawl-lite": {
"command": "mcp-proxy",
"args": ["http://your-server:3000/sse"]
}
}
}🛠️ 高级配置
代理支持
PROXY_SERVER_URL=http://your-proxy-server.com:1337
PROXY_SERVER_USERNAME=your-username
PROXY_SERVER_PASSWORD=your-password反检测
SCRAPE_USER_AGENT="Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/113.0.0.0 Safari/537.3"
SCRAPE_DELAY_MIN=1000
SCRAPE_DELAY_MAX=3000性能调整
SCRAPE_VIEWPORT_WIDTH=1920
SCRAPE_VIEWPORT_HEIGHT=1080
SCRAPE_BATCH_DELAY_MIN=2000
SCRAPE_BATCH_DELAY_MAX=5000🛠️ 故障排除
Chrome问题
Chrome会在首次使用时自动安装。如果您遇到问题:
# Manual installation
npx puppeteer browsers install chrome
# Reset if corrupted
rm -rf ~/.cache/puppeteer && npx puppeteer browsers install chrome连接问题
- 验证互联网连接
- 检查LLM提供程序URL可访问性
- 确保API密钥有效
- 对于公司网络,配置代理设置
📊 使用示例
删除网页
{
"name": "scrape_page",
"arguments": {
"url": "https://example.com"
}
}批量抓取多个URL
{
"name": "batch_scrape",
"arguments": {
"urls": ["https://example.com", "https://example.org"],
"onlyMainContent": true
}
}使用提示提取数据
{
"name": "extract_data",
"arguments": {
"urls": ["https://example.com"],
"prompt": "Extract the main article title and summary"
}
}使用模式提取
{
"name": "extract_with_schema",
"arguments": {
"urls": ["https://example.com"],
"schema": {
"type": "object",
"properties": {
"title": {"type": "string"},
"description": {"type": "string"}
}
}
}
}🐳 集装箱登记处
预构建图像可用:
Docker Hub: ariangibson/firecrawl-lite-mcp-server:latest\ GitHub容器注册表: ghcr.io/ariangibson/firecrawl-lite-mcp-server:latest
两者都支持多架构(amd64, arm64)自动更新。
🙏 致谢与致谢
该项目的灵感来自原始Firecrawl项目的出色工作:
🔥 萤火虫
最初的Firecrawl项目由 Mendable.ai -一个具有高级功能的综合网络抓取平台。
🔥 Firecrawl MCP服务器
Firecrawl团队的官方MCP服务器实现。
我们非常感谢Firecrawl团队在网页抓取和MCP集成方面的开创性工作! 🚀
💡 正在寻找企业级网络抓取?\ 访问 firecrawl.com 网站地址 因为他们的云服务具有零设置复杂性。
📝 许可证
MIT许可证-请参阅 许可证 了解详情。
