CrawlCraft
CrawlCraft 是由Groq、MCP和Firecrawl提供支持的反应式AI代理。它可以抓取网站,提取结构化数据,并执行工具驱动的推理。专为自动化、研究和智能数据收集而设计。
______________________________________________________________________
🚀 特性
- 反应式架构: 使用 LangGraph 和 MCP工具 用于动态决策。
- 高级爬行: Web爬行和数据提取 火爬.
- 推理引擎: 由...驱动 Groq法学硕士 用于快速、循序渐进的推理。
- 数据处理: 能够处理结构化和半结构化的web数据。
- 可扩展: 易于使用新工具和API集成进行扩展。
______________________________________________________________________
🛠 使用的技术
- Python 3.10+
- LangGraph (代理编排)
- LangChain MCP适配器
- Groq聊天模特 (
kimi-k2-instruct-0905) - 火爬 (网络抓取)
- 异步 (并发操作)
______________________________________________________________________
📦 安装
1.克隆存储库
git clone
cd CrawlCraft2.创建并激活虚拟环境
窗户:
python -m venv venv
source venv/Scripts/activateLinux/macOS:
python -m venv venv
source venv/bin/activate3.安装依赖项
pip install -r requirements.txt4.设置环境变量
创建一个 .env 在根目录中创建文件并添加密钥:
GROQ_API_KEY=your_groq_api_key_here
FIRECRAWL_API_KEY=your_firecrawl_api_key_here重要提示: 这.env文件包含在.gitignore保护你的秘密。
______________________________________________________________________
⚡ 用法
使用以下命令运行代理:
python main.py代理将在终端中启动并提示您输入。您可以键入自然语言查询或命令。
交互示例:
You: Crawl the homepage of example.com and extract all email addresses
Agent: Found the following emails: contact@example.com, info@example.com类型 quit 退出应用程序。
______________________________________________________________________
🧩 项目结构
CrawlCraft/
├─ main.py # Entry point for the agent
├─ .env # Environment variables (ignored by Git)
├─ .gitignore # Files to ignore
├─ README.md # Project documentation
├─ pyproject.toml # Python project metadata
└─ uv.lock # Dependency lock file______________________________________________________________________
💡 扩展代理
- 添加工具: 通过修改中的工具列表添加新的MCP工具
main.py. - 修改行为: 更新中的系统提示
messages改变代理的推理方式。 - 集成: 通过创建新的适配器函数,根据需要集成其他API或数据源。
______________________________________________________________________
🔒 安全
- 永远不要承诺你的
.env文件。 - 对所有API密钥保密。
- 如果怀疑钥匙泄漏,请立即转动钥匙。
______________________________________________________________________
