实时网络访问工作坊:利用实时数据为您的AI加速
学习如何让您的AI代理访问实时网络数据——这是静态大型语言模型(LLM)与动态、可信应用之间缺失的连接环节。
为何这很重要
人工智能应用的好坏完全取决于其数据质量。虽然大型语言模型(LLMs)拥有广泛的知识,但它们受限于训练数据的截止日期,无法获取实时信息。这带来了根本性的问题:
- 过时信息:无法回答有关近期事件、当前价格或最新进展的问题
- 无来源验证:无法引用或验证来自权威来源的信息
- 有限的上下文:忽略了网络的动态性和不断更新的特性
解决方案:赋予您的AI代理实时搜索、获取和处理实时网络数据的能力。这将静态模型转变为动态系统,使其能够:
- 研究当前热点话题并附上引用文献
- 监控价格和趋势
- 获取最新信息
- 使用最新数据构建RAG系统
- 为自主智能体赋予真实世界的情境能力
你将要构建的内容
一个由MCP(模型上下文协议)驱动的智能AI研究代理,它能够:
- 自主搜索并分析网络资源
- 明智地决定要抓取哪些页面
- 综合撰写包含引用的研究报告
- 使用LangChain的ReAct框架进行智能推理
在此过程中,自动绕过封锁、验证码(CAPTCHA)和反机器人措施。
快速入门
先决条件
- Node.js 18及以上版本
- Bright Data账户(注册地址:https://brightdata.com)
安装
git clone https://github.com/ScrapeAlchemist/The_Missing_Link_in_AI.git
cd The_Missing_Link_in_AI
npm install配置
- 从 https://brightdata.com/cp/settings 获取API密钥
- 导航至“API令牌”→ 生成新令牌
- (可选)从https://console.anthropic.com/settings/keys获取Anthropic API密钥
- 建议用于更高品质的合成(如省略,则使用启发式回退方法)
- 设置环境:
cp .env.example .env
# Edit .env with your credentials所需于 .env:
BRIGHTDATA_API_KEY=your_api_key_here可选:
ANTHROPIC_API_KEY=your_anthropic_key_here # Enables LLM synthesis (recommended)
SERP_ZONE=your_serp_zone_name # Create a SERP API zone in Bright Data
UNLOCKER_ZONE=your_unlocker_zone # Create a Web Unlocker zone in Bright Data- 验证您的设置:
npm run verify跑
# Main workflow - Intelligent MCP agent analyzes 10 sources
npm start "your search query here"
# Examples:
npm start "latest AI news"
npm start "quantum computing breakthroughs 2025"
# Or run directly:
node src/main_workflow.js "your search query"自主学习
对此感到新奇吗? 按照分步教程进行操作:
- 教程.md - 完整的自主节奏工作坊(45-60分钟)
- 包括练习、故障排除和挑战
- 非常适合现场研讨会后的自主学习
研讨会内容
为何实时网页访问至关重要
- 大型语言模型需要新鲜、可验证的数据
- 用例:研究助理、价格追踪、RAG(检索增强生成)系统、趋势分析
网站如何阻止机器人
- IP封锁、验证码(CAPTCHA)、JavaScript挑战、指纹追踪
- 好消息:Bright Data 会自动处理这一点
MCP集成
主要工作流程使用Bright Data MCP工具:
- 搜索具有领域多样性的相关资源
- 抓取选定页面并以干净的Markdown格式保存
- 撰写一份包含引用的研究报告
- 如果已配置,则使用Claude(Anthropic) - 否则,回退到启发式离线摘要器
替代访问方法 (用于学习/比较):
npm run demo:api基本HTTP API方法(需要SERP_ZONE+UNLOCKER_ZONE)npm run demo:mcp- ReAct智能体演示(需要ANTHROPIC_API_KEY)
注Bright Data还提供了一种 Python SDK(软件开发工具包) 在Python应用程序中实现高级抽象和类型安全。
负责任的使用
- 应做:访问公开数据,遵守速率限制,遵循服务条款(TOS)
- 不要:发送垃圾信息、虚假互动、绕过付费墙、访问私人内容
项目结构
.env # Environment variables (local, not committed)
src/
main_workflow.js # Main MCP-powered intelligent agent (10 sources)
brightdata_api_demo.js # Direct HTTP approach
brightdata_mcp_demo.js # Simple MCP demo
verify_setup.js # Setup verification tool
docs/
GETTING_STARTED.md # Detailed setup guide
API_REFERENCE.md # API documentation工作流程的工作原理
主要工作流程执行一个简单、可靠的管道处理过程:
- 初始化Bright Data MCP客户端和工具
- 进行搜索并选择具有域名多样性的URL
- 将每一页数据提取并整理成干净的Markdown格式
- 撰写一份包含引用的报告
- 与克劳德一起:实现更高品质的分析与综合 - 没有Claude的辅助:启发式摘要,突出标题、首句、关键词和来源
import { runWorkflow } from './src/main_workflow.js';
const result = await runWorkflow('quantum computing 2025', {
maxResults: 10
});
console.log(result.result); // Final research report (LLM or heuristic)
console.log(result.toolUsage); // Which tools were used
console.log(result.executionTime); // Time taken工作流程:
- 寻找相关资源
- 将网页抓取为Markdown格式
- 综合研究成果并附上引用(基于大型语言模型或启发式方法)
文档
- 入门指南:docs/GETTING_STARTED.md
- 根据上面的信息,执行如下指令:
- Bright Data 文档:https://docs.brightdata.com
常见使用场景
研究助理:进行全面分析并注明出处
import { runWorkflow } from './src/main_workflow.js';
const result = await runWorkflow('quantum computing 2025', { maxResults: 10 });
console.log(result.result); // Full research report价格监控:比较各零售商的价格
const result = await runWorkflow('best laptop deals RTX 4090', { maxResults: 10 });
// Agent finds and analyzes multiple retailersRAG管道:利用实时网络数据丰富大型语言模型(LLM)
const webResearch = await runWorkflow(userQuery, { maxResults: 10 });
// webResearch.result contains synthesized information with sources
// Pass to your downstream LLM or use directly______________________________________________________________________
表达你的支持
如果这个研讨会对你有帮助,请给个好评!
没有大型语言模型(LLM)?使用离线模式
- 克劳德(Claude)在主工作流程中是可选的。如果
ANTHROPIC_API_KEY如果未设置,则工作流仍会运行,并生成包含引用(标题、首句、关键词和来源)的启发式摘要。 - 为了获得更高质量的合成,请设置
ANTHROPIC_API_KEY(并且可选地ANTHROPIC_MODEL,默认claude-sonnet-4-5)。
演示要求
npm run demo:api需要SERP_ZONE并且UNLOCKER_ZONE在.env(亮数据区域)。npm run demo:mcp需要ANTHROPIC_API_KEY(使用了一个ReAct智能体演示)。
