AI研究引擎
人工智能研究最全面的数据源清单和方法。100多个免费API、40多个MCP服务器和一个多代理工作流程,使“只需谷歌一下”看起来就像用手电筒搜索海底。
问题
当你要求人工智能进行研究时,实际情况如下:
- “问问AI” --它从训练数据中得到答案。过时了,经常是错误的,它不会告诉你它不知道什么。
- “AI帮你谷歌” --谷歌只索引了世界数据的一小部分。没有学术论文,没有专利申请,没有软件包下载统计数据,没有预测市场概率,没有美国证券交易委员会公司申请,没有应用商店数据。
- “谷歌自己” --您将看到结果的第一页。也许是第二个。你错过了所有没有SEO优化的东西。
真实数据存在于100多个专用数据库、注册表和API中。他们中的大多数都是免费的。几乎没有人一次使用超过2或3个。
这是什么
AI代理的研究基础设施。不是另一个聊天机器人包装器。不是另一个只连续进行5次谷歌搜索的“深度研究”工具。
这是:
- 完整的库存 100多个免费数据源,每个数据源都有curl示例、速率限制和身份验证要求
- 一种多智能体方法 其中廉价模型(Sonnet)并行收集来自数十个来源的数据,然后一个强大的模型(Opus)交叉引用和综合
- 源选择步骤 根据你的具体问题,选择18个来源集群中哪些是真正相关的——就像药剂师为病人挑选药物,而不仅仅是抛弃整个药房
- 飞行前检查 在显示选项之前,它会自动验证安装了哪些工具,因此您永远不会自动错过覆盖范围
- 验证步骤 在生成最终报告之前,检查覆盖范围、标记矛盾并确定差距
- 质量框架 (DRACO维度),根据事实准确性、分析深度、呈现和来源归因对输出进行评分
覆盖
| 类别 | 来源 | 示例 |
|---|---|---|
| 网页搜索 | 10+引擎 | Tavily、Exa、Firecrawl、SearXNG、DuckDuckGo、Bing、Brave、谷歌 |
| 学术论文 | 2.5亿多篇论文 | 语义学者、OpenAlex、arXiv、PubMed、Crossref、CORE、DBLP、DOAJ、Zenodo |
| 引用与影响 | 6个API | 开放测试、NIH iCite(RCR指标)、ORCID、ROR、Altmetric、OpenAIRE |
| 专利 | 1.4亿多项专利 | 美国专利商标局专利视图、欧洲专利局专利操作系统、Lens.org、谷歌专利BigQuery |
| 社会与社区 | 15+平台 | Reddit、X/Twitter、Bluesky、Mastodon、HN、Lobste.rs、Discourse、Discord、Telegram、Slack、StackExchange(170+个网站)、Hashnode、DEV.to、Lemmy |
| 趋势与预测 | 8+来源 | 谷歌趋势、TrendsMCP、Polymarket、TikTok、Instagram、YouTube、Truth Social |
| 新闻与媒体 | 6+来源 | GDELT、newsmcp、NewsAPI、纽约时报、RSS提要、谷歌新闻 |
| 播客 | 190M+集 | 播客索引、苹果播客/iTunes、听音笔记 |
| 包裹登记处 | 10个注册表 | npm、PyPI、crates.io、Packagist、RubyGems、NuGet、Homebrew、Docker Hub、HuggingFace、libraries.io(40多个注册表) |
| 公司与创业 | 7+来源 | SEC EDGAR、英国公司之家、YC OSS API、Finnhub、FMP、OpenCorporates、AI Funding API |
| 政府与经济 | 10+来源 | FRED(840K时间序列)、BLS、人口普查、Congress.gov、联邦公报、世界银行、国际货币基金组织、经济合作与发展组织、开放食品药品监督管理局、美国支出 |
| 搜索引擎优化和网络基础设施 | 8+来源 | Open PageRank、crt.sh、Google PageSpeed、Tranco、Wayback CDX、Common Crawl、Serper.dev、Cloudflare Radar |
| AI品牌知名度 | 3个工具 | Aperture、AICW、Citatra(追踪ChatGPT/困惑/克劳德如何提到你的品牌) |
| 知识图谱 | 2个来源 | 维基数据SPARQL、维基百科API |
| 书籍与媒体 | 3个来源 | 开放图书馆、互联网档案馆、Rumble |
运作原理
Step 0: Source Selection (Opus, before any agents launch)
Analyze the question → reason about which of 18 source clusters are relevant
Pre-flight check: silently verify what tools are installed/configured
Present sources grouped by WHY (not just a flat list)
Flag missing tools with install instructions
User confirms: go / just use what's ready / let me adjust
Phase 1: Collection (Sonnet agents, parallel)
Launch one agent per confirmed cluster, all in the background
Each agent: raw findings + confidence score + gaps
Sonnet costs 5x less than Opus — right model for data collection
Phase 1.5: Verification
One Sonnet agent audits all results:
→ Coverage score 1-5
→ Contradictions flagged
→ Missing topics identified
→ If score < 3, launch follow-up agents
Phase 2: Synthesis (Opus, main thread — never delegated)
Cross-reference all sources
Flag contradictions (never silently merge conflicting claims)
Score on DRACO dimensions (factual accuracy, analytical depth, presentation, source attribution)
Output structured report with full citations来源选择——“药剂师模式”
这项技能不仅仅是在每个问题上都发射所有18个集群。这浪费了时间和代币。在启动单个代理之前,它会对您的特定问题进行推理,并选择哪些集群实际包含相关数据。
“有人为浏览器记录建立了MCP服务器吗?”这个问题与“人工智能监管的经济影响是什么?”这个技能在接触任何API之前都会仔细考虑这个问题。
18个源集群,每个集群按访问类型标记:
- 🟢 自由 --直接卷曲、零键、零设置
- 🔑 钥匙 -需要免费的API密钥
- 📦 主控程序 --必须安装MCP服务器
- 💰 已支付 --有可能需要花钱的配额或学分
- 🔧 命令行界面 --需要安装CLI工具
来源按以下方式分组和呈现 *原因* 他们被选中了。所以,你看到的不是40个工具的简单列表,而是这样的:
Does this already exist?
✅ Code & Libraries — GitHub repos, npm/PyPI packages
✅ Package Registries — all free, no setup needed
⚠️ Competitive Intelligence — idea-reality-mcp not installed
→ Install: uvx idea-reality-mcp (30 seconds)
→ Or skip — I'll use Web Search + GitHub instead
What are people saying?
✅ Social Platforms — Reddit, Bluesky, StackExchange (all free)
⚠️ Twitter — MCP installed but reads cost $0.01 each
Is this space growing?
✅ News & Events — GDELT + newsmcp
⚠️ Trends — trendsmcp not installed
Maybe related (want me to include these?):
❓ Academic Papers — might be research on browser automation
❓ Patent & IP — someone might have patented this
Skipping (clearly not relevant):
⬚ Biomedical
⬚ Government & Economic
Options:
(a) Go with everything (install missing tools first)
(b) Just use what's ready now — zero setup friction
(c) Let me adjust选项(b)专为希望立即获得结果的用户而设计。发动机优雅地降级:使用所有🟢 免费curl API加上已经安装的MCP,跳过任何需要设置的内容,并在最终报告中注明跳过了哪些覆盖范围。
飞行前检查
在展示源列表之前,该技能会默默地验证:
- 每个MCP服务器是否响应
- 是否设置了所需的API密钥
- 是否安装了CLI工具
你永远不会默默地错过报道。如果没有设置某些内容,您将看到缺少的内容和一行安装命令。
模型选择
这项技能告诉你它正在使用哪些模型以及为什么:
- 十四行诗 --所有搜索/收集/提取代理。可以使用所有工具,成本比Opus低5倍。
- 俳句 --简单的单源查找。成本比Opus低25倍。当代理只需要1-2个工具时使用。
- 作品 --只有综合,在主线。从未用于收藏。合成是质量真正重要的部分。
确认源选择后,您可以在启动任何代理之前选择收集模型(推荐:Sonnet)。
是什么让这与众不同
vs谷歌搜索:谷歌索引网页。我们直接查询100多个专业数据库。专利申请、学术引文、软件包下载趋势、预测市场概率、美国证券交易委员会公司文件、政府经济数据——这些都没有出现在谷歌的第一页上。
vs ChatGPT/Claude/Gemini“深度研究”:他们进行5-10次网络搜索和综合。我们跨专用API执行100多个并行查询,在合成之前验证覆盖率并标记矛盾,并明确地对输出质量进行评分。他们的引用准确率为40-80%(DeepTRACE,NeurIPS 2025)。验证步骤专门用于捕捉这一点。
与过去30天相比:社交新事物的绝佳工具(过去30天内为Reddit/X/TikTok/Instagram)。我们涵盖了学术论文、专利、政府数据、软件包注册、公司文件、播客、预测市场以及80多个没有时间限制的来源。
vs出色的mcp服务器:按名称列出MCP服务器。我们列出了每个数据源,包括curl示例、确切的速率限制、身份验证要求以及将它们一起使用的方法。
vs公共api:列出1400多个API。我们精心策划对研究有重要意义的内容,展示如何将它们与人工智能代理一起使用,并提供将它们联系在一起的工作流程。
文件
research-engine.md # Master inventory: every API, MCP, and data source
skills/deep-research/ # Claude Code skill: the multi-agent workflow
SKILL.md # Full methodology + agent prompts + report template快速开始
直接使用数据源清单
research-engine.md 是一个独立的参考。每个API都有一个curl示例,您现在可以运行:
# Search 250M+ academic papers
curl "https://api.openalex.org/works?search=large+language+models&sort=publication_date:desc"
# Check prediction market odds
curl "https://gamma-api.polymarket.com/markets?tag=ai&closed=false"
# Search US patents
curl "https://search.patentsview.org/api/v1/patent/?q=machine+learning"
# Get Python package download trends
curl "https://pypistats.org/api/packages/langchain/recent"
# Search 840K+ economic time series
curl "https://api.stlouisfed.org/fred/series/search?search_text=unemployment&api_key=YOUR_FREE_KEY&file_type=json"用作Claude代码技能
复制 skills/deep-research/ 到 ~/.claude/skills/deep-research/ 并调用 /deep-research "your question".
技能阅读 research-engine.md 每次运行时都要获取最新的工具库存。
贡献
找到我们缺少的免费API或MCP服务器?打开一个问题或PR。栏位是:
- 必须是免费的或有一个有意义的免费等级
- 必须有一个工作API(不仅仅是一个网站)
- 必须包括:名称、URL、它提供的数据、速率限制、身份验证要求
许可证
麻省理工学院
