Token导航 LogoToken导航TokenDH.com
AI knowledge hub logo
文档知识未说明官方级别未说明来源级核验

AI knowledge hub

MCP Server

AI Knowledge Hub是一个本地与云集成的自动化环境,结合OpenWebUI、Groq、Firecrawl和Ollama,用于智能数据抓取、知识管理和AI辅助自动化。

工具数

0

提示词数

0

GitHub Stars

0

资源数

0
知识管理JavaScript多模型支持数据抓取

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

hieudku

提供方

hieudku

最后核验

2026/5/17 20:21

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

详细介绍

人工智能知识中心

AI知识中心是一个本地与云端集成的自动化环境,它结合了 OpenWebUI(中文可译为“开放网页用户界面”)Groq(注:这是一个专有名词,通常不进行翻译,保持原样。在某些语境下,如果需要解释其含义或背景,可以添加说明,但在此直接给出译文)火爬行(或译为“火焰爬行者”,具体译名可能根据上下文调整),以及 Ollama(注:Ollama是一个用于训练和运行大型语言模型的开源工具,此处直接保留原名,不进行意译) 用于智能数据抓取、知识管理以及AI辅助自动化。

这个项目利用了 模型上下文协议(MCP) 框架,使人工智能模型能够直接与外部工具和应用程序编程接口(API)进行交互。\ 通过Groq的MCP兼容响应API和Firecrawl的MCP服务器,它实现了AI相关数据的自动检索、总结和组织,并将其同步到可通过OpenWebUI访问的知识库中。

______________________________________________________________________

目的

该项目的目的是提供一个统一、模块化的系统,用于:

  • 跑步 OpenWebUI 通过NVIDIA Docker在本地使用GPU加速。
  • 整合 Groq API 用于高速推理的、具备推理能力的大型语言模型(LLM)推理。
  • 通过自动化实现网页抓取和摘要生成任务 Firecrawl API.
  • 将所有收集到的数据整理到一个本地目录中,以便 OpenWebUI知识同步
  • 同时启用两者 本地和基于云的AI模型 在一个环境中无缝协作。

这种设置非常适合研究、人工智能知识整合以及利用大型语言模型(LLM)驱动的自动化进行实验。

______________________________________________________________________

特点/功能

  • 自动化数据抓取

- harvest_ai_models.js从Hugging Face抓取热门的AI模型。 - harvest_reddit_ai.js抓取与人工智能相关的Reddit子版块讨论。 - harvest_investor_news_firecrawl.js抓取金融与投资新闻及市场情绪。

  • 持续输出管理

- 在(某个位置/目录下)组织了子目录 /outputs 对于每个数据源。 - 可选的实时挂载到OpenWebUI /uploads 用于自动同步的文件夹。

  • 多模型支持

- 使用Ollama进行本地推理(例如。, gemma3:4b 或者 llama3:8b)。 - 通过Groq进行云端推理(例如。, gpt-oss-120bllama-3.1-70b)。

  • GPU加速

- 集成NVIDIA驱动程序支持,以提升本地大型语言模型(LLM)性能。

  • 容器化环境

- 单身 docker-compose.yml 处理构建、运行和持久化。

  • 安全配置

- .env 文件管理API密钥和模型配置。

展示台;陈列柜

  • 金融新闻概要来自 投资者Ne - 使用Groq的GPT-OSS-120b和Firecrawl进行MCP网页抓取,通过本地Llama3.3-70b基础模型结合知识/系统提示进行总结
  • ![](./resources/img/finance_news_daily_scrap.jpg)
  • 基于定制化Llama3.3-70b的AI研究员模型对Huggingface.co及AI与LLM子版块的新帖子进行总结与分析。
  • ![](./resources/img/researcher_huggingface_redditai.jpg)
  • MCP 提示 -> 抓取 -> 自动化总结执行过程
  • ![](./resources/img/bash.jpg)

______________________________________________________________________

目录结构

ai_knowledge_hub/
│
├── docker-compose.yml          # Docker setup for OpenWebUI with GPU + mounts
├── harvest_ai_models.js        # Scraper for Hugging Face trending models
├── harvest_reddit_ai.js        # Scraper for Reddit AI communities
├── package.json                # Node dependencies for scraper scripts
├── .env                        # Environment variables (not committed)
├── .env.example                # Example environment file for setup
├── outputs/                    # Auto-generated data folder
│   ├── RedditAI/
│   └── AI_Models/
└── README.md                   # Project documentation

______________________________________________________________________

安装说明

1. 克隆仓库

git clone https://github.com/hieudku/ai-knowledge-hub.git
cd ai-knowledge-hub

______________________________________________________________________

2. 创建环境变量

复制这个示例 .env 文件并编辑您的API凭证:

cp .env.example .env

然后打开 .env 并插入您的实际密钥:

GROQ_API_KEY=your_groq_api_key_here
FIRECRAWL_API_KEY=your_firecrawl_api_key_here
OLLAMA_API_BASE_URL=http://host.docker.internal:11434
DEFAULT_MODEL=choose_your_own_local_model
ENABLE_MCP_SERVERS=true
NVIDIA_VISIBLE_DEVICES=all
NVIDIA_DRIVER_CAPABILITIES=compute,utility

______________________________________________________________________

3. 启动Docker容器

docker compose up -d

运行后,请访问:

http://localhost:3000

现在,您将能够运行带有GPU加速的OpenWebUI,同时支持与本地Ollama的连接,并提供Groq和Firecrawl的集成,用于网页抓取和模型推理。

______________________________________________________________________

4. 运行收获脚本

Node.js脚本实现了数据抓取的自动化,并将输出结果馈送到OpenWebUI挂载的知识路径中。

抓取热门AI模型

node harvest_ai_models.js

抓取AI相关Subreddits(论坛板块)

node harvest_reddit_ai.js

所有抓取的数据将自动保存至:

outputs/AI_Models/
outputs/RedditAI/

如果你的Docker容器挂载了这个文件夹(如在配置中所指定的那样) docker-compose.yml), 文件将自动出现在OpenWebUI的内部 知识 → 同步目录 用于即时索引。

______________________________________________________________________

环境文件参考

示例 .env 变量:

# API Integrations
GROQ_API_KEY=
FIRECRAWL_API_KEY=

# Local Ollama Configuration
OLLAMA_API_BASE_URL=http://host.docker.internal:11434
DEFAULT_MODEL=gemma3:4b

# External MCP Integration
ENABLE_MCP_SERVERS=true

# GPU Configuration
NVIDIA_VISIBLE_DEVICES=all
NVIDIA_DRIVER_CAPABILITIES=compute,utility

______________________________________________________________________

Docker 配置概览

你的 docker-compose.yml 处理所有服务和卷挂载:

version: "3.9"

services:
  openwebui:
    image: ghcr.io/open-webui/open-webui:latest
    container_name: openwebui
    restart: unless-stopped
    ports:
      - "3000:8080"
    env_file:
      - .env
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: all
              capabilities: [gpu]
    volumes:
      - ollama:/root/.ollama
      - openwebui_data:/app/backend/data
      - C:/Users/hieuc/ai_knowledge_hub/outputs:/app/backend/data/uploads/mounted-scrapping

volumes:
  ollama:
  openwebui_data:

______________________________________________________________________

架构概述

人工智能知识中心 整合多个系统:

组件角色描述
OpenWebUI前端界面用于本地和外部大型语言模型(LLM)的聊天用户界面
Ollama(注:Ollama是一个用于本地运行大型语言模型的工具或框架,直接翻译可能无法准确传达其含义,但在此处保留原英文以保持专业性,同时根据语境可理解为“奥拉玛”或直接以其英文名指代。)本地推理在本地运行小型到中型的开源模型
Groq API云推理提供超快速推理模型(例如,GPT-OSS-120B)
火爬行者(或根据上下文可译为“火蚁”、“火行者”等,具体译法需结合语境) 网络抓取API自动提取和总结网页内容
收获脚本自动化层获取并保存AI内容至 /outputs/
Docker Compose部署编排器使用GPU和持久卷构建并运行系统

______________________________________________________________________

推荐使用流程

  1. 使用 Docker Compose 启动 OpenWebUI。
  2. 运行抓取脚本(harvest_ai_models.js 或者 harvest_reddit_ai.js)。
  3. 文件将出现在挂载点中 /uploads/ 容器内的文件夹。
  4. 打开 OpenWebUI → *知识标签页* 同步或刷新您的目录。
  5. 使用最新的上下文知识查询你的大型语言模型(如Groq、Ollama等)。

______________________________________________________________________

安全与最佳实践

  • Do(做) 不是 坚定你的(决心/承诺等,具体根据上下文确定) .env 文件。
  • 仅创建和分享 .env.example 带有占位符键。
  • 在Groq和Firecrawl仪表板上查看并限制您的API使用限制。
  • 如果要公开暴露您的实例,请在OpenWebUI设置中配置身份验证。
  • 定期备份您的 outputs/ 如果你依赖长期数据积累,那么请查看目录。

______________________________________________________________________

故障排除

问题可能原因解决方案
(无)(无)(无)nvidia-container-toolkit容器启动失败缺少NVIDIA运行时或GPU驱动程序安装
OLLAMA_API_BASE_URLOllama 网络问题主机绑定错误确保 http://host.docker.internal:11434 使用
.env 根据上面的信息,执行如下指令:
文件值outputs/OpenWebUI中无抓取数据挂载路径不匹配确保主机 /app/backend/data/uploads 被映射到

______________________________________________________________________

|

许可证\ 此项目仅供教育和研究用途发布。\ 您可以自由修改或扩展它,用于本地人工智能开发或内部工具构建。

______________________________________________________________________

所有依赖项均受其各自许可证的约束。

致谢/功劳/贡献\ 由Hieu Cu开发并维护。 结合来自(某处)的开源组件OpenWebUI Ollama(注:Ollama是一个开源的机器学习框架,用于训练和部署机器学习模型,此处直接音译为“奥拉玛”,但具体翻译可能需根据上下文或品牌官方译名调整。) Groq ,以及 火爬行者(或根据上下文可译为“火蜥蜴”、“火虫”等,具体译名需结合语境确定)

目录标签

目录标签

知识管理JavaScript多模型支持数据抓取本地部署AI自动化本地与云集成

接入字段

传输方式(transport,传输协议)

未说明

鉴权方式(authType,认证方式)

none

工具数量(toolCount,工具数)

0

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

未说明none部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

仍需确认:installCommand

来源信息

继续浏览同类 MCP