CMAS MCP-知识管道
该存储库包含用于构建和驱动服务器的基础设施 模型上下文协议(MCP) 专门研究UDD工程学院(C+和CMAS中心)的创新和技术生态系统。
项目目标
其中心目的是将数百小时的视听内容和技术文件转化为结构化和可访问的语言模型知识库。这使人工智能助理能够用准确和上下文化的数据回答有关锂开采、环境传感器和领土治理等项目的技术问题。
文件夹结构
data/ -数据中心
该文件夹管理信息的生命周期,从原始捕获到最终优化。
data/raw/:存储未处理的原始数据。
- youtube/:完整的元数据和字幕文件(.vtt)从渠道创新方向提取。 - cmas_web/:通过爬网从官方网站CMAS UDD获得的原始内容。
data/processed/:Es la 知识库 人工智能优化。
- 目的: LLMS无法有效地“观看”视频或处理数千份无序的转录本。在这个文件夹中,文本被清理,分为片段(分块),并用执行摘要、关键词和已识别的实体进行丰富。 - 主文件: processed_videos_v1.jsonl。它是MCP服务器读取的文件,以提供快速和准确的答案。
scripts/ -自动化工具
管道不同阶段的Python脚本:
ingest_youtube.py:下载完整的视频和元数据列表。fetch_captions.py:获取多种语言的字幕。process_pipeline.py:执行文本清理和基本结构。process_next_batch.py:管理10个视频的增量批处理。
src/mcp_server/ -服务器
包含MCP服务器的实现(基于 FastMCP)它展示了工具和资源,以便Claude Desktop等客户能够查询这些知识。
______________________________________________________________________
当前范围(已完成)
- \[x\] 第1阶段(基线): 架构定义、传输(STDIO/HTTP)和响应模式。
- \[x\] 第二阶段(摄入): 从YouTube频道(193个视频)捕获100%的元数据和字幕。
- \[x\] 第3阶段(管道): 结构化处理的数据,生成词汇索引和文本清理。
- \[x\] 第4阶段(浓缩): 通过人工智能为193段视频生成100%的执行摘要、技术关键词和实体识别。(完成时间:2026年2月12日)。
