🔌 DataLake MCP服务器
生产就绪的模型上下文协议(MCP)服务器,通过标准化接口公开AWS数据湖服务,使任何AI助手都能使用自然语言查询您的数据湖。
🎯 概述
此MCP服务器弥合了AI助手和AWS数据湖之间的差距,允许在S3、Glue Catalog和Athena上进行自然语言查询,而无需编写SQL或boto3代码。
状态: 🚧 积极发展|📅 开始日期:2025年1月
✨ 特性
当前:
- 🏗️ 项目结构和架构已定义
- 📋 计划实施MCP协议
- 📚 文件编制中
计划(第1-2周):
- ✅ S3资源暴露(列出存储桶、对象)
- ✅ 基本MCP服务器实现
- ✅ 胶水目录集成
计划(第3-4周):
- 🔄 Athena查询执行
- 🔒 湖组安全
- 💾 缓存层
- 📊 成本估算工具
未来:
- 🔍 语义目录搜索
- 🤖 基于人工智能的查询优化
- 📈 数据质量检查
- 🔄 实时数据访问
🏗️ 建筑
┌─────────────────────────────────┐ │ AI客户端│ │ (克劳德、GPT、自定义应用程序)│ └──────────────┬──────────────────┘ │ MCP协议 ↓ ┌─────────────────────────────────┐ │ DataLake MCP服务器│ │ ┌───────────────────────────┐ │ │ │ 资源│ │ │ │ - S3桶/对象│ │ │ │ - 粘合表/模式│ │ │ │ - 雅典娜询问│ │ │ └───────────────────────────┘ │ │ ┌───────────────────────────┐ │ │ │ 工具│ │ │ │ - query_athena()││ │ │ - read_s3_object()││ │ │ - search_catalog()││ │ └───────────────────────────┘ │ └──────────────┬──────────────────┘ │ ↓ ┌─────────────────────────────────┐ │ AWS数据湖│ │ S3 |胶水|雅典娜|湖景│ └─────────────────────────────────┘
🚀 快速开始
💡 示例用法
马上就来!自然语言查询示例:
“我们有什么关于客户的表格?” → 列出胶水目录中所有与客户相关的表
“显示订单表中的示例数据” → 执行Athena查询并返回结果
“查找与2024年销售相关的所有数据集” → 跨数据目录的语义搜索
先决条件
Python 3.11+
AWS Account with Data Lake
AWS CLI configured
MCP-compatible client🤝 贡献
该项目尚处于早期开发阶段。v0.1发布后欢迎投稿!
📄 许可证
MIT许可证-请参阅许可证文件
🔗 链接
Model Context Protocol Spec
AWS SDK for Python (boto3)
Project Documentation (coming soon)📫 联系
GitHub: @ai-dataplatform-hub
Email: ai.dataplatform.io@gmail.com
Issues: Report a bug