使用会话接口进行数据迁移
传统的数据迁移到云端通常采用升降式方法,需要大量的技术专长。虽然领域专家对数据的商业价值有深入的了解,但他们经常面临获取迁移特定数据集以生成见解所需的必要工具或技术专长的挑战。
该项目提出了一种模式,通过利用模型上下文协议(MCP)服务器和Microsoft Fabric,使领域专家能够通过会话接口执行选择性数据迁移。这种方法将数据迁移从技术障碍转变为直观、业务用户友好的过程,在保持数据治理的同时加快了洞察时间。
特性
- 会话数据发现:使用自然语言识别和探索数据工件
- 无缝云迁移:保持数据完整性的自动化迁移过程
- 数据整合:将多个数据源合并为统一的数据集
- 交互式查询:通过对话界面查询和分析迁移的数据
建筑
系统架构展示了数据迁移和会话交互的端到端流程:
过程
先决条件
- 访问JDBC兼容的源数据库
- 访问Microsoft Fabric工作区以创建Lakehouse和数据代理
组织
- 设置源数据库:可以使用与JDBC兼容的数据库(如Oracle或PostgreSQL)作为源。中提供了一个脚本,用于在Oracle数据库中创建包含一些示例数据的表 scripts/createemployee_table.sql
- 为JDBC设置Quarkus MCP服务器:请按照以下设置说明进行操作 Quarkus MCP JDBC服务器 配置JDBC MCP服务器以实现数据库连接。如果您将VS Code与GitHub Copilot一起用作MCP客户端,请在VS Code中设置配置。
- 下载并配置OneLake文件资源管理器:从下载OneLake文件资源管理器 Microsoft下载中心 并将其配置为连接到您的Microsoft Fabric工作区。这将实现本地环境和Microsoft Fabric Lakehouse之间的无缝数据移动。
用法
- 数据发现:使用您的MCP客户端(例如使用GitHub Copilot或Claude Desktop的VS Code)通过会话查询来探索数据源。首先问一些问题,比如“数据库中有哪些表可用?”。如果您使用提供的脚本创建了employee表,则表结构如下:
- 合并数据集:一旦信息在Fabric Lakehouse中可用,将其与其他数据工件相结合,以产生更深入的见解。如果您使用的是员工数据集,则可以在中找到包含部门位置的文件 files/deptloc.csv 其可用于将员工链接到位置。在Fabric Lakehouse中,桌子看起来像这样:
- 构建对话界面:要将合并的数据集作为对话界面公开,以便领域专家用自然语言查询,请使用中提供的说明在Microsoft Fabric中创建数据代理 创建结构数据代理。如果您使用的是上述数据集,则可以使用中提到的示例说明 数据代理说明。此处显示了此屏幕截图:
- 自然语言查询:领域专家现在可以使用自然语言查询合并的数据集。在下面的示例中,向Agent提出了一个问题,该问题需要组合2个表中的信息。该图像包含代理的输出,以及它在幕后生成的连接表的SQL查询。
结论
这种模式展示了会话接口如何改变传统的数据迁移过程,使领域专家无需深厚的技术专长即可访问。通过将MCP服务器的强大功能与Microsoft Fabric的云原生数据平台相结合,组织可以:
- 数据迁移民主化:使业务用户能够通过自然语言交互识别、提取和迁移相关数据资产
- 维护数据治理:实施选择性迁移策略,排除敏感信息,同时保留分析价值
- 加快洞察时间:降低整合云中多个来源的数据所需的复杂性和时间
- 启用自助服务分析:为领域专家提供会话界面,以便在没有SQL知识的情况下查询和分析整合的数据集
