   
运动员表现分析平台-技术展示
一个展示先进LLM集成、RAG系统和现代全栈架构模式的生产应用程序。
🎯 项目概述
该存储库展示了生产应用程序的技术架构和实施模式,该应用程序集成了:
- LLM集成 (Anthropic Claude)使用结构化工具调用
- RAG系统 基于向量嵌入的(检索增强生成)
- 类似MCP的架构 实现关注点的清晰分离
- 现代全栈 使用Next.js、TypeScript和PostgreSQL进行开发
备注:此存储库包含用于showcaase目的的经过净化的代码示例和架构文档。完整的生产应用程序仍然是私有的,以保护知识产权。
🏗️ 建筑亮点
MCP类工具集成模式
一种自定义架构模式,模仿模型上下文协议(MCP),在LLM通信逻辑和数据功能之间提供清晰的分离。
主要优势:
- 用于所有LLM工具调用的单一网关
- 轻松迁移到真正的MCP服务器
- 可扩展的工具注册表模式
- 全面的错误处理
RAG实施
一个使用向量嵌入和语义搜索的生产就绪RAG系统。
主要特点:
- 用于高级文本提取的Google文档AI(表单解析器、布局解析器)
- 大文件(>15页或>4MB)的自动PDF分割
- OpenAI嵌入(文本嵌入3-small)
- pgvector用于PostgreSQL向量相似性搜索
- Vercel Blob存储用于文档持久化
- 重新处理单个文档以避免超时问题
- 可靠性回退机制(unpdf)
- 自动知识库集成
- 基于相似性评分的Top-K检索
架构说明:
- RAG用于一般知识、研究文章和上下文解释
- 精确的数字/参考数据存储在PostgreSQL(不是RAG)中,用于确定性查询
全栈设计
现代web应用程序架构,具有:
- 前端:Next.js 14、React 18、TypeScript、顺风CSS
- 后端:Next.js API路由,服务器操作
- 数据库:PostgreSQL(Neon),带Prisma ORM,pgvector扩展
- AI/ML:人类学Claude API,OpenAI嵌入
- 文档处理:谷歌文档AI,用于pdf分割的pdf库
- 存储:Vercel Blob存储用于文档持久化
- 部署:Vercel
📚 文档
💻 代码示例
展示关键模式的山宁泰代码示例:
🛠️ 主要技术特点
1.自定义工具注册表模式
LLM通信和数据功能之间的清晰分离:
// Extensible tool registry
const TOOL_REGISTRY = {
'analyze_data': {
description: 'Comprehensive data analysis tool',
handler: async (params) => { /* ... */ }
}
}2.带矢量搜索的RAG系统
生产就绪检索增强生成:
- 矢量嵌入生成
- 语义相似度搜索
- 知识库集成
- LLM的上下文检索
3.结构化LLM输出
带验证的类型安全JSON生成:
- 架构验证
- 错误处理
- 数据完整性措施
- 可靠的结构化输出
4.生产就绪模式
- 全面的错误处理
- 日志记录与监视
- TypeScript的类型安全
- 可扩展体系结构
💡 技术见解
为什么是MCP式架构?
- 提供清晰的关注点分离
- 使LLM集成易于维护
- 允许轻松添加新工具
- 便于迁移到真正的MCP服务器
RAG实施决策
- 为了简单起见,选择pgvector而不是外部向量数据库
- OpenAI的可靠性嵌入
- Top-K检索性能
- 与现有PostgreSQL基础架构集成
LLM集成挑战
- 结构化输出可靠性
- 数据完整性实施
- 错误处理和回退
- 令牌优化
🚀 主要成就
- ✅ 为LLM工具集成实现了类似MCP的自定义架构
- ✅ 利用向量嵌入构建生产RAG系统
- ✅ 为多模态分析设计可扩展的数据模型
- ✅ 创建了具有引用要求的循证分析引擎
- ✅ 部署了性能优化的生产应用程序
📄 许可证
技术展示-代码示例用于演示和教育目的。
备注:此存储库包含经过净化的代码示例和架构文档。完整的生产应用程序仍然是私有的,以保护知识产权。
______________________________________________________________________
连接
- 领英:http://linkedin.com/in/david-elliott-6304555a
- 电子邮件:ellttdave218@gmail.com
