通用AI MCP服务器v3.0
一个全面的MCP(模型上下文协议)服务器,提供对多个AI提供商和模型的智能访问,包括 GPT-5, Grok-4, 双子座2.5, 希腊,以及 当地Ollama模型 -凭借先进的布线、成本优化和25多种专用工具。
🆕 v3.0中的新功能: 通过xAI Grok、Google Gemini、Groq推理、成本跟踪和所有提供商的智能模型路由提供多提供商支持。
🚀 主要特点
🌐 通用多提供商支持
- Azure OpenAI:GPT-5、GPT-5聊天、GPT-4o、o3、o1预览、o1迷你、DALL-E 3
- OpenAI Direct:所有可直接访问API的OpenAI模型
- xAI Grok:Grok-4(实时搜索),Grok-3-Mini,Grok-2-Image
- 谷歌人工智能:Gemini 2.5 Pro/Flash/Flash思维(1M上下文)
- 希腊:Llama和GPT模型的超快速推理(1500+令牌/秒)
- 没有:完全隐私的本地模型(llama3.2、codellama、mistral、qwen2.5)
🧠 智能模型路由
- 智能选择:根据任务复杂性、成本、速度和质量要求自动选择最佳模型
- 多策略路由:成本优化、速度优化、质量第一、隐私第一策略
- 后备链:提供程序之间的自动故障转移以提高可靠性
- 实时优化:从使用模式中学习以改进选择
💰 高级成本管理
- 实时成本跟踪:监控所有供应商的支出
- 预算控制:每日/每月支出限额和警报
- 成本优化:在适当的时候自动路由到具有成本效益的型号
- 使用情况分析:包含优化建议的详细报告
⚡ 性能和能力
- 超快速响应:Groq基础设施的次秒级第一代币
- 海量上下文:Gemini型号最多100万个代币
- 实时搜索:Grok-4在线搜索
- 多模式支持:跨提供商的图像分析和生成
- 会话管理:具有自动清理功能的持续对话
🛡️ 隐私和安全
- 隐私级别:公共、私人和仅本地处理选项
- 数据保留:可配置的会话和数据保留策略
- 本地处理:通过Ollama集成实现完全隐私
- 安全的API处理:API密钥管理的最佳实践
📊 模型比较矩阵
| 提供商 | 型号 | 上下文 | 速度 | 成本/1M | 最适合 | 功能 |
|---|---|---|---|---|---|---|
| Azure/OpenAI | GPT-5 | 272k | 慢 | $10/30 | 复杂推理 | 文本、代码、推理 |
| Azure/OpenAI | GPT-5-Chat | 128k | 快速 | 5美元/15美元 | 对话 | 文本、多模式、功能 |
| Azure/OpenAI | GPT-4o | 128k | 快速 | 5美元/15美元 | 多模式 | 文本、视觉、功能 |
| 扩展应用识别 | Grok-4 | 128k | 中等 | 3美元/15美元 | 实时研究 | 文本、搜索、推理 |
| 扩展应用识别 | Grok-3-Mini | 32k | 快速 | 0.30美元/0.50美元 | 预算任务 | 文本,基本推理 |
| 谷歌 | Gemini 2.5 Pro | 1M | 中等 | 2.50美元/10美元 | 大型环境 | 多模式推理 |
| 谷歌 | Gemini 2.5 Flash | 1M | 非常快 | 0.075美元/0.30美元 | 速度+质量 | 多模式,快速 |
| 希腊 | Llama 3.3 70B | 131k | 超高速 | 0.59美元/0.79美元 | 实时聊天 | 文本,代码 |
| 希腊 | GPT-OSS 120B | 32k | 超高速 | 1.25美元/1.25美元 | 质量+速度 | 文本、推理 |
| 没有 | Llama 3.2 | 131k | 快速 | 免费 | 私人/本地 | 文本、代码、本地 |
| 没有 | 代码Llama | 16k | 快速 | 免费 | 代码生成 | 本地代码 |
| 没有 | Mistral 7B | 32k | 非常快 | 免费 | 高效聊天 | 文本,多语言 |
| 没有 | Qwen 2.5 | 131k | 中等 | 自由 | 高级推理 | 文本、代码、推理 |
📦 安装
- 克隆存储库:
git clone https://github.com/yourusername/gpt5-mcp-agent.git
cd gpt5-mcp-agent- 安装依赖项:
npm install- 构建TypeScript代码:
npm run build⚙️ 配置
服务器同时支持这两种功能 Azure OpenAI 和 标准OpenAI API.通过中的环境变量进行配置 .env:
选项1:Azure OpenAI
# Provider Selection
API_PROVIDER=azure
# Azure OpenAI Configuration
AZURE_OPENAI_API_KEY=your_api_key_here
AZURE_OPENAI_ENDPOINT=https://your-resource.openai.azure.com/
AZURE_OPENAI_API_VERSION=2025-01-01-preview
# Azure Deployment Names (customize to match your deployments)
AZURE_OPENAI_DEPLOYMENT_GPT5=your-gpt5-deployment-name
AZURE_OPENAI_DEPLOYMENT_GPT5_CHAT=your-gpt5-chat-deployment-name选项2:标准OpenAI API
# Provider Selection
API_PROVIDER=openai
# OpenAI Configuration
OPENAI_API_KEY=your_openai_api_key_here
# Optional: Custom base URL (leave empty for default)
OPENAI_BASE_URL=
# Optional: Organization ID
OPENAI_ORG_ID=
# OpenAI Model Names
OPENAI_MODEL_GPT5=gpt-5
OPENAI_MODEL_GPT5_CHAT=gpt-5-chat选项3:通用多提供商设置
# Multiple Providers Enabled
PROVIDERS_ENABLED=azure,xai,google,groq,ollama
# xAI Grok Configuration
XAI_API_KEY=your_xai_api_key_here
XAI_ENABLE_LIVE_SEARCH=true
XAI_SEARCH_DEPTH=deep
# Google AI Configuration
GOOGLE_AI_API_KEY=your_google_api_key_here
GOOGLE_PROJECT_ID=your_project_id
GOOGLE_LOCATION=us-central1
# Groq Configuration
GROQ_API_KEY=your_groq_api_key_here
GROQ_PRIORITY_TIER=paid
# Ollama Local Models
OLLAMA_HOST=http://localhost:11434
OLLAMA_AUTO_INSTALL=true
OLLAMA_DEFAULT_MODEL=llama3.2通用设置(所有提供程序)
# Model Selection
DEFAULT_CHAT_MODEL=gpt-5-chat # For fast conversations
DEFAULT_REASONING_MODEL=gpt-5 # For complex analysis
ENABLE_MODEL_ROUTING=true # Auto-select optimal model
# GPT-5-Chat Settings (Traditional Chat Model)
DEFAULT_TEMPERATURE=0.7 # Controls randomness (0.0-2.0)
DEFAULT_TOP_P=1.0 # Nucleus sampling
DEFAULT_PRESENCE_PENALTY=0 # Encourages new topics (-2.0 to 2.0)
DEFAULT_FREQUENCY_PENALTY=0 # Reduces repetition (-2.0 to 2.0)
# GPT-5 Reasoning Model Settings
DEFAULT_REASONING_EFFORT=medium # minimal, low, medium, high
DEFAULT_VERBOSITY=medium # low, medium, high
# Performance Settings
MAX_COMPLETION_TOKENS=128000 # Max tokens for responses
ENABLE_STREAMING=true # Enable streaming for GPT-5-Chat
SESSION_TIMEOUT_MINUTES=60 # Session cleanup interval🛠️ 可用工具
智能路由
gpt5_smart-基于查询复杂性智能路由到最佳模型
GPT-5-聊天工具(快速且富有创意)
gpt5_chat_fast-具有全参数控制的快速对话式人工智能gpt5_chat_creative-针对创意写作进行了优化
GPT-5推理工具(深度分析)
gpt5_reasoning-复杂问题的高级推理gpt5_chain_of_thought-逐步解决问题
专用工具
gpt5_code-代码分析、审查、优化、调试gpt5_code_generate-根据规范生成代码gpt5_design-UI/UX、架构、数据库设计gpt5_write-生成各种类型的文本内容gpt5_brainstorm-创意生成gpt5_translate-多语言翻译gpt5_summarize-文本摘要
会话管理
gpt5_conversation-带上下文的多回合对话gpt5_list_sessions-查看活动会话gpt5_clear_sessions-清除所有会话
通用工具(v3.0中的新功能)
ai_smart-跨所有提供商的通用智能路由ai_search-与多个提供商进行实时网络搜索ai_multimodal-跨多个提供商的图像分析ai_image_generate-使用提供商选择生成图像ai_compare_models-并排模型比较ai_best_for-获取特定任务的模型建议ai_usage_report-全面的成本和使用分析ai_benchmark_models-跨模型的性能分析ai_model_recommendations-特定用例的模型建议
实用工具
gpt5_explain_routing-解释模型选择逻辑gpt5_model_info-获取模型功能
💡 使用示例
智能自动路由
{
"tool": "gpt5_smart",
"parameters": {
"message": "Analyze the algorithmic complexity of this sorting algorithm",
"autoRoute": true
}
}
// Automatically routes to GPT-5 for complex analysis带温度控制的快速聊天
{
"tool": "gpt5_chat_fast",
"parameters": {
"message": "Write a creative story about AI",
"temperature": 0.9,
"topP": 0.95,
"presencePenalty": 0.3
}
}带推理的代码审查
{
"tool": "gpt5_code",
"parameters": {
"code": "function quickSort(arr) { ... }",
"task": "review",
"language": "javascript",
"reasoningEffort": "high"
}
}系统设计
{
"tool": "gpt5_design",
"parameters": {
"brief": "Design a scalable microservices architecture for e-commerce",
"type": "architecture",
"depth": "deep",
"constraints": ["AWS cloud", "100k concurrent users", "Sub-second response"]
}
}多回合对话
{
"tool": "gpt5_conversation",
"parameters": {
"message": "Let's discuss machine learning",
"model": "gpt-5-chat",
"temperature": 0.7
}
}当地私人模特(Ollama)
{
"tool": "ai_smart",
"parameters": {
"message": "Analyze this private code locally",
"forceModel": "llama3.2",
"preferredModel": "llama3.2"
}
}
// Automatically uses local Ollama for complete privacy通用模型比较
{
"tool": "ai_benchmark_models",
"parameters": {
"testPrompts": ["Explain quantum computing", "Write a Python function"],
"models": [
{"provider": "azure", "model": "gpt-5"},
{"provider": "xai", "model": "grok-4"},
{"provider": "ollama", "model": "llama3.2"}
]
}
}🎯 模型选择策略
服务器使用基于查询分析的智能路由:
选择GPT-5-Chat用于:
- 快速对话和问答
- 创意写作任务
- 头脑风暴会议
- 一般协助
- 实时应用
选择GPT-5用于:
- 解决复杂问题
- 代码分析和生成
- 证明
- 系统设计
- 多步推理
- 技术文件
🔧 参数优化指南
GPT-5-聊天温度设置
- 0.0-0.3:技术文件、事实答复
- 0.4-0.7:平衡对话、一般协助
- 0.8-1.2:创意写作、头脑风暴
- 1.3-2.0:极具创意、实验性的内容
GPT-5推理努力水平
- 最小:快速分析,简单问题
- 低:具有基本推理的标准分析
- 中等:深入分析,详细推理
- 高:详尽分析,综合推理
🚀 运行服务器
Windows(批处理文件)
start.bat手动启动
npm start发展模式
npm run dev🔌 Claude代码集成
添加到您的Claude代码配置中:
视窗 (%APPDATA%\Claude\claude_desktop_config.json):
{
"mcpServers": {
"gpt5-agent": {
"command": "node",
"args": ["C:\\path\\to\\gpt5-mcp-agent\\dist\\index.js"]
}
}
}macOS/Linux (~/.config/Claude/claude_desktop_config.json):
{
"mcpServers": {
"gpt5-agent": {
"command": "node",
"args": ["/path/to/gpt5-mcp-agent/dist/index.js"]
}
}
}将路径替换为实际安装目录。添加配置后,完全重新启动Claude Code。
📊 性能特征
| 用例 | 推荐模型 | 设置 | 预期延迟 |
|---|---|---|---|
| 快速聊天 | GPT-5-聊天 | 时间:0.7 | 1-3秒 |
| 创意写作 | GPT-5-聊天 | 时间:0.9-1.2 | 1-3秒 |
| 代码生成 | GPT-5 | 工作量:高 | 5-15秒 |
| 复杂分析 | GPT-5 | 努力:高,冗长:高 | 10-30秒 |
| 简单问答 | GPT-5-聊天 | 临时:0.3 | 1-2秒 |
🐛 故障排除
常见问题
- “max_tokens太大”错误
- 已在v2.0中修复:GPT-5-Chat最大输出现在正确限制为16384个令牌 - 服务器自动执行特定于模型的令牌限制 - 覆盖 maxTokens 如果需要,参数(将限制在模型极限)
- “不支持的参数”错误
- GPT-5推理模型不支持温度 - GPT-5-Chat不支持推理_努力 - 服务器自动处理参数路由
- 反应缓慢
- 推理模型具有更高的延迟 - 减少推理_努力以获得更快的响应 - 使用快速模型(Groq、GPT-4o)满足实时需求
- 模型选择问题
- 检查 gpt5_explain_routing 理解选择逻辑 - 使用 forceModel 用于覆盖自动路由的参数 - 调整 ENABLE_MODEL_ROUTING 在.env中
- 会话管理
- 会话在60分钟后自动过期 - 使用 gpt5_clear_sessions 重置 - 检查 SESSION_TIMEOUT_MINUTES 在.env中
🔒 安全说明
- API密钥存储在
.env(不包括在版本控制中) - 支持Azure和OpenAI API提供商
- 自动会话清理可防止内存泄漏
- 对错误消息进行清理,以避免暴露敏感数据
- 所有请求均已Zod模式验证
📈 高级功能
流媒体支持
GPT-5-Chat支持流媒体实时响应。启用 stream: true 参数。
智能上下文管理
会话自动管理对话历史,将最相关的消息保持在令牌限制内。
模型回退
如果模型失败,系统可以自动回退到其他模型。
🛠️ 发展
项目结构
gpt5-agent/
├── src/
│ ├── index.ts # Main server with all tools
│ ├── gpt5-client.ts # Enhanced client with dual model support
│ ├── model-router.ts # Intelligent model selection logic
│ └── types.ts # TypeScript definitions
├── dist/ # Compiled JavaScript
├── .env # Configuration
└── package.json建筑
npm run build测试
# Test build
debug.bat
# Test server startup
test-server.bat📝 许可证
MIT许可证
🤝 贡献
欢迎投稿!请确保:
- TypeScript类型定义正确
- 错误处理全面
- 文档已更新
- 代码遵循现有模式
📚 资源
🎉 版本历史记录
v3.0.0(当前)
- 通用多提供商支持:Azure、OpenAI、xAI、谷歌、Groq、Ollama
- 6人工智能提供商:20多个具有智能路由的型号
- 高级路由算法:多标准决策分析,情境感知选择
- 完整的隐私选项:配备自动安装功能的当地Olama车型
- 成本优化:实时跟踪、预算控制、使用分析
- 模型比较工具:绩效基准和建议
- 25+专用工具:通用工具+完全向后兼容
- 增强功能:实时搜索、图像生成、多模式支持
v2.0.0版本
- 完全支持双模式(GPT-5+GPT-5-Chat)
- 智能模型路由
- 全面的参数支持
- 17种专用工具
- 流媒体支持
- 增强的错误处理
v1.0.0
- 支持GPT-5的初始版本
- 基本对话工具
- 会话管理
