MCP服务器基准测试工具
一个基于网络的基准测试工具,用于使用Agora Conversational AI比较两个MCP(模型上下文协议)服务器。该工具允许您测量响应延迟、跟踪代理状态并对响应质量进行评级。
特性
- 双MCP服务器测试:并排比较两个MCP服务器
- 5个可配置的问题:为一致性测试设置基准问题
- 延迟测量:
- 首次代币时间(TTFT) - 完整响应时间 - 代理状态更改跟踪
- 质量评级:以1-5颗星的评分标准对回复进行评分,并附上备注
- RTM/信号集成:使用Agora RTM通过文本发送问题
- 结果比较:服务器之间的视觉比较图
- 导出选项:将结果导出为JSON或CSV
先决条件
- Agora账户:
- 应用程序ID - 应用证书(用于生成令牌) - REST API客户ID和机密
- LLM API访问(OpenAI、Azure OpenAI等)
- TTS API访问(Microsoft Azure、ElevenLabs或OpenAI)
- 两台MCP服务器进行基准测试
设置
- 复制
.env.example查看配置选项 - 打开
index.html在现代网络浏览器中 - 填写配置:
- Agora凭据(应用程序ID、证书、REST凭据) - 通道配置 - MCP服务器1和2端点 - LLM配置 - TTS配置
- 点击“保存配置”以保存您的设置
用法
开始基准测试
- 选择服务器:选择要测试的MCP服务器(1或2)
- 启动代理:单击“启动代理”以初始化ConvoAI代理
- 发送问题:
- 使用快速按钮(Q1-Q5)发送预设问题 - 或者在输入框中键入自定义问题
- 监控指标:实时查看TTFT和响应时间
- 速率响应:每次回复后,对质量进行评分(1-5颗星)并保存
运行所有问题
点击“运行所有问题”,自动按顺序发送所有5个配置的问题。
比较结果
- 在两台MCP服务器上运行基准测试
- 切换到“比较”选项卡查看并排指标
- 将结果导出为JSON或CSV以供进一步分析
建筑
mcpbenchmark/
├── index.html # Main UI
├── .env.example # Configuration template
├── README.md # This file
└── src/
├── css/
│ └── styles.css # Modern dark theme styling
└── js/
├── AccessToken2.js # Agora token generation
├── RtcTokenBuilder2.js # RTC token builder
├── RtmTokenBuilder2.js # RTM token builder
├── pako.min.js # Compression library
├── api.js # Agora REST API client
├── conversational-ai-api.js # RTM messaging handler
├── benchmark.js # Benchmark logic & metrics
└── app.js # Main application跟踪指标
| 度量 | 描述 |
|---|---|
| TTFT(到达第一个令牌的时间) | 从问题发送到第一个响应令牌的时间 |
| 完整响应时间 | 完整响应的总时间 |
| 代理状态更改 | 跟踪听/说/静音状态 |
| 质量评分 | 用户评分质量分数(1-5) |
浏览器支持
- Chrome 80+
- 火狐75+
- Safari 13+
- 边缘80+
需要以下支持:
- ES6+JavaScript
- 网络加密API
- 获取API
- 本地存储
安全说明
- 凭据存储在浏览器LocalStorage中
- 令牌是使用您的应用证书在客户端生成的
- 永远不要共享您的应用程序证书或API密钥
- 在生产环境中使用HTTPS
故障排除
代理无法启动
- 验证所有Agora凭据是否正确
- 检查MCP服务器端点是否可访问
- 确保LLM和TTS API密钥有效
没有出现转录
- 确认RTM已连接(检查状态面板)
- 确保在代理配置中启用RTM
- 检查浏览器控制台是否有错误
指标未更新
- 确保正在跟踪代理状态更改
- 检查对话式AI事件是否正在触发
许可证
此工具用于基准测试和测试目的。
