Token导航 LogoToken导航TokenDH.com
Eval Rpg logo
AI代理未说明官方级别未说明来源级核验

Eval Rpg

MCP Server

EvalRPG Community Edition 是一个开源的对话评估工具,通过多轮对话测试AI系统的真实能力,支持动态角色生成、MCP服务器集成和全面分析。

工具数

0

提示词数

0

GitHub Stars

1

资源数

0
PythonClaude开源工具Claude

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

BrandonShar

提供方

BrandonShar

最后核验

2026/5/17 20:20

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

详细介绍

🤖 EvalRPG社区版

逐一评估您的AI代理和MCP服务器。

EvalRPG社区版是一个开源的对话评估工具,通过逼真的多回合对话而不是孤立的提示来测试人工智能系统。与传统的评估工具不同,EvalRPG模拟了真实的对话,其中代理必须维护上下文、使用工具并在多个回合中适应用户需求。

![Open Source](LICENSE) ![Python 3.12+](https://python.org) ![Streamlit](https://streamlit.io)

看看Youtube上的介绍视频!

![youtube-thumbnail](https://youtu.be/0DC10ruCuZo)

🎯 为什么要进行对话式评估?

传统的评估工具使用单次提示来测试人工智能系统,但 真正的人工智能代理通过对话工作他们需要:

  • 理解上下文 跨越多个转弯
  • 使用工具和外部服务 (MCP服务器)
  • 处理不明确的请求 并提出澄清问题
  • 保持对话流畅 以及用户体验

EvalRPG通过创建来弥合这一差距 真实的对话场景 通过不同的角色来测试你的代理的真实能力。

✨ 主要特点

🎭 动态人物角色生成

  • 人工智能生成了多样化的测试角色
  • 可定制的角色特征
  • 现实的对话开场白
  • 每次评估运行有多个角色

🔧 MCP服务器集成

  • 连接到外部工具和服务
  • 测试真实世界的代理能力
  • HTTP流媒体支持
  • 多种服务器配置

📊 综合分析

  • 成功/失败跟踪
  • 会话长度分析
  • 持续时间指标
  • 详细的对话日志

⚙️ 灵活的配置

  • 自定义完成标准
  • 可调节的对话限制
  • 多次运行以提高可靠性
  • 多种AI模型支持

🚀 入门指南

选项1:使用Streamlit托管版本

最简单的入门方法是使用托管的Streamlit版本。只需上传您的配置并开始评估!

试用EvalRPG社区版→

选项2:本地安装

先决条件

  • Python 3.12或更高版本
  • OpenAI API密钥(或兼容的API)

安装

  1. 克隆存储库:
   git clone 
   cd conversational-evals
  1. 使用uv安装依赖项(推荐):
   uv sync
  1. 运行应用程序:
   streamlit run main.py

🔄 运作原理

1️⃣ 生成人

根据您的评估需求,创建具有独特背景、目标和沟通风格的多样化对话角色。

  • 自定义角色提示
  • 自动分集
  • 真实的开场白

2.️⃣ 配置代理

使用系统说明设置您的AI代理,并连接MCP服务器以访问工具。

  • 自定义系统提示
  • MCP服务器集成
  • 模型选择

3.️⃣ 运行评估

执行多回合对话,并使用详细的成功指标和对话日志分析结果。

  • 完成标准
  • 转弯限制
  • 每个角色多次运行

📖 使用指南

设置您的第一次评估

  1. 配置您的AI模型 在侧边栏中:

- 添加API密钥 - 选择您的型号(GPT-4、Claude等) - 如果使用自定义端点,请设置基本URL

  1. 生成人物角色:

- 编写一个提示,描述要模拟的用户类型 - 指定要生成的角色数量 - 点击“生成”以创建各种测试字符

  1. 配置评估设置:

- 定义完成标准(什么是成功) - 设置最大对话次数 - 选择每个角色的运行次数

  1. 添加MCP服务器 (可选):

- 配置您的代理可以使用的外部工具 - 设置HTTP流端点 - 测试工具集成

  1. 运行评估:

- 点击“运行评估”开始测试 - 实时监控进度 - 查看详细的结果和对话日志

人物角色提示示例

Generate personas for testing a customer support chatbot for an e-commerce platform. 
Include users with different technical skill levels, various types of issues 
(billing, shipping, returns), and different communication styles (direct, verbose, confused).

完成标准示例

The conversation is successful if the agent:
1. Correctly identifies the user's issue
2. Provides a clear solution or next steps
3. Maintains a helpful and professional tone throughout
4. Uses appropriate tools when needed (e.g., order lookup, refund processing)

支持的型号

  • 任何与OpenAI兼容的API端点(OpenAI、Anthropic、LiteLLM)

MCP服务器配置

EvalRPG支持用于工具集成的模型上下文协议(MCP)服务器。在侧边栏中配置服务器,以测试代理使用外部工具和服务的能力。

📊 了解结果

跟踪指标

  • 成功率:符合完成标准的对话百分比
  • 平均转弯次数:平均对话次数
  • 持续时间:每次对话所花费的时间
  • 人物表演:按角色类型划分的成功率

会话分析

  • 带有时间戳的完整对话日志
  • 逐段分析
  • 工具使用跟踪
  • 错误识别和分类

🤝 贡献

EvalRPG社区版是开源的,欢迎投稿!无论您是在修复错误、添加功能还是改进文档,我们都希望得到您的帮助。

开发设置

git clone 
cd conversational-evals
uv sync --dev

运行测试

# Add test commands here when available

📄 许可证

此项目根据MIT许可证获得许可-请参阅 许可证 文件以获取详细信息。

🙏 致谢

📞 支持

  • 问题:在我们的网站上报告错误并请求功能 页
  • 讨论:加入对话
  • 文档:查看我们的 维基 获取详细指南

______________________________________________________________________

EvalRPG社区版 -逐一评估您的代理和MCP服务器。 🤖✨

目录标签

目录标签

PythonClaude开源工具AI测试本地部署多轮对话MCP集成性能分析

支持客户端

Claude

接入字段

传输方式(transport,传输协议)

未说明

鉴权方式(authType,认证方式)

none

工具数量(toolCount,工具数)

0

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

未说明none部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

仍需确认:installCommand

来源信息

继续浏览同类 MCP