自信的AI MCP服务器
   
Confident AI MCP服务器将AI驱动的工具连接到 自信的AI,一个评估、观察和迭代人工智能质量的平台。它使您可以直接从编辑器完全控制您的资源:
- 云评估和指标收集
- 评估数据集
- 及时的版本控制和管理
- 生产跟踪和可观察性
- 人工注释和反馈
对于用户 DeepEval,Confident AI也是您评估结果的原生后端和持久层。此MCP服务器使您能够通过将所有数据直接带入Cursor和Claude Code等工具来迭代您的AI应用程序。
\[!警告\] 此MCP服务器当前处于 测试版。我们邀请大家尝试一下,但也要联系 自信的AI团队 在这样做之前,要避免功能上的任何意外。
用例
专为希望在Cursor、Claude Code和Windsurf等编辑器中更快地迭代AI应用程序的开发人员而设计,从简单的查询到完全自动化的改进工作流程:
- 10倍于你的迭代速度。 运行一个eval,检查一组提示是否更好——在一个连续的工作流中,而不是分散在工具中。过去需要一个小时的标签切换,现在只需要一次对话。
- 自动从评估结果转到行动计划。 你的人工智能助手可以提取评估结果,读取失败的原因,并起草下一步改进的计划——不需要手动分析。
- 使用生产跟踪进行迭代。 提取跟踪,查看输入和输出的内容,阅读用户所说的内容,并在其他人注意到之前修复它。
- 让人类的反馈推动你的下一次迭代。 提取您的团队在生产跟踪上留下的注释数据,并让您的AI助手使用它来决定修复什么以及如何修复。
每次您离开编辑器检查eval结果、调整仪表板中的提示或查找团队注释时,您都会失去上下文和迭代速度。
这与平台有何不同?
自信的AI有一个完整的 web用户界面 在那里你可以用鼠标完成所有这些。此MCP服务器与您的编辑器访问的平台相同。想想:AWS web控制台与AWS CLI——相同的资源,不同的界面。
服务器说话 模型上下文协议(MCP),因此任何兼容的客户端都可以开箱即用。web UI不会去任何地方。这只是另一种进入方式。
跃进
- 光标 · 克劳德代码(或桌面) · 帆板运动 · 在本地运行
先决条件
- A. 自信的人工智能API密钥.
- MCP兼容客户端-- 光标, 克劳德, 帆板运动或支持模型上下文协议的任何其他客户端。
快速启动
Confident AI为您托管MCP服务器。选择您的地区:
| 区域 | MCP服务器URL |
|---|---|
| 美国(默认) | https://mcp.confident-ai.com/mcp |
| 欧盟 | https://eu.mcp.confident-ai.com/mcp |
| AU | https://au.mcp.confident-ai.com/mcp |
| 自托管 | 使用您自己的部署URL |
\[!提示\] 以下示例使用 美国 服务器URL。对于其他区域,请交换URL: - 欧盟:https://eu.mcp.confident-ai.com/mcp- AU:https://au.mcp.confident-ai.com/mcp- 自托管/本地部署: 如果你正在运行自己的Confident AI实例,你可以自己运行这个MCP服务器,并将其指向你的部署。看 在本地运行服务器 有关设置说明。
🖥️ 光标
将以下内容添加到您的 .cursor/mcp.json 文件:
{
"mcpServers": {
"confident-ai": {
"url": "https://mcp.confident-ai.com/mcp",
"headers": {
"Authorization": "Bearer "
}
}
}
}🤖 克劳德代码(或桌面)
克劳德代码 --在终端中运行以下命令:
claude mcp add --transport sse confident-ai https://mcp.confident-ai.com/mcp --header "Authorization: Bearer "克劳德桌面 --将以下内容添加到您的 claude_desktop_config.json 文件:
{
"mcpServers": {
"confident-ai": {
"command": "npx",
"args": [
"-y",
"mcp-remote",
"https://mcp.confident-ai.com/mcp",
"--header",
"Authorization: Bearer "
]
}
}
}🏄 帆板运动
将以下内容添加到您的Windsurf MCP配置中:
{
"mcpServers": {
"confident-ai": {
"serverUrl": "https://mcp.confident-ai.com/mcp",
"headers": {
"Authorization": "Bearer "
}
}
}
}🛠️ 在本地运行服务器
如果您是自托管或为此项目做出贡献,则可以从源代码运行服务器。
先决条件: Python>=3.12, 诗歌
poetry install
uv run server.py服务器将于启动 http://0.0.0.0:8081 具有两个端点:
| 端点 | 方法 | 描述 |
|---|---|---|
/mcp | MCP客户端的GET | SSE连接端点 |
/messages | POST | 工具执行的消息传递端点 |
两个端点都需要 Bearer 令牌在 Authorization 标题(你的 自信的人工智能API密钥).
在本地运行时,将MCP客户端指向 http://localhost:8081/mcp 而不是上面的托管URL。
要改为在stdio模式下运行(对于通过stdin/stdout通信的MCP客户端),请取消注释 server.py:
if __name__ == "__main__":
mcp.run(transport="stdio")配置
\[!注意\] 本节仅适用于以下情况 在本地运行服务器.如果您正在使用托管服务器,那么您唯一需要的就是上面快速启动配置中的API密钥。
服务器是通过环境变量配置的。您可以在 .env 项目根目录中的文件。
| 变量 | 描述 | 默认值 |
|---|---|---|
CONFIDENT_API_KEY | 您自信的AI API密钥 | 必需 |
CONFIDENT_ENVIRONMENT | LOCAL, PROD,或 ON_PREM | LOCAL |
CONFIDENT_REGION | US, EU,或 AU (仅在以下情况下使用 CONFIDENT_ENVIRONMENT=PROD) | US |
CONFIDENT_BACKEND_LOCAL_URL | 本地开发的后端URL | -- |
CONFIDENT_BACKEND_US_PROD_URL | 美国生产后端URL | -- |
CONFIDENT_BACKEND_EU_PROD_URL | 欧盟生产后端URL | -- |
CONFIDENT_BACKEND_AU_PROD_URL | AU生产后端URL | -- |
CONFIDENT_BACKEND_ON_PREM_URL | 本地后端URL(需要时 CONFIDENT_ENVIRONMENT=ON_PREM) | — |
可用工具
Prompts — 7 tools
使用完整版本控制(pull、push、version和interpole)管理提示模板。
| 工具 | 说明 |
|---|---|
pull_prompt | 按别名、版本、标签或提交哈希获取提示 |
push_prompt | 在Confident AI上创建或更新提示模板 |
interpolate_prompt | 通过用值替换占位符在本地呈现提示模板 |
create_prompt_version | 为特定的提示提交分配版本字符串 |
list_prompt_versions | 列出提示的所有正式版本 |
list_prompt_commits | 列出提示的完整提交历史记录 |
list_prompts | 列出项目中的所有提示 |
Datasets — 2 tools
提取评估数据集,用于本地测试运行或代理工作流。
| 工具 | 说明 |
|---|---|
pull_dataset | 按别名获取数据集(单圈或多圈) |
list_datasets | 列出项目中的所有数据集 |
Evaluate — 2 tools
触发云评估并模拟多回合对话。
| 工具 | 说明 |
|---|---|
run_llm_evals | 根据度量集合对一批测试用例运行云评估 |
simulate_conversation | 使用场景和预期结果模拟多回合对话的下一回合 |
Traces, Threads, and Spans — 9 tools
浏览、检查和评估LLM管道各个级别的生产可观察性数据。
| 工具 | 说明 |
|---|---|
list_traces | 列出跟踪,并按环境、时间范围和排序顺序进行筛选 |
get_trace | 获取特定跟踪的完整详细信息,包括所有跨度 |
list_threads | 列出具有过滤和分页功能的对话线程 |
get_thread | 获取线程的完整详细信息,包括所有跟踪和线程级指标 |
list_spans | 列表跨度按类型、错误状态、提示版本等进行筛选 |
get_span | 获取跨度的完整详细信息,包括I/O、成本、指标和注释 |
evaluate_trace | 在特定跟踪上触发云评估 |
evaluate_thread | 在对话线程上触发云评估 |
evaluate_span | 在特定跨度上触发云评估 |
Annotations — 4 tools
创建和管理关于跟踪、跨度和线程的人工反馈。
| 工具 | 说明 |
|---|---|
list_annotations | 列出注释,并按目标、类型和评级范围进行筛选 |
get_annotation | 获取特定注释的完整详细信息 |
create_annotation | 在轨迹、跨度或线程上创建新注释(拇指评级或星级) |
update_annotation | 更新现有注释的评级、解释或预期输出 |
Test Runs — 2 tools
检查过去的评估运行及其结果。
| 工具 | 说明 |
|---|---|
list_test_runs | 列出测试运行,并按状态、时间范围和多回合类型进行筛选 |
get_test_run | 获取测试运行的完整细节,包括每个测试用例的度量分数和推理 |
Metric Collections — 1 tool
在触发评估之前发现可用的度量集合。
| 工具 | 说明 |
|---|---|
list_metric_collections | 列出所有指标集合,包括其指标和阈值 |
公共端点
\[!小心\] 主办 /mcp 端点严格用于内部开发和实验使用。 它不是为公众消费而设计的。 API及其底层数据结构不稳定,可能随时更改、中断更新或删除,恕不另行通知。不要构建生产应用程序,也不要依赖此公共端点进行任何关键工作流。许可证
该项目根据以下条款获得许可 MIT许可证.
