Token导航 LogoToken导航TokenDH.com
Whisper Speech Recognition MCP Server logo
音视频stdio官方级别未说明来源级核验

Whisper Speech Recognition MCP Server

MCP Server

基于Faster Whisper的高性能语音识别MCP服务器,提供高效的音频转录功能。

工具数

0

提示词数

0

GitHub Stars

0

资源数

0
语音识别多模型支持PythonClaude批量处理Claude DesktopClaudeClineVS Code

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

Jacobngai

提供方

Jacobngai

最后核验

2026/5/17 20:22

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

命令预览

pip install -r requirements.txt

详细介绍

耳语语音识别MCP服务器

______________________________________________________________________

中文文档

基于Faster Whisper的高性能语音识别MCP服务器,提供高效的音频转录功能。

特性

  • 与Faster Whisper集成,实现高效的语音识别
  • 批处理加速,提高转录速度
  • 自动CUDA加速(如果可用)
  • 支持多种型号尺寸(从小到大-v3)
  • 输出格式包括VTT字幕、SRT和JSON
  • 支持批量转录文件夹中的音频文件
  • 模型实例缓存以避免重复加载
  • 基于GPU内存的动态批量大小调整

安装

依赖项

  • Python 3.10+
  • 更快的耳语>=0.9.0
  • 火炬==2.6.0+cu126
  • 闪电==2.6.0+cu126
  • mcp\[cli\]>=1.2.0

安装步骤

  1. 克隆或下载此存储库
  2. 创建并激活虚拟环境(推荐)
  3. 安装依赖项:
pip install -r requirements.txt

PyTorch安装指南

根据您的CUDA版本安装相应版本的PyTorch:

  • 第12.6条:
  pip install torch==2.6.0 torchvision==0.21.0 torchaudio==2.6.0 --index-url https://download.pytorch.org/whl/cu126
  • 第12.1条:
  pip install torch==2.5.1 torchvision==0.20.1 torchaudio==2.5.1 --index-url https://download.pytorch.org/whl/cu121
  • CPU版本:
  pip install torch==2.6.0 torchvision==0.21.0 torchaudio==2.6.0 --index-url https://download.pytorch.org/whl/cpu

您可以通过以下方式检查CUDA版本 nvcc --versionnvidia-smi.

用法

启动服务器

在Windows上,只需运行 start_server.bat.

在其他平台上,运行:

python whisper_server.py

配置Claude桌面

  1. 打开Claude Desktop配置文件:

- 窗户: %APPDATA%\Claude\claude_desktop_config.json - macOS: ~/Library/Application Support/Claude/claude_desktop_config.json

  1. 添加Whisper服务器配置:
{
  "mcpServers": {
    "whisper": {
      "command": "python",
      "args": ["D:/path/to/whisper_server.py"],
      "env": {}
    }
  }
}
  1. 重新启动克劳德桌面

可用工具

服务器提供以下工具:

  1. 获取模式信息 -获取Whisper可用型号的信息
  2. 转录 -转录单个音频文件
  3. 批处理_订阅 -批量转录文件夹中的音频文件

性能优化提示

  • 使用CUDA加速显著提高了转录速度
  • 批处理模式对大量短音频文件更有效
  • 批量大小根据GPU内存大小自动调整
  • 使用VAD(语音活动检测)过滤可以提高长音频的准确性
  • 指定正确的语言可以提高转录质量

本地测试方法

  1. 使用MCP检查器进行快速测试:
mcp dev whisper_server.py
  1. 使用Claude Desktop进行集成测试
  1. 使用命令行直接调用(需要mcp\[cli\]):
mcp run whisper_server.py

错误处理

服务器实现了以下错误处理机制:

  • 音频文件存在性检查
  • 模型加载失败处理
  • 转录过程异常捕获
  • GPU内存管理
  • 批处理参数自适应调整

项目结构

  • whisper_server.py:主服务器代码
  • model_manager.py:Whisper模型加载和缓存
  • audio_processor.py:音频文件验证和预处理
  • formatters.py:输出格式(VTT、SRT、JSON)
  • transcriber.py:核心转录逻辑
  • start_server.bat:Windows启动脚本

许可证

麻省理工学院

致谢

这个项目是在这些令人惊叹的人工智能工具和模型的帮助下开发的:

特别感谢这些令人难以置信的工具及其背后的团队。

目录标签

目录标签

语音识别多模型支持PythonClaude批量处理本地部署音频转录CUDA加速

支持客户端

Claude DesktopClaudeClineVS Code

接入字段

传输方式(transport,传输协议)

stdio

鉴权方式(authType,认证方式)

none

部署方式(deploymentType,部署类型)

local-only

工具数量(toolCount,工具数)

0

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

stdiononelocal-only

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

来源信息

继续浏览同类 MCP