耳语语音识别MCP服务器
______________________________________________________________________
中文文档
基于Faster Whisper的高性能语音识别MCP服务器,提供高效的音频转录功能。
特性
- 与Faster Whisper集成,实现高效的语音识别
- 批处理加速,提高转录速度
- 自动CUDA加速(如果可用)
- 支持多种型号尺寸(从小到大-v3)
- 输出格式包括VTT字幕、SRT和JSON
- 支持批量转录文件夹中的音频文件
- 模型实例缓存以避免重复加载
- 基于GPU内存的动态批量大小调整
安装
依赖项
- Python 3.10+
- 更快的耳语>=0.9.0
- 火炬==2.6.0+cu126
- 闪电==2.6.0+cu126
- mcp\[cli\]>=1.2.0
安装步骤
- 克隆或下载此存储库
- 创建并激活虚拟环境(推荐)
- 安装依赖项:
pip install -r requirements.txtPyTorch安装指南
根据您的CUDA版本安装相应版本的PyTorch:
- 第12.6条:
pip install torch==2.6.0 torchvision==0.21.0 torchaudio==2.6.0 --index-url https://download.pytorch.org/whl/cu126- 第12.1条:
pip install torch==2.5.1 torchvision==0.20.1 torchaudio==2.5.1 --index-url https://download.pytorch.org/whl/cu121- CPU版本:
pip install torch==2.6.0 torchvision==0.21.0 torchaudio==2.6.0 --index-url https://download.pytorch.org/whl/cpu您可以通过以下方式检查CUDA版本 nvcc --version 或 nvidia-smi.
用法
启动服务器
在Windows上,只需运行 start_server.bat.
在其他平台上,运行:
python whisper_server.py配置Claude桌面
- 打开Claude Desktop配置文件:
- 窗户: %APPDATA%\Claude\claude_desktop_config.json - macOS: ~/Library/Application Support/Claude/claude_desktop_config.json
- 添加Whisper服务器配置:
{
"mcpServers": {
"whisper": {
"command": "python",
"args": ["D:/path/to/whisper_server.py"],
"env": {}
}
}
}- 重新启动克劳德桌面
可用工具
服务器提供以下工具:
- 获取模式信息 -获取Whisper可用型号的信息
- 转录 -转录单个音频文件
- 批处理_订阅 -批量转录文件夹中的音频文件
性能优化提示
- 使用CUDA加速显著提高了转录速度
- 批处理模式对大量短音频文件更有效
- 批量大小根据GPU内存大小自动调整
- 使用VAD(语音活动检测)过滤可以提高长音频的准确性
- 指定正确的语言可以提高转录质量
本地测试方法
- 使用MCP检查器进行快速测试:
mcp dev whisper_server.py- 使用Claude Desktop进行集成测试
- 使用命令行直接调用(需要mcp\[cli\]):
mcp run whisper_server.py错误处理
服务器实现了以下错误处理机制:
- 音频文件存在性检查
- 模型加载失败处理
- 转录过程异常捕获
- GPU内存管理
- 批处理参数自适应调整
项目结构
whisper_server.py:主服务器代码model_manager.py:Whisper模型加载和缓存audio_processor.py:音频文件验证和预处理formatters.py:输出格式(VTT、SRT、JSON)transcriber.py:核心转录逻辑start_server.bat:Windows启动脚本
许可证
麻省理工学院
致谢
这个项目是在这些令人惊叹的人工智能工具和模型的帮助下开发的:
- -AI配对程序员
- 崔 -智能AI编码助手
- 克莱恩 -AI供电终端
- 深度求索 -先进的人工智能模型
- 第3.7条十四行诗 -Anthropic强大的人工智能助手
- 双子座-2.0-Flash -谷歌的多模式人工智能模型
- VS Code -强大的代码编辑器
- 耳语 -OpenAI的语音识别模型
- 更快的耳语 -优化Whisper实施
特别感谢这些令人难以置信的工具及其背后的团队。
