🎧 音频MCP服务器
A. 模型上下文协议(MCP)服务器 用于专业音频处理、分析和语音音乐同步——由Python(librosa、numpy、Whisper)和TypeScript MCP包装器提供支持。
为AI编码代理构建,以编程方式创建广播就绪的音频内容。
✨ 特性
🎵 核心音频工具(1-8)
| 工具 | 说明 |
|---|---|
audio_generate_music | 按程序生成免版税的背景音乐(环境垫、低保真) |
audio_mix_with_ducking | 将画外音+音乐与智能音量切换相结合 |
audio_transcribe | 通过OpenAI Whisper进行单词级时间戳转录 |
audio_time_stretch | 在保持音调的同时延长音频/视频的时间 |
audio_analyze | 分析音频元数据:持续时间、BPM、RMS、采样率 |
audio_normalize | 符合平台响度标准(Spotify、YouTube、TikTok等) |
audio_format_convert | 通过比特率控制在WAV、MP3、AAC、OGG、FLAC之间进行转换 |
audio_eq | 带预设的参数均衡器(语音清晰度、温感、去感、播客) |
🎼 语音音乐同步工具(9-15)
| 工具 | 说明 |
|---|---|
audio_beat_grid | 使用HPSS+librosa提取精确的节拍时间戳 |
audio_speech_timestamps | 通过Whisper交叉注意力进行单词级语音计时 |
audio_prosody_analyze | 语言节奏分析(n-PVI,重音模式,阿拉伯语支持) |
audio_dtw_align | 语音和音乐节拍之间的动态时间扭曲对齐 |
audio_formant_stretch | 蚁类保存时间延长(无花栗鼠效应) |
audio_beat_drop_detect | 为社交媒体编辑寻找高能量的影响时刻 |
audio_artisan_mix | 通过智能闪避技术生成具有身体感知的音乐 |
🏗 建筑
audio-mcp/
├── src/
│ └── index.ts # MCP server — tool definitions + Python runner
├── python/
│ ├── audio_analyze.py # Audio metadata analysis
│ ├── audio_normalize.py # LUFS loudness normalization
│ ├── audio_eq.py # Parametric EQ engine
│ ├── audio_format_convert.py # Format conversion (via pydub/ffmpeg)
│ ├── audio_beat_grid.py # Beat tracking (HPSS + librosa)
│ ├── audio_speech_timestamps.py# Word-level timestamps (Whisper)
│ ├── audio_prosody_analyze.py # Linguistic prosody (n-PVI)
│ ├── audio_dtw_align.py # Dynamic Time Warping alignment
│ ├── audio_formant_stretch.py # Formant-preserving stretch
│ ├── audio_beat_drop_detect.py # Energy drop detection
│ ├── artisan_sync_mixer.py # Prosody-aware music mixer
│ ├── generate_music.py # Lo-fi music generator
│ ├── generate_ideal.py # Ambient pad music generator
│ ├── generate_captions.py # Whisper captioning
│ ├── rhythmic_audio_mixer.py # Voice+music ducking mixer
│ ├── time_stretch_video.py # Video time-stretch
│ └── requirements.txt # Python dependencies
├── package.json
└── tsconfig.json🚀 设置
先决条件
- Node.js ≥ 18
- python ≥ 3.10
- FFmpeg (用于格式转换)
安装
# Clone the repo
git clone https://github.com/YOUR_USERNAME/audio-mcp.git
cd audio-mcp
# Install Node dependencies
npm install
# Set up Python venv
cd python
python3 -m venv venv
source venv/bin/activate
pip install -r requirements.txt
cd ..
# Build TypeScript
npm run build配置MCP客户端
添加到您的MCP配置中(例如,双子座/反重力/克劳德):
{
"mcpServers": {
"audio-mcp": {
"command": "node",
"args": ["/path/to/audio-mcp/dist/index.js"]
}
}
}📖 用法
连接后,您的AI代理可以使用15个工具中的任何一个。工作流程示例:
1. audio_analyze → Get BPM, duration of speech clip
2. audio_speech_timestamps → Extract word-level timing
3. audio_prosody_analyze → Analyze speech rhythm (n-PVI)
4. audio_generate_music → Create matching background music
5. audio_beat_grid → Extract beat grid from music
6. audio_dtw_align → Align speech to music beats
7. audio_formant_stretch → Stretch speech to fit alignment
8. audio_mix_with_ducking → Final mix with ducking
9. audio_normalize → Normalize for target platform
10. audio_format_convert → Export as MP3🎯 平台响度标准
| 平台 | 目标LUFS |
|---|---|
| Spotify | -14 |
| YouTube | -14 |
| 尝试 | -14 |
| -14 | |
| 播客 | -16 |
| 广播(EBU R128) | -23 |
📄 许可证
麻省理工学院
