🎵 Gemini音频MCP
  
Gemini音频MCP 是专为专业级音频合成而设计的高性能模型上下文协议(MCP)服务器。它利用了 Gemini 2.5多模式直播API 谷歌DeepMind Lyria 3 该模型可按需提供高保真的环境声景、音乐作品和富有表现力的叙事。
______________________________________________________________________
🛠 先决条件
在部署服务器之前,请确保您的环境满足以下技术要求:
1.FFmpeg(核心处理引擎)
高性能音频编码、解码和转码所需。
- macOS:
brew install ffmpeg - 视窗:
winget install ffmpeg或从以下网址下载 ffmpeg.org. - Linux(Ubuntu/Debian):
sudo apt update && sudo apt install ffmpeg
2.Rust工具链(编译)
需要从源构建服务器。
- 通过安装 rustup.rs:
curl --proto '=https' --tlsv1.2 -sSf https://sh.rustup.rs | sh
3.Node.js和NPM(运行时)
如果使用预编译的NPM包,则需要。
- 版本:
node >= 18.0.0
______________________________________________________________________
🚀 安装和部署
全球安装(通过NPX)
将服务器集成到MCP客户端(例如Claude Desktop)的最快方法。
{
"mcpServers": {
"gemini-audio": {
"command": "npx",
"args": ["-y", "gemini-audio-mcp"],
"env": {
"GEMINI_API_KEY": "YOUR_SECURE_API_KEY"
}
}
}
}手动构建(优化)
为了获得最佳性能,请在本地构建Rust二进制文件:
- 克隆和构建:
git clone https://github.com/mcp-servers/gemini-audio-mcp.git
cd gemini-audio-mcp
cargo build --release- 查找二进制文件:优化后的二进制文件将在
./target/release/gemini-audio-mcp.
______________________________________________________________________
🔑 API密钥管理
服务器需要有效的Google AI Studio API密钥。
- 从以下位置获取密钥 谷歌人工智能工作室.
- 安全最佳实践:永远不要硬编码密钥。通过以下方式注入钥匙
GEMINI_API_KEY环境变量。 - 层级注释:访问Lyria 3(Pro/Clip)型号通常需要 付费等级 或在Google AI Studio中进行特定的预览访问。
______________________________________________________________________
🎮 工具使用指南
1.环境发电(generate_soundscape)
合成沉浸式、无人声的环境纹理。
{
"name": "generate_soundscape",
"arguments": {
"prompt": "Deep underwater abyss, low-frequency whale songs, rhythmic air bubbles rising, muffled aquatic pressure.",
"duration": 60,
"quality": "high",
"auto_play": true
}
}2.专业音乐(generate_music)
生成具有可选声乐控制的结构作品。
{
"name": "generate_music",
"arguments": {
"prompt": "Melancholic solo cello in a vast cathedral with 5-second decay reverb.",
"bpm": 72,
"song_key": "D minor",
"intensity": 4
}
}3.表达性嗓音(generate_voice)
使用Gemini 2.5原生音频进行叙述和人物对话。
{
"name": "generate_voice",
"arguments": {
"text": "The artifacts are stable, but the rift remains open.",
"voice_direction": "Gravelly, urgent, whispered"
}
}4.动态演变(transition_soundscape)
交叉渐变两个不同的环境,实现无缝的场景过渡。
{
"name": "transition_soundscape",
"arguments": {
"from_prompt": "Quiet library silence.",
"to_prompt": "Sudden heavy rain on a tin roof.",
"transition_duration": 8
}
}______________________________________________________________________
⚙️ 高级参数
| 参数 | 类型 | 说明 |
|---|---|---|
seed | Integer | 确保确定性、可再现的音频输出。 |
image_path | String | 多模态:使用局部图像来引导声学情绪(例如共振)。 |
bpm | Number | 明确地设定节奏(对音乐至关重要)。 |
intensity | Number | 1-10级控制动态范围和复杂性。 |
guidance | Number | 0.0-6.0级,用于快速坚持(Lyria型号)。 |
duration | Number | 目标长度(秒)。触发 无缝循环发动机. |
______________________________________________________________________
🔬 架构概述
Gemini Audio MCP采用了一种独特的 混合动力发动机策略:
- WebSocket循环:连接到Gemini 2.5 Live,以实现低延迟、交互式语音和foley任务。
- REST管道:与Lyria 3 Pro接口,用于高保真音乐合成。
- PCM处理:一个基于Rust的内部循环(
decode -> crossfade -> loop -> encode)确保短片转化为无缝、无限的音景,而不会发出咔嗒声。
______________________________________________________________________
🧪 故障排除
FFmpeg错误
- “未找到FFmpeg”:确保
ffmpeg在您的系统PATH中。跑ffmpeg -version在您的终端中进行验证。 - 转码失败:检查您是否有必要的编解码器(例如。,
libmp3lameMP3)。大多数标准FFmpeg安装都包括这些。
API问题
- 429速率限制:服务器实现了一个信号量来限制并发,但要确保API层支持请求的模型。
- 空音频输出:验证您的
GEMINI_API_KEY是正确的,并且您的帐户可以访问所请求的模型(尤其是lyria-3-pro-preview).
______________________________________________________________________
📄 许可证
根据 MIT许可证由MCP社区精确设计。
