双子座媒体mcp
  
通过Google Gemini API和Vertex AI生成人工智能媒体的统一Go MCP服务器。

特性
- 图像生成 --文本到图像,具有可配置的宽高比和分辨率(1K/2K/4K)
- 图像编辑 --使用自然语言提示修改现有图像
- 多参考成分 --最多可将3张参考图像与风格/内容指导相结合
- 视频生成 --通过Veo 3.1 Lite、快速和标准层将文本转换为视频
- 图像转视频 --将静止图像动画化为视频片段
- 视频扩展 --用于较长内容的链式剪辑(快速和标准层)
- 文本到语音 --使用可配置的语音和语言生成口语音频
- 音乐发生器 --通过Lyria 3播放的AI音乐(30秒片段或带人声、结构控制的完整歌曲)
- 单个二进制 --无运行时依赖关系,通过stdio传输运行
- 提供者抽象 --用于图像、视频、音频和模型操作的后端无关接口
- 双后端 --支持Gemini API(API密钥)和Vertex AI(项目证书)
快速开始
# Install
go install github.com/mordor-forge/gemini-media-mcp/cmd/gemini-media-mcp@latest
# Configure (Gemini API; either variable name works)
export GEMINI_API_KEY="your-api-key"
# export GOOGLE_API_KEY="your-api-key"
# Or configure (Vertex AI)
export GOOGLE_CLOUD_PROJECT="your-project-id"
export GOOGLE_CLOUD_LOCATION="us-central1"
# Run directly (stdio transport)
gemini-media-mcp然后将其添加到您的MCP客户端中——请参阅 MCP客户端配置 在......下面
配置
| 变量 | 必填 | 默认 | 描述 |
|---|---|---|---|
GOOGLE_API_KEY | 是\* | -- | Gemini API密钥。 GEMINI_API_KEY 也被接受 |
GOOGLE_CLOUD_PROJECT | 是\* | -- | Vertex AI后端的GCP项目ID |
GOOGLE_CLOUD_LOCATION | 没有 | us-central1 | Vertex AI的GCP区域 |
MEDIA_OUTPUT_DIR | 没有 | ~/generated_media | 保存媒体文件的目录 |
\*其中之一 GOOGLE_API_KEY 或 GOOGLE_CLOUD_PROJECT 必须设置。如果同时设置了两者,则API键优先(避免在 GOOGLE_CLOUD_PROJECT 在其他工具的外壳中设置)。
如果您不确定哪个后端处于活动状态,请致电 get_config 从MCP客户端确认所选后端和输出目录。
可用工具
| 工具 | 描述 | 类型 |
|---|---|---|
generate_image | 从文本提示生成图像 | 同步 |
edit_image | 使用文本提示编辑现有图像 | 同步 |
compose_images | 多参考图像合成(最多3个) | 同步 |
generate_video | 从文本提示生成视频(返回操作ID) | Async |
animate_image | 将图像动画化为视频(第一帧) | 异步 |
extend_video | 链接视频剪辑以获得更长的内容 | 异步 |
video_status | 检查视频生成进度 | 同步 |
download_video | 下载完成的视频 | 同步 |
generate_audio | 从文本生成语音音频(TTS) | 同步 |
generate_music | 从文本描述生成AI音乐(Lyria) | 同步 |
list_models | 显示具有功能和定价的可用型号 | 同步 |
get_config | 显示当前后端和配置 | 同步 |
异步工具立即返回操作ID。使用 video_status 要轮询完成情况,则 download_video 以检索文件。
模型层
图像
| 级别 | 型号 | 最适合 | 成本 |
|---|---|---|---|
| nb2(默认) | gemini-3.1-flash-image-preview | 快速迭代,大多数任务 | ~0.067/img美元 |
| pro | gemini-3-pro-image-preview | 最终渲染,复杂场景 | ~0.134/img美元 |
这两个层都支持1K、2K、4K分辨率和1:1、2:3、3:2、3:4、4:3、4:5、5:4、9:16、16:9、21:9的宽高比。
视频
| 级别 | 型号 | 最适合 | 成本 |
|---|---|---|---|
| lite(默认) | veo-3.1-lite-generate-preview | 大容量,草稿 | 0.05美元/秒(720p),0.08美元/每秒(1080p) |
| 快 | veo-3.1-fast-generate-preview | 高质量迭代 | 0.15美元/秒(720p/1080p),0.35美元/秒 |
| 标准 | veo-3.1-generate-preview | 最终渲染,4K | 每秒0.40美元(720p/1080p),每秒0.60美元(4K) |
支持的纵横比为 16:9 和 9:16支持的持续时间为 4, 6,以及 8 秒。Lite支持 720p 和 1080p快速和标准支持 720p, 1080p,以及 4K.视频扩展(extend_video)仅在快速和标准层上可用,扩展层必须与原始版本匹配。
音频(TTS)
| 级别 | 型号 | 最适合 | 成本 |
|---|---|---|---|
| tts | gemini-2.5-flash-preview-tts | 自然声音的文本转语音 | 标准Gemini代币定价 |
这 generate_audio 该工具将文本转换为语音。它支持:
- 语音选择 --从预构建的声音中选择,如
Aoede,Kore,Puck以及更多。违约:Aoede - 语言 --设置语言代码(例如。,
en-US,it-IT,cs-CZ,de-DE).违约:en-US - 自然语音 --通过适当的节奏和语调生成富有表现力、听起来自然的语音
输出保存为原始PCM音频(audio/L1624kHz采样率)。该文件可以使用以下工具播放 ffplay 或转换为其他格式:
# Play directly
ffplay -f s16le -ar 24000 -ac 1 ~/generated_media/audio-2026-04-02T12-20-12-0603.pcm
# Convert to WAV
ffmpeg -f s16le -ar 24000 -ac 1 -i audio.pcm audio.wav
# Convert to MP3
ffmpeg -f s16le -ar 24000 -ac 1 -i audio.pcm audio.mp3音乐(Lyria)
| 层级 | 型号 | 产量 | 最适合 | 成本 |
|---|---|---|---|---|
| 剪辑(默认) | lyria-3-clip-preview | 30秒剪辑 | 快速迭代,声音设计 | 约0.08美元/首 |
| 满 | lyria-3-pro-preview | 长达约3分钟 | 包含人声、诗句、合唱的完整歌曲 | 基于代币 |
这 generate_music 该工具根据文本描述创建人工智能生成的音乐。功能包括:
- 类型和风格 --指定任何流派、乐器、BPM、键/音阶、情绪
- 结构控制 --使用以下标签
[Verse],[Chorus],[Bridge],[Intro],[Outro] - 自定义歌词 --包括带有声乐曲目分段标记的歌词
- 时间戳控制 --
[0:00 - 0:10] Intro: gentle piano...用于精确的分段计时 - 多语言 --提示语言决定输出语言
- 高保真 --48kHz立体声MP3输出
所有生成的音乐都带有SynthID水印。
示例提示:
# Instrumental
"A gentle acoustic guitar melody in C major, 90 BPM, calm and peaceful indie folk"
# With structure
"[Intro] Ambient synth pad, ethereal
[Verse] Lo-fi hip-hop beat, mellow piano chords, vinyl crackle
[Chorus] Uplifting, add strings and gentle drums
[Outro] Fade out with reverb"
# With lyrics
"Upbeat pop song, 120 BPM, major key
[Chorus] We're dancing in the light / Everything feels right / Under stars so bright tonight"您可以传递层名称(lite, fast, standard, nb2, pro, tts, clip, full)或者直接输入原始型号ID。
MCP客户端配置
克劳德代码
添加到您的Claude Code MCP设置中(~/.claude/settings.json 或项目 .mcp.json):
{
"mcpServers": {
"gemini-media": {
"command": "gemini-media-mcp",
"env": {
"GOOGLE_API_KEY": "your-api-key",
"MEDIA_OUTPUT_DIR": "/path/to/output"
}
}
}
}使用其中之一 GOOGLE_API_KEY 或 GEMINI_API_KEY 在 env 上方挡块;两者都被接受。
或者,如果从源头构建:
{
"mcpServers": {
"gemini-media": {
"command": "/path/to/gemini-media-mcp",
"env": {
"GOOGLE_API_KEY": "your-api-key"
}
}
}
}克劳德代码的同伴技能
这 skills/ 该目录包含在MCP工具之上提供交互式工作流的ClaudeCode技能。每种技能都指导克劳德完成针对特定媒体类型的快速工程、模型选择和迭代改进。
| 技能 | 目录 | 描述 |
|---|---|---|
| 双子座图像生成器 | skills/gemini-image-gen/ | 图像生成、编辑和多参考合成 |
| 视频发生器 | skills/video-gen/ | 使用异步轮询、图像到视频、扩展生成视频 |
| 音乐基因 | skills/music-gen/ | 具有结构标签、歌词、流派控制的音乐生成 |
| tts发电机 | skills/tts-gen/ | 带语音和语言选择的文本转语音 |
要安装技能,请将其目录复制到 ~/.claude/skills/:
cp -r skills/video-gen ~/.claude/skills/
cp -r skills/music-gen ~/.claude/skills/
cp -r skills/tts-gen ~/.claude/skills/
cp -r skills/gemini-image-gen ~/.claude/skills/技能是可选的——MCP工具在没有技能的情况下也能工作。但这些技能增加了及时的工程指导、模型层建议和交互式审查工作流程,显著提高了输出质量。
从源代码构建
git clone https://github.com/mordor-forge/gemini-media-mcp.git
cd gemini-media-mcp
go build ./cmd/gemini-media-mcp/二进制文件将在以下时间创建 ./gemini-media-mcp.
要运行测试,请执行以下操作:
go test ./...贡献
- 分叉存储库
- 创建要素分支(
git checkout -b feature/your-feature) - 进行更改并添加测试
- 跑
go test ./...和go vet ./... - 提交您的更改
- 打开一个pull请求
main
