voiceforge mcp
用于语音AI开发的MCP服务器。推荐、基准测试和脚手架STT+LLM+TTS堆栈——由企业规模4年语音人工智能的生产数据提供支持。
安装
claude mcp add voiceforge-mcp -- npx -y voiceforge-mcp就是这样。Claude Code现在可以访问所有VoiceForge工具。
工具
voiceforge_recommend
为您的语言和用例获得最佳的STT+LLM+TTS组合。 您可以通过以下方式请求结构化输出 output_format: "json" 为了实现自动化。
"What's the best voice stack for Thai debt collections?"
→ Deepgram nova-3 → ElevenLabs eleven-turbo → ElevenLabs eleven_v3
142ms latency | 4.1/5 quality | $0.004/minvoiceforge_benchmark
浏览所有测试的组合,包括延迟、质量和成本数据。按语言或提供商筛选。 支持 output_format: "markdown" | "json" 为了实现自动化。
voiceforge_compare
并排比较两个堆栈:延迟、质量、成本和语言覆盖率。 combo_a/combo_b 仅支持提供者或提供者+模型语法。 当仅使用提供者并且多个基准行匹配时,将选择得分最高的匹配项。
示例:
combo_a:"Deepgram + OpenAI + Cartesia"combo_b:"Deepgram nova-3 + OpenAI gpt-4.1-mini + Cartesia sonic-3"
voiceforge_scaffold
使用推荐的堆栈生成完整的语音AI项目。
- LiveKit代理 python
agent.py,requirements.txt,voiceforge.yaml,.env - Next.js+ElevenLabs (TypeScript)-语音小部件组件,env配置(目前基于ElevenLabs的MVP)
voiceforge_validate
根据基准覆盖率和可搭建性验证自定义堆栈(提供者+模型元组)。 模型名称根据已知的提供者目录进行验证;不支持的值返回明确的建议。
在投球/现场演示之前使用此功能,以便YC评审员可以验证候选堆栈是否真实且可运行。
voiceforge_providers
列出所有支持的提供商:Deepgram、ElevenLabs、Cartesia、OpenAI、Anthropic、谷歌、Groq、AssemblyAI、Speechmatics、PlayHT、Rime。
voiceforge_config
使用管道设置、质量目标和监控阈值生成生产就绪的YAML配置。 支持 output_format: "markdown" | "json" 以及提供商/模型净化。
voiceforge_health
面试前使用,一目了然地表明准备就绪:
- 可用基准行总数
- 语言支持和框架覆盖
- 表现最好的总结(最快、质量最好、最便宜)
- 健康产出包括
data_snapshot用于可重复的演示证据
YC演示清单
- 跑
voiceforge_health并保存输出。 - 保持
voiceforge_health {"output_format":"json"}在YC审核截图的最终提交文件夹中输出。 - 跑
voiceforge_recommend对于您的顶级用例,请使用output_format: "json". - 跑
voiceforge_validate在录制前的最后一张纸上。 - 跑
voiceforge_scaffold并共享生成的启动文件/屏幕截图。 - 跑
voiceforge_providers和voiceforge_config提交前提供一页证据。
YC演示脚本
voiceforge_health {"output_format":"json"}
voiceforge_recommend {"language":"English","use_case":"customer-support","output_format":"json"}
voiceforge_validate {"stt_provider":"Deepgram","stt_model":"nova-3","llm_provider":"OpenAI","llm_model":"gpt-4.1-mini","tts_provider":"Cartesia","tts_model":"sonic-3","framework":"livekit","output_format":"json"}
voiceforge_scaffold {"language":"English","use_case":"customer-support","framework":"livekit","output_format":"json"}稳定性改进
- 规范规范化现在可以处理提供者别名,并避免不明确的部分匹配。
- 用例别名被规范化(
customer support,debt collections等等)。 - 脚手架输出现在对文件系统友好的代理名称是安全的。
- 未知的提供程序/语言筛选器返回可操作的支持值提示。
voiceforge_compare现在解析提供者+模型元组,并在需要时返回歧义元数据。
基准数据
从生产企业部署中测试了12种跨10种语言的STT+LLM+TTS组合。
| 度量 | 范围 |
|---|---|
| 延迟 | 142毫秒--287毫秒 |
| 质量 | 4.0--4.8 UTMOS |
| 成本 | 0.004--0.022/分钟 |
| 语言 | 10(英语、泰语、越南语、日语、韩语等) |
为什么选择VoiceForge?
每个构建语音代理的团队都会对提供商组合进行反复试验。ElevenLabs对自己进行了基准测试。Deepgram对自己进行了基准测试。 没有人对组合进行基准测试。 我们确实如此。
由...建造 Beknazar Abdikamalov --4年为企业客户构建8种语言的生产语音AI。
许可证
麻省理工学院
