演讲者
AI编码代理的本地TTS——大声说出响应
将语音输出添加到任何AI编码代理(Claude Code、Kiro CLI、Gemini CLI、OpenCode、Crush、Amp)。用途 kokoro onnx (82M参数)用于快速、自然发音的语音,延迟约1.5秒。
所有代理都通过 主控程序 暴露一个 speak 工具。Kokoro模型加载一次并在内存中保持温暖,消除了后续调用的冷启动延迟。
为什么?
- 听觉通道有助于专注和处理(特别是对于神经发散用户)
- 听到口头回应可以减少“文本墙”的负担
- 自然音质——不是机器人,不会让你分心
快速开始
git clone /speaker.git
cd speaker
./scripts/install.sh这将安装 speak-mcp MCP服务器,并配置任何检测到的AI工具。
用法
在任何代理会话中:
| 平台 | 启用 | 禁用 |
|---|---|---|
| 克劳德代码 | /speak-start | /speak-stop |
| Kiro命令行界面 | @speak-start | @speak-stop |
| Gemini CLI | @speak-start | @speak-stop |
| OpenCode | @speak-start | @speak-stop |
| 放大器 | @speak-start | @speak-stop |
默认情况下,语音处于关闭状态。启用后,代理调用 speak MCP工具及其完整响应(不包括代码块)。
MCP服务器
这 speak-mcp 入口点运行a FastMCP 服务器公开了三个工具: speak, list_voices,以及 speaker_statusKokoro模型在内存中保持温暖——第一次调用加载模型(~2s),后续调用的开销约为200ms。
工具模式
| 字段 | 值 |
|---|---|
| 姓名 | speak |
| 参数 | text: str, voice: str = "am_michael", speed: float = 1.0 |
| 退货 | str --确认或错误消息 |
添加到任何代理
添加到代理的MCP配置中:
{
"mcpServers": {
"speaker": {
"command": "speak-mcp",
"args": []
}
}
}然后在代理的提示中添加:
The user can toggle voice with @speak-start and @speak-stop.
When enabled, call the speak tool with your full response text.
Exclude code blocks from spoken text.看 docs/agent-install.md 针对特定平台的配置。
声音
kokoro onnx的声音遵循这种模式 {accent}{gender}_{name}:
| 语音 | 描述 |
|---|---|
am_michael | 美国男性(默认)——清晰、自然 |
af_heart | 美国女性——暖色调 |
af_bella | 美国女性——聪明 |
am_adam | 美国男性-更深 |
bf_emma | 英国女性 |
速度
通过 speed 作为工具参数(0.5=慢,2.0=快,默认值1.0)。
运作原理
- 代理人致电
speak带响应文本的MCP工具 - MCP服务器(
speak-mcp)通过以下方式合成音频 kokoro onnx - 音频重新采样24kHz->48kHz,并通过声音设备播放
- 模型在内存中保持温暖,以实现低延迟的后续调用
建筑
Agent (Claude/Kiro/Gemini/...)
|
| MCP protocol (stdio)
v
speak-mcp (FastMCP server)
|
| SpeakerEngine (in-process)
v
kokoro-onnx -> sounddevice -> audio out需求
- Python 3.10+
- 紫外线 用于安装
- macOS或Linux(kokoro-onnx通过onnx运行时在CPU上运行)
许可证
麻省理工学院
生成的人工制品
🔍 探索此项目 --人工智能生成的概述 谷歌笔记本LM
*产生于 notebookrm仓库工件*
