Token导航 LogoToken导航TokenDH.com
研究检索需要联网clawhub未标认证来源可访问clear审计提醒

voice-tts语音合成

Agent Skill

用于辅助音频、音乐、语音转写、语音合成或声音素材处理。它适合让 Agent 生成配乐说明、整理音频流程、调用语音工具或处理播客和视频配音素材。使用时需要确认输入音频来源、输出格式、时长和模型限制;涉及人声克隆、版权音乐或公开发布时,应先核对授权和合规边界。

总安装

18,727

周安装

765

GitHub Stars

公开资料未说明

下载量

6,059
OpenClaw

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

MIT-0

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:voice-tts(语音合成)
来源仓库:https://github.com/believe3344/voice-tts
安装命令:
openclaw skills install voice-tts
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 OpenClaw 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

ClawHubOpenClaw
openclaw skills install voice-tts

简介

语音输入(Whisper ASR)+语音输出(Edge TTS)技能,支持代理专属音色,可调用send_voice_reply.mjs 发送 Telegram 语音消息。

SKILL.md

name
voice-tts
description
语音输入(Whisper ASR)+ 语音输出(Edge TTS)技能,支持 agent 专属音色,可调用 send_voice_reply.mjs 发送 Telegram 语音消息。
metadata
{"openclaw": {"emoji": "🎙️", "requires": {"bins": ["node>=18", "python3", "ffmpeg"], "pip": ["edge-tts", "whisper", "click"]}}}

voice-tts

语音输入(ASR)+ 语音输出(TTS)技能,完整替代 OpenClaw 内置 tts 工具处理中文内容。

技术概览

方向技术说明
语音 → 文字Whisper(本地)接收语音,自动转文字
文字 → 语音Edge TTS(云端)生成 MP3,发送 Telegram 语音消息

工作方式

ASR(语音 → 文字)

用户发来语音消息 → voice-asr.mjs 转写为文字 → 触发 agent 处理。

语音识别在 OpenClaw 工具层自动完成,agent 收到的是文字。

TTS(文字 → 语音)

agent 回复文字后,如需以语音发送,调用 send_voice_reply.mjs 手动发送 Telegram 语音消息:

node /path/to/voice-tts/scripts/send_voice_reply.mjs \
  --text "你的回复内容" \
  --chat-id 8317347201 \
  --agent main

快速安装

方式一:一键安装(推荐)

# 默认安装 turbo 模型
bash /path/to/voice-tts/install.sh

# 国内加代理
bash /path/to/voice-tts/install.sh --proxy http://127.0.0.1:7897

方式二:手动安装

pip install edge-tts whisper click
brew install ffmpeg   # macOS
sudo apt install -y ffmpeg  # Ubuntu

安装完成后运行冒烟测试:

bash tests/smoke.sh

配置(可选)

config.default.json 已包含所有默认值,不填配置可直接使用

如需自定义 agent 音色映射或 ASR 参数,在 openclaw.jsonskills.entries.voice-tts.config 中覆盖:

{
  "skills": {
    "entries": {
      "voice-tts": {
        "enabled": true,
        "config": {
          "tts": {
            "defaultVoice": "zh-CN-XiaoxiaoNeural",
            "agentVoices": {
              "main":       "zh-CN-XiaoxiaoNeural",
              "researcher": "zh-CN-YunxiNeural",
              "product":    "zh-CN-XiaoyiNeural",
              "coder":      "zh-CN-YunyangNeural",
              "devops":     "zh-CN-YunjianNeural"
            }
          },
          "asr": {
            "defaultInitialPrompt": "以下是中文语音转文字。常见词包括:管家、研究员、邮差、码农、产品、运维、OpenClaw、小爱、Telegram。",
            "defaultTemperature": 0,
            "conditionOnPreviousText": true
          }
        }
      }
    }
  }
}

修改后执行 openclaw gateway restart


核心脚本

语音合成 — bin/voice-tts.mjs

将文字转为语音文件:

# 基本用法
node bin/voice-tts.mjs "你好" -f /tmp/demo.mp3

# 指定 agent 音色
node bin/voice-tts.mjs "你好" -f /tmp/demo.mp3 --agent main

# 指定声音 / 语速
node bin/voice-tts.mjs "你好" -f /tmp/demo.mp3 -v zh-CN-YunxiNeural -r +10%

可用中文音色:zh-CN-XiaoxiaoNeural(女声,推荐)、zh-CN-YunxiNeuralzh-CN-XiaoyiNeuralzh-CN-YunyangNeuralzh-CN-YunjianNeuralzh-CN-XiaomoNeural

语音识别 — bin/voice-asr.mjs

将音频文件转文字:

# 基本用法
node bin/voice-asr.mjs audio.ogg

# 指定模型 / 语言
node bin/voice-asr.mjs audio.ogg --model turbo --language zh

# 输出 JSON(含语言检测)
node bin/voice-asr.mjs audio.ogg --json

可用模型:tiny base small turbo large-v3

发送 Telegram 语音 — scripts/send_voice_reply.mjs

一键完成"文字 → TTS 合成 → Telegram 语音消息发送":

node scripts/send_voice_reply.mjs \
  --text "已收到!" \
  --chat-id 8317347201 \
  --agent main

参数说明:

参数必填说明
--text要语音播报的文字内容
--chat-idTelegram 目标用户 ID
--agentagent id,自动选对应音色
--voice覆盖默认音色,如 zh-CN-YunxiNeural
--rate语速,如 +10%-5%
--token直接指定 Telegram Bot Token

Token 自动查找优先级:

  1. --token 参数
  2. openclaw.json → channels.telegram.accounts.<当前agent>.botToken
  3. openclaw.json → channels.telegram.accounts.default.botToken
  4. 环境变量 TELEGRAM_BOT_TOKEN

文件结构

voice-tts/
├── SKILL.md                      # 本文档
├── config.default.json           # 默认配置(直接可用,不需修改)
├── install.sh                    # 一键安装脚本
│
├── bin/
│   ├── voice-tts.mjs             # TTS 入口
│   └── voice-asr.mjs             # ASR 入口
│
├── lib/
│   ├── config.mjs                # 配置读取(支持 openclaw.json 覆盖)
│   ├── errors.mjs                 # 统一错误码 + 用户兜底消息
│   └── audio.mjs                 # 音频校验
│
├── scripts/
│   ├── send_voice_reply.mjs      # Telegram 语音发送(核心)
│   └── auto_voice_check          # 批量处理未处理语音
│
└── tests/
    └── smoke.sh                   # 冒烟测试
注意: scripts/edge_ttsscripts/whisper 是内部 Python 封装,非直接入口;直接使用上表中的 bin/ 入口即可。

错误码

错误码含义用户兜底消息
no_file_path未提供音频文件抱歉,没有收到音频文件,请重试。
file_not_found文件不存在抱歉,音频文件没找到,请重试。
file_empty文件为空抱歉,音频文件是空的,请重试。
file_too_small文件过小抱歉,音频文件不完整,请重试。
file_stale文件过期抱歉,音频文件已过期,请重试。
transcription_failedWhisper 转写失败抱歉,语音识别失败了,请重试。
synthesis_failedEdge TTS 生成失败抱歉,语音生成失败了,请重试。
timeout执行超时抱歉,处理超时了,请稍后重试。

语音文件自动归档

voice-asr.mjs 成功转写后,自动将原文件从 ~/.openclaw/media/inbound/ 复制到 agent workspace media/inbound/,然后删除原文件。

  • ✅ 成功时:复制归档,删除原文件
  • ❌ 失败时:保留原文件,可重试

故障排查

# 检查依赖
ffmpeg -version
python3 -c "import edge_tts; print('edge-tts ok')"
python3 -c "import whisper; print('whisper ok')"

# 检查未处理语音文件
ls -la ~/.openclaw/media/inbound/

# 直接测试 ASR
node bin/voice-asr.mjs ~/.openclaw/media/inbound/your-file.ogg

# 直接测试 TTS
node bin/voice-tts.mjs "测试" -f /tmp/test.mp3

# 运行冒烟测试
bash tests/smoke.sh

常见问题:

  • TTS 生成失败:检查 python3 -c "import edge_tts; print('ok')"
  • Telegram 发送失败:确认 botToken 正确、chat-id 是数字 ID、语音文件 < 20MB
  • 语音发错对象:检查 conversationId 是否与预期 chat-id 一致

可选:批量处理未处理语音

node scripts/auto_voice_check

检查 ~/.openclaw/media/inbound/ 下未处理的 .ogg 文件,自动转写并归档。

适合场景

01

OpenClaw 用户查找和安装 Skill 时

02

用户想查找某类 Agent Skill 时

03

需要根据任务场景推荐可安装能力包时

04

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

补充不同宿主或平台的使用分布数据

能力 5

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

OpenClaw

98.13%
按下载量换算5,946

安全审计

VirusTotal

可疑

ClawScan

可疑

Static analysis

可疑

权限和风险

需要联网

该 Skill 可能需要联网访问来源站点、仓库或外部 API;具体网络访问范围需要结合源码和 README 复核。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills