Token导航 LogoToken导航TokenDH.com
效率敏感数据clawhub未标认证来源可访问clear审计通过

qwen3-tts-feishuqwen3 tts 飞书

Agent Skill

qwen3-tts-feishu 用于补充效率相关能力,适合在 OpenClaw 中需要让 Agent 承接效率相关任务时使用。可结合来源仓库、安装命令和原始 README 继续核验具体用法。安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写。

总安装

12,047

周安装

497

GitHub Stars

公开资料未说明

下载量

3,936
OpenClaw

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

MIT-0

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:qwen3-tts-feishu(qwen3 tts 飞书)
来源仓库:https://github.com/shawnreality/qwen3-tts-feishu
安装命令:
openclaw skills install qwen3-tts-feishu
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 OpenClaw 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

ClawHubOpenClaw
openclaw skills install qwen3-tts-feishu

简介

使用 Qwen3-TTS 本地语音合成,将文字转为语音文件,并可通过飞书发送语音消息(语音气泡格式)。支持 Apple Silicon (MPS) 和 CUDA GPU,消耗 API Key 即可本地合成。

SKILL.md

name
qwen3-tts-feishu
description
使用 Qwen3-TTS 本地语音合成,将文字转为语音文件,并可通过飞书发送语音消息(语音气泡格式)。支持 Apple Silicon (MPS) 和 CUDA GPU,无需 API Key 即可本地合成。
metadata
openclaw
requires
env
bins
primaryEnv
FEISHU_APP_ID
emoji
🎙️
os

Qwen3-TTS 本地语音合成 + 飞书语音消息

完全本地运行,无需 API Key。支持中文、英文、日文等多语言,9 种音色可选。


第一步:环境准备

安装依赖

# 创建项目目录(可自定义)
mkdir -p ~/qwen-tts && cd ~/qwen-tts

# 创建虚拟环境
python3 -m venv .venv
source .venv/bin/activate   # Windows: .venv\Scripts\activate

# 安装 Python 依赖
pip install qwen-tts soundfile modelscope

# 安装系统工具(发送飞书语音需要)
# macOS:
brew install ffmpeg sox
# Ubuntu/Debian:
# apt install ffmpeg sox

第二步:下载模型

模型大小约 4.2GB,需要下载两个组件:

国内(ModelScope,推荐)

from modelscope.hub.snapshot_download import snapshot_download

# 下载主模型(3.57GB)
snapshot_download(
    "Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice",
    local_dir="./Qwen3-TTS-12Hz-1.7B-CustomVoice"
)
注意modelscope CLI 在 Python 3.12+ 下有 bug,请用上面的 Python API 方式。

海外(HuggingFace)

pip install huggingface_hub
huggingface-cli download Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice \
    --local-dir ./Qwen3-TTS-12Hz-1.7B-CustomVoice
提示:模型目录自带 speech_tokenizer 子目录,不需要单独下载 tokenizer。

第三步:合成语音

import soundfile as sf
from qwen_tts.inference.qwen3_tts_model import Qwen3TTSModel

# 根据硬件选择设备
# Apple Silicon: device_map="mps"
# NVIDIA GPU:    device_map="cuda"
# CPU(慢):     device_map="cpu"
MODEL_PATH = "./Qwen3-TTS-12Hz-1.7B-CustomVoice"

model = Qwen3TTSModel.from_pretrained(MODEL_PATH, device_map="mps")

wavs, sample_rate = model.generate_custom_voice(
    text="你好,我是本地语音合成助手。",
    speaker="aiden",      # 见下方音色列表
    language="Chinese"    # Chinese / English / Japanese
)

sf.write("output.wav", wavs[0], sample_rate)
print(f"已生成: output.wav ({sample_rate}Hz)")

也可直接用脚本(见 scripts/synthesize.py):

python scripts/synthesize.py "要合成的文字" output.wav aiden Chinese

可用音色

speaker性别风格
aiden标准普通话
bella标准普通话
chelsie年轻活泼
ethan成熟稳重
freya温柔知性
george低沉磁性
holly清新自然
iris活力充沛
james专业正式

第四步:通过飞书发送语音消息

重要:飞书 msg_type: audio 要求 opus 格式,必须直接调飞书 API 上传文件。OpenClaw message 工具的 filePath 参数只发送路径文本,不是真正上传。

前置条件

  • 飞书自建应用的 app_idapp_secret
  • 收件人的 open_id
  • 应用已开通权限:im:message:send_as_botim:resource

发送流程(4步)

# 1. WAV → opus
ffmpeg -i output.wav -c:a libopus -b:a 24k output.opus -y

# 2. 获取 token
TOKEN=$(curl -s -X POST "https://open.feishu.cn/open-apis/auth/v3/tenant_access_token/internal" \
  -H "Content-Type: application/json" \
  -d '{"app_id":"YOUR_APP_ID","app_secret":"YOUR_APP_SECRET"}' \
  | python3 -c "import json,sys; print(json.load(sys.stdin)['tenant_access_token'])")

# 3. 上传 opus 文件
FILE_KEY=$(curl -s -X POST "https://open.feishu.cn/open-apis/im/v1/files" \
  -H "Authorization: Bearer $TOKEN" \
  -F "file_type=opus" \
  -F "file_name=audio.opus" \
  -F "file=@output.opus" \
  | python3 -c "import json,sys; print(json.load(sys.stdin)['data']['file_key'])")

# 4. 发送语音气泡
curl -X POST "https://open.feishu.cn/open-apis/im/v1/messages?receive_id_type=open_id" \
  -H "Authorization: Bearer $TOKEN" \
  -H "Content-Type: application/json" \
  -d "{\"receive_id\":\"TARGET_OPEN_ID\",\"msg_type\":\"audio\",\"content\":\"{\\\"file_key\\\":\\\"$FILE_KEY\\\"}\"}"

完整自动化脚本见 scripts/send_voice_feishu.sh(需配置环境变量 FEISHU_APP_IDFEISHU_APP_SECRET)。


常见问题

问题原因 / 解决方案
flash-attn 警告可忽略,不影响功能
模型加载慢(10~20s)首次加载正常,之后复用同一实例
MPS 报错确认 PyTorch >= 2.0,macOS >= 12.3
飞书收到的是文件而不是语音气泡格式必须是 opus,不能是 mp3/wav
pkg_resources 报错modelscope CLI bug,改用 Python API 下载

性能参考(Apple M4)

  • 模型加载:约 15 秒
  • 短句合成(< 50字):约 2~3 秒
  • 长句合成(100~200字):约 5~10 秒

适合场景

01

OpenClaw 用户查找和安装 Skill 时

02

用户想查找某类 Agent Skill 时

03

需要根据任务场景推荐可安装能力包时

04

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

补充不同宿主或平台的使用分布数据

能力 5

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

OpenClaw

74%
按下载量换算2,913

安全审计

VirusTotal

通过

ClawScan

通过

Static analysis

未展示

权限和风险

敏感数据

该 Skill 可能接触密钥、Token、环境变量或敏感配置,应进入高风险复核队列,默认不自动发布。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills