Token导航 LogoToken导航TokenDH.com
待分类敏感数据unknown未标认证来源可访问许可证需确认审计通过

voice-to-text语音转文字

Agent Skill

用于辅助音频、音乐、语音转写、语音合成或声音素材处理。它适合让 Agent 生成配乐说明、整理音频流程、调用语音工具或处理播客和视频配音素材。使用时需要确认输入音频来源、输出格式、时长和模型限制;涉及人声克隆、版权音乐或公开发布时,应先核对授权和合规边界。

总安装

7,907

周安装

323

下载量

2,532
Local Agent

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

来源数

2

许可证

unknown

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:voice-to-text(语音转文字)
来源仓库:https://skills.volces.com
仓库路径:voice-to-text
安装命令:
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。当前暂无明确安装命令,请以来源页面说明为准。

简介

实现语音到文字的实时转换,支持多语种识别与标点插入。

  • 适用于会议记录、采访转录或字幕生成等文字产出场景。
  • 当前仅支持 Local Agent 运行环境,暂无公开安装命令。
  • 准确率受背景噪音影响较大,建议在安静环境中使用。
  • voice-to-text 属于待分类类 Skill,可作为该场景下的辅助能力补充。

SKILL.md

Voice to Text Skill

基于火山引擎 BigModel ASR 将语音转为文字。准确率和多语言能力远优于本地 whisper,且速度更快。

适用场景

  1. 收到飞书语音消息(message_type: audio),需要自动识别语音内容
  2. 收到音频文件附件(.ogg.mp3.wav
  3. 用户提到「语音识别」「语音转文字」「ASR」

强制规则(最高优先级)

当你收到语音消息或音频文件附件时:

  • 必须且只能使用 本 Skill 的 asr.py 脚本来识别语音
  • 禁止使用 whisper 命令或 openai-whisper skill
  • 禁止 fallback:如果 asr.py 执行失败,直接将错误信息告知用户,不要改用 whisper

使用步骤

  1. 确认音频来源(本地文件、URL 或飞书语音 file_key)。
  2. 运行脚本前先 cd 到本技能目录:skills/voice-to-text
  3. 执行对应命令(见下方参数说明)。
  4. 将脚本输出的文字当作用户发送的文本消息,理解其意图并正常回复。不需要额外说明"语音识别结果是xxx",直接回答用户的问题即可。

环境变量与鉴权

鉴权采用新版控制台方案,详见:快速入门(新版控制台)API Key 使用

使用前需配置:

  • 推荐(新版控制台)MODEL_SPEECH_API_KEY — 在豆包语音新版控制台开通录音文件识别极速版,并创建/获取 API Key。
  • 兼容旧版:若同时配置 MODEL_SPEECH_APP_IDMODEL_SPEECH_API_KEY,则使用旧版 X-Api-App-Key / X-Api-Access-Key 鉴权。
  • 可选MODEL_SPEECH_ASR_API_BASE(ASR API 端点,默认 BigModel Flash)、MODEL_SPEECH_ASR_RESOURCE_ID(资源 ID,默认 volc.bigasr.auc_turbo)。
  • 飞书相关FEISHU_TENANT_TOKEN(飞书 tenant_access_token,仅在使用 --file-key 模式时需要)。

脚本参数

参数必填说明
--file三选一本地音频文件路径
--url三选一音频文件的 URL 地址
--file-key三选一飞书语音消息的 file_key
--feishu-token飞书 tenant_access_token(也可通过 FEISHU_TENANT_TOKEN 环境变量设置)
--appid火山引擎 ASR App ID(也可通过 MODEL_SPEECH_APP_ID 环境变量设置)
--token火山引擎 ASR API Key(也可通过 MODEL_SPEECH_API_KEY 环境变量设置)
--language语言代码,如 zh-CNja-JPen-US(不传则自动识别)

返回值说明

脚本输出纯文本到 stdout,即为用户说的话。如果失败,stdout 会包含以 [voice-to-text ERROR] 开头的错误信息。

飞书语音消息处理流程

收到 audio 消息 → 音频文件已下载到 /root/.openclaw/media/inbound/ → 执行 asr.py --file → 返回文字 → 当作用户消息处理

常用命令:

# 飞书语音文件(最常用,文件已被飞书插件自动下载)
python scripts/asr.py --file "/root/.openclaw/media/inbound/xxxxx.ogg"

错误处理

  • 若报错 PermissionError: MODEL_SPEECH_API_KEY... 需在环境变量中配置:提示用户按快速入门(新版控制台)开通录音文件识别极速版,并获取并配置 MODEL_SPEECH_API_KEY,写入 workspace 下的环境变量文件后重试。
  • 若报错 ASR 请求失败:根据错误码和信息提示用户检查 API 凭据及账号是否已开通豆包语音服务。
  • 若报错 音频文件不存在音频文件为空:检查文件路径是否正确。
  • 遇到报错时直接告知用户具体错误,不要尝试用 whisper 替代。

参考文档

示例

# 本地音频文件(最常用)
python scripts/asr.py --file "/root/.openclaw/media/inbound/xxxxx.ogg"

# 音频 URL
python scripts/asr.py --url "https://example.com/audio.mp3"

# 指定语言
python scripts/asr.py --file "/path/to/audio.ogg" --language "ja-JP"

# 飞书 file_key(需要 tenant_token)
python scripts/asr.py --file-key "file_v2_xxxx" --feishu-token "t-g104xxx"

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Local Agent

85.84%
按下载量换算2,173

安全审计

Socket

通过

权限和风险

敏感数据

该 Skill 可能接触密钥、Token、环境变量或敏感配置,应进入高风险复核队列,默认不自动发布。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills