Token导航 LogoToken导航TokenDH.com
效率需要联网clawhub未标认证来源可访问clear审计提醒

video-subtitle-skill视频字幕技巧

Agent Skill

用于辅助视频生成、动画合成、脚本化剪辑或 Remotion 等视频项目开发。它适合让 Agent 组织镜头、生成素材说明、维护合成代码或排查渲染问题。使用时需要确认分辨率、时长、素材路径和导出格式;涉及外部素材、人物肖像或商业发布时,应先核对版权授权和内容审核要求。

总安装

9,302

周安装

380

GitHub Stars

公开资料未说明

下载量

2,979
OpenClaw

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

MIT-0

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:video-subtitle-skill(视频字幕技巧)
来源仓库:https://github.com/qwerty0205/video-subtitle-skill
安装命令:
openclaw skills install video-subtitle-skill
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 OpenClaw 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

ClawHubOpenClaw
openclaw skills install video-subtitle-skill

简介

自动生成多语言字幕并支持翻译与人声分离处理。

  • 适用于播客、访谈类视频的多语种传播需求。适用宿主包括 OpenClaw,接入前应确认版本、权限和运行环境要求。
  • 传入音视频文件即可获得 SRT/VTT 格式字幕。
  • 涉及敏感内容时应进行二次审核以确保准确性。
  • video-subtitle-skill 属于效率类 Skill,可作为该场景下的辅助能力补充。

SKILL.md

name
video-subtitle-skill
description
为视频/音频自动生成字幕,支持多语言识别、翻译、说话人分离、字幕烧入视频

视频字幕生成器 (Video Subtitle Generator)

基于 SenseAudio ASR API,为视频或音频文件自动生成字幕。

核心功能

  1. 语音识别 — 自动识别视频/音频中的语音内容,生成带时间戳的字幕
  2. 多语言支持 — 支持中文、英文、日文、韩文等 20+ 种语言
  3. 字幕翻译 — 识别后可自动翻译成目标语言
  4. 说话人分离 — 多人对话场景自动区分不同说话人
  5. 字幕烧入 — 将生成的字幕直接烧入视频输出新文件
  6. 多格式输出 — 支持 SRT / VTT / TXT / JSON 格式

使用方式

用户说出类似以下请求时触发此 Skill:

  • "帮我给这个视频加字幕"
  • "识别这个音频的内容并生成字幕"
  • "把这个英文视频翻译成中文字幕"
  • "帮我总结一下这个视频讲了什么"

执行步骤

第一步:检查 API 密钥

echo "SENSEAUDIO_API_KEY=$SENSEAUDIO_API_KEY"

如果 SENSEAUDIO_API_KEY 为空,必须先向用户询问,说明在 https://senseaudio.cn 注册获取。不要直接运行脚本让它报错。

第二步:运行脚本生成字幕

# 基础用法
python scripts/video_subtitle.py "/path/to/video.mp4" --output outputs/

# 指定语言 + 翻译
python scripts/video_subtitle.py "/path/to/video.mp4" --language zh --translate en

# 生成字幕并烧入视频
python scripts/video_subtitle.py "/path/to/video.mp4" --burn --font-size 28

# 说话人分离
python scripts/video_subtitle.py "/path/to/meeting.mp4" --model pro --speaker

注意:如果环境变量 SENSEAUDIO_API_KEY 已设置,无需 --senseaudio-api-key

第三步:内容总结(如用户需要)

脚本会输出纯文本转写结果(*.txt)。如果用户需要视频内容总结,你(Claude)直接读取这个 txt 文件并总结,不需要调用外部 LLM。

第四步:返回结果

将生成的字幕文件路径(和烧入后的视频路径)返回给用户。

ASR 模型选择

模型参数值特点适用场景
极速版lite毫秒级响应、30+ 语言低成本批量转写
标准版standard功能全面、性价比高通用转写、视频字幕(推荐)
专业版pro高精度、说话人分离会议记录、访谈、多人场景
深度版deepthink智能纠错、方言增强方言/术语较多的场景

环境要求

  • Python 3.10+,依赖:requests
  • 系统依赖:ffmpeg(音频提取和字幕烧入)、fonts-noto-cjk(中日韩字幕烧入需要)
  • SENSEAUDIO_API_KEY — SenseAudio API 密钥(唯一需要的密钥)

参数说明

参数说明默认值
input输入视频/音频文件路径(必填)-
--output输出目录输入文件同级 subtitle_output/
--modelASR 模型 (lite/standard/pro/deepthink)standard
--language音频语言代码 (zh/en/ja 等)自动检测
--translate翻译目标语言代码不翻译
--speaker启用说话人分离
--sentiment启用情感分析
--burn将字幕烧入视频
--font-size烧入字幕字体大小24
--format字幕格式 (srt/vtt/both)srt
--senseaudio-api-keySenseAudio API 密钥环境变量

输出文件

文件说明
文件名.srtSRT 格式字幕
文件名.vttVTT 格式字幕(需指定 --format vtt/both)
文件名.txt纯文本转写结果
文件名_detail.json详细识别结果(含时间戳、说话人等)
文件名_subtitled.mp4烧入字幕的视频(需指定 --burn)

支持的语言代码

zh(中文) en(英文) ja(日文) ko(韩文) fr(法语) de(德语) es(西班牙语) pt(葡萄牙语) ru(俄语) it(意大利语) ar(阿拉伯语) yue(粤语) nl(荷兰语) id(印尼语) ms(马来语) th(泰语) tr(土耳其语) vi(越南语) 等

适合场景

01

OpenClaw 用户查找和安装 Skill 时

02

用户想查找某类 Agent Skill 时

03

需要根据任务场景推荐可安装能力包时

04

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

补充不同宿主或平台的使用分布数据

能力 5

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

OpenClaw

70.97%
按下载量换算2,114

安全审计

VirusTotal

通过

ClawScan

可疑

Static analysis

通过

权限和风险

需要联网

该 Skill 可能需要联网访问来源站点、仓库或外部 API;具体网络访问范围需要结合源码和 README 复核。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills