Token导航 LogoToken导航TokenDH.com
开发只读clawhub未标认证来源可访问clear审计通过

pet-video-narration宠物视频旁白

Agent Skill

用于辅助视频生成、动画合成、脚本化剪辑或 Remotion 等视频项目开发。它适合让 Agent 组织镜头、生成素材说明、维护合成代码或排查渲染问题。使用时需要确认分辨率、时长、素材路径和导出格式;涉及外部素材、人物肖像或商业发布时,应先核对版权授权和内容审核要求。

总安装

3,599

周安装

153

GitHub Stars

公开资料未说明

下载量

1,261
OpenClaw

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

MIT-0

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:pet-video-narration(宠物视频旁白)
来源仓库:https://github.com/zhanglinghao01-rakuten/pet-video-narration
安装命令:
openclaw skills install pet-video-narration
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 OpenClaw 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

ClawHubOpenClaw
openclaw skills install pet-video-narration

简介

宠物第一视角视频创作技能。当用户发送宠物视频并希望生成"宠物内心独白"风格的配音视频时激活。适用场景:(1)分析宠物肢体动作并解读其意图;(2)生成宠物第一视角的趣味文案;(3)文字转语音并音视频合并为成品。触发词:宠物视频配音、我的宠物在想什么、给宠物加旁白、宠物内心独白、pet video narration。

SKILL.md

name
pet-video-narration
description
宠物第一视角视频创作技能。当用户发送宠物视频并希望生成"宠物内心独白"风格的配音视频时激活。适用场景:(1)分析宠物肢体动作并解读其意图;(2)生成宠物第一视角的趣味文案;(3)文字转语音并音视频合并为成品。触发词:宠物视频配音、我的宠物在想什么、给宠物加旁白、宠物内心独白、pet video narration。

宠物第一视角视频创作 SOP

将宠物视频转化为"宠物内心独白"风格配音视频的完整流程。

核心流程(5步)

第1步:视频分析 → 第2步:行为解读 → 第3步:生成文案 → 第4步:音频生成 → 第5步:音视频合并

第1步:视频内容分析

使用 videos_understand 分析视频,prompt 结构化输出:

请详细描述:
1)环境场景(室内/室外、物品、光线)
2)宠物外观(品种、毛色、体型特征)
3)所有肢体动作(姿态、四肢、面部表情、尾巴/耳朵细节)
4)情绪状态(平静/警觉/好奇/兴奋/紧张)
5)动作发生的时间节点(0-X秒)

关键:记录精确时间节点,用于后续音频卡点。


第2步:行为解读(物种专项)

加载 references/pet-body-language.md 作为参考框架,结合视频具体动作,判断宠物意图。

常见意图模式:

  • 期待落空 → 撒娇/赌气型独白
  • 极度放松 + Sploot/侧躺 → 满足型独白(带点小傲娇)
  • 警觉 + 耳朵前倾 → 好奇探索型
  • 快速移动 + 跳跃(Binky)→ 开心宣泄型

结合宠物背景信息判断语气:

  • 活泼型 → 语气夸张、自信、有表情
  • 安静型 → 语气低沉、简洁
  • 高冷型 → 语气傲慢、爱搭不理
  • 黏人型 → 带点撒娇、小委屈

第3步:生成文案

原则:

  • 第一人称,宠物的视角
  • 不暴露名字/年龄/品种等客观介绍——这些只用于辅助意图判断
  • 对话式、有情绪、有态度
  • 长度与视频时长匹配(建议 10–20 秒内)

典型文案结构(按意图分类):

意图文案风格长度
期待落空委屈+赌气,有点小脾气中等
极度放松得意、满足、傲娇偏短
好奇探索兴奋+警觉,眼神到处看中等偏长
开心宣泄兴奋,不说话就是跑跳短或无配音

音频节奏建议:

  • 停顿模拟思考/撒娇节奏
  • 分段生成,每段对应一个动作节点
  • 10秒视频建议 2–4 个音频片段

第4步:音频生成

声线选择(batch_text_to_audio / synthesize_speech):

物种/风格推荐 voice_id
兔子/仓鼠/荷兰猪Chinese (Mandarin)_Cute_Spirit
猫咪Chinese (Mandarin)_Cute_SpiritChinese (Mandarin)_Soft_Girl
小型犬/活泼宠物Chinese (Mandarin)_ExplorativeGirl
大型犬/稳重型Chinese (Mandarin)_Warm_Girl
高冷傲娇型Chinese (Mandarin)_Crisp_Girl
英文版本English_PlayfulGirl

参数建议:

  • speed: 0.9–1.1(活泼宠物稍快,高冷宠物稍慢)
  • 多段时:分别生成各段 → 计算静音间隔 → 拼接为完整音频

静音间隔计算(卡点用):

gap_dur = max(0, next_action_time - (current_action_time + audio_duration))

用 Python 生成静音段 WAV,再转 AAC/M4A 后拼接。


第5步:音视频合并

FFmpeg 合并(Linux 环境):

# 音频合并
ffmpeg -y -f lavfi -i "anullsrc=r=24000:cl=mono" -t <duration> -q:a 9 silence.wav
ffmpeg -y -i <audio>.mp3 -ar 24000 -ac 1 <audio>.m4a
ffmpeg -y -f concat -safe 0 -i <concat_list.txt> -c:a aac <full_audio>.m4a

# 视频合并
ffmpeg -y -i <original_video>.mov -i <full_audio>.m4a \
  -map 0:v:0 -map 1:a:0 -c:v copy -c:a aac \
  -shortest <output>.mp4

音频时长验证: 确保合并后音频时长 ≥ 视频时长,-shortest 自动截断。

Linux 环境检查: ffmpeg 默认可能不存在,需先安装:

apt-get install -y ffmpeg

用户信息收集(不能少的步骤)

生成前必须向用户确认:

  1. 宠物名字(用于文案称呼,可省略)
  2. 物种/品种(辅助判断行为特征)
  3. 性别(影响语气)
  4. 年龄
  5. 性格关键词(如:莽撞但机灵、高冷、黏人、爱吃醋等)
⚠️ 这些信息不写入文案,只用于判断意图和语气。

输出文件规范

文件路径说明
最终成品视频/workspace/pet_final.mp4带音频的完整视频
独立音频/workspace/pet_audio.m4a方便用户在剪辑工具中二次编辑
各段音频/workspace/pet_seg*.mp3分段原件,供调试

质量检查清单

  • [ ] 视频内容分析包含时间节点
  • [ ] 行为解读结合物种特征 + 宠物性格
  • [ ] 文案语气符合宠物性格(不是通用旁白)
  • [ ] 音频卡点到动作变化节点
  • [ ] 最终视频有音轨(验证 codec_name=aac)
  • [ ] 文件大小正常(视频 ≤ 50MB)

适合场景

01

OpenClaw 用户查找和安装 Skill 时

02

用户想查找某类 Agent Skill 时

03

需要根据任务场景推荐可安装能力包时

04

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

补充不同宿主或平台的使用分布数据

能力 5

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

OpenClaw

88.36%
按下载量换算1,114

安全审计

VirusTotal

未展示

ClawScan

通过

Static analysis

通过

权限和风险

只读

该 Skill 主要提供规则、说明或参考内容,本身偏只读;真正读写文件、联网或执行命令仍取决于宿主 Agent 的任务。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills