Token导航 LogoToken导航TokenDH.com

这个功能太牛了!去年没做成的视频,我用LibTV做出来了

更新时间 2026-09-03来源 好好聊AI正文 2801字阅读约 9分钟7 张图片
去年没做成的尝试

去年没做成的“古人怼人”,这次我终于做出来了。我还让自己的IP跳了太空步和古装舞蹈。

去年有一阵子,古人怼人的视频特别火。

小明剑魔在直播时有一段很经典的画面。他歪着头贴近镜头,说“回答我,look in my eyes,tell me why baby”。后来很多人把视频里的人换成苏轼、鲁迅和各种古代人物,看起来又荒诞又好笑。

我当时也很想把视频里的人换成鲁迅试试。看起来只是换一个人说同样的话,真正做起来却很麻烦。动作、人物、声音和口型都要分别处理,我折腾了一圈,最后没有做成功。

今天看到LibTV上线了深度动作捕捉功能,我又把去年的那段视频找了出来。这一次,终于做成功了。

01

PART

直接参考和深度动作捕捉,差别在哪里

先看最难复刻的细微动作

人做一个动作很自然,一旦要写成提示词,就会突然发现自己根本说不清楚。

小明剑魔那段动作的幅度其实很小。歪头、靠近镜头、再离开镜头,每一步都不夸张,可那种味道全藏在细节里。

我先试了最直接的办法,把原视频作为参考,提示模型尽量还原动作和表情。后来又把同一段视频做了深度动作捕捉,继续使用同一张IP形象来生成。

为了看清这两种方式到底差在哪里,我把两段结果剪到了一起。我主要看三件事,头部歪斜的角度、人物和镜头之间的距离,以及每个动作发生的时间点。

VIDEO 01

直接参考原视频生成的版本,也会跟着做表情和头部动作,但仔细看会发现,动作的差别还是很大的。

使用深度动作捕捉生成的版本,变化会明显一些。人物先歪着头向镜头靠近,脸在画面中的占比随之变大,随后身体退回,再次向前探近。人物移动的方向、离镜头的远近和动作发生的先后关系,都保留得更完整。

这里说的视频质量更高 主要指的是动作完成度和动作相近度。它能做出几个相似姿势,也把姿势之间怎样衔接、人物怎样在镜头前移动一起带了过来。

为什么会有这个差别?中间生成的这段黑白灰视频,其实很关键。

VIDEO 02

 该视频使用了AI生成技术

这段视频用不同的灰度保留了人物轮廓、前后距离和场景里的空间层次。原人物的长相、服装颜色和房间细节被弱化了,模型接收到的重点变成了人物怎样移动、身体离镜头有多远,以及镜头怎样变化。

VIDEO 03

我又把深度动作捕捉的生成结果和原视频放在同一个画面里,这一次就能更清楚地看见,人物第一次靠近镜头、退回去、再次探近,以及头部向一侧倾斜的几个时间点,基本都能和原视频对应上。

直接参考时,模型既要理解人物和场景,又要自己猜动作里真正重要的部分。做过深度动作捕捉以后,动作和空间关系被单独提取出来,原视频里那些很难用语言写清楚的细节,就有了更明确的参考。

这也正好解决了我去年遇到的问题。我不需要再费力描述应该歪多少度、什么时候靠近镜头、退回去多远,模型已经能够从深度视频里读取这些信息。这比我去年做同样的事情,方便了太多太多。

02

PART

再试两个更复杂的动作

太空步与古装舞蹈

小动作能够跟下来以后,我又试了迈克尔·杰克逊的太空步。

如果让我们用语言描述太空步,哪只脚先动、脚尖怎样支撑、另一只脚什么时候向后滑、身体重心怎么换,真的很难写准确。

这一次,我使用深度动作捕捉功能生成了视频。脚步向后滑动、身体重心的变化和整个表演节奏都能看出来。

VIDEO 04

真正让我产生“自己好像也能成为影视主角”这种感觉的,是后面那段古装舞蹈。

原视频里,舞者在宫殿中旋转,长袖随着身体展开。镜头会靠近、拉远,也会从高处俯拍。里面还有复杂的脚步、走位,以及人物与桌榻之间的位置关系。

我让自己的IP形象换上古装,进入重新设计的宫殿场景,再使用原舞蹈的深度动作信息生成。她什么时候旋转、从哪里走到哪里、镜头什么时候拉远,都能找到比较清楚的对应关系。

VIDEO 05

看到自己的IP形象真的能够这样跳舞,我忍不住想说“天晴了,雨停了,我又觉得我行了”。我以前看到喜欢的影视片段,也会忍不住想,如果有一天,自己也能成为里面的主角就好了。现在这个想法,离普通人已经越来越近了。

03

PART

这个功能具体怎么用

三步完成动作提取与新视频生成

输入素材

原视频+人物图片

输出结果

保留动作与运镜的新视频

STEP 01上传原视频和人物形象图片

把想要参考动作的原视频,以及准备放进新视频的人物形象图片上传到LibTV画布。

STEP 02生成黑白灰深度参考视频

选中原视频,在顶部工具栏找到“逐帧拉片”,打开下拉菜单,点击“深度动作捕捉”。

图片

系统会弹出新的生成节点。默认480P,处理较快;720P支持30秒以内的视频,处理会稍慢。选择后点击“确认提取”,通常3分钟内完成。

图片

提取完成后,黑白灰深度参考视频会以新节点的形式出现在画布上。

 该图片疑似使用了AI生成技术,请谨慎甄别图片
STEP 03引用人物图片和深度视频生成新视频

把人物形象图片和这个黑白灰深度视频添加到下游的视频生成节点,作为生成新视频的参考素材。

容易漏掉

图片和视频放进参考区以后,还要在提示词中分别@它们。输入@,从素材列表中选择对应素材,看到带编号的图片、视频标签才算引用成功。只上传却没有引用,模型可能不知道每份素材负责什么。

图片

@图片1是人物形象,@视频2是刚刚提取出的深度动作视频。“动作运镜参考”这几个字也建议写清楚,让模型同时参考人物动作、位置变化和镜头运动。

模型选择SeaDance 2.5 我实测下来,效果会比较好。

生成前还要记得检查视频长度。参考动作只有几秒,就不要直接沿用一个很长的默认时长。按照自己真正需要的片段设置,能够减少无效生成,也能避免浪费积分。

我在测试时还遇到过视频像素过低、无法继续生成的提示。

图片

这时可以先选中视频,点击左上角的“高清”,开启“画质增强”,先生成一版更清晰的视频,再进行深度动作捕捉。我试下来,这样更容易成功。

图片

版权提醒

深度动作捕捉减少了原人物和原画面对结果的影响,但版权问题依然存在。公开发布时,参考素材仍要尽量使用自己拍摄、获得授权或可以合法使用的视频。

04

PART

动作做出来以后,还有剪辑

智能口播剪辑的真实体验

我以前录过一段时间的口播。录制还能坚持,真正让我泄气的是后面的剪辑。卡壳要删,重复的话要删,长停顿要删,几段视频还要重新拼起来。每次都要花很长时间,表达的热情也慢慢被消耗掉了。

这次,我上传了3段自己录制的口播,试了LibTV智能剪辑里的口播创作功能。

图片

它可以上传口播素材和补充画面,再写下剪辑要求和目标时长。系统会先完成粗剪,处理口水词、重复内容和停顿,把片段重新拼接。确认粗剪后,还可以继续做字幕、配乐等细节包装。

VIDEO 06

我实测下来,它现在还有提升空间。和自己在剪映里花一两个小时仔细剪出来的片子相比,精细程度还有差距。它更适合先快速完成一版能看的粗剪,把最耗时间的基础整理交给系统。

很多普通创作者并不缺想法,可一想到后面还要拍、还要剪、还要反复修改,那一点刚冒出来的表达欲,可能就慢慢缩回去了。视频能够更快做出来,我们或许就愿意多拍一次,再多创作一次。

///

文章标签AI资讯
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多