今天我想沉下心来,认认真真给大家写一篇 AI 视频创作教程。
这篇教程会比较实操,我把自己最近做 AI 视频的完整流程拆开,从一个想法开始,怎么写剧本、做分镜、生成画面、生成视频,再到最后怎么剪成一条完整的片子。
里面用到的模型和视频 Agent,也都是目前比较新的版本。
我现在很推荐大家,有时间的话试着做一做 AI 视频。
因为我越来越明显地感觉到,这个领域还处在早期。工具和模型刚刚成熟,同时,真正稳定创作的人还不算多,应该还有红利。
废话不多说,先给大家看看我昨天下午做的这个成品。
如果放在几个月前,类似的视频,我可能需要做上两天。现在基本半天就能完成。
这里面当然有熟练度的原因,但更大的变化,还是来自工具。视频模型最近进步很快,人物、场景和镜头的稳定性都比之前好了不少。
视频 Agent 也开始真正参与创作流程,可以帮我们处理剧本、分镜、素材生成和剪辑这些工作。
这次我主要用的产品是 LibTV。我最近用它连续做了几个视频,整体体验还是挺超出预期的。
https://www.liblib.tv/
它把图片模型、视频模型、音乐模型和剪辑工具都融入到了一起,我们可以在同一个项目里完成大部分工作。
而且它支持 Skill,目前已经内置了 100 多个 Skill,覆盖商业广告、影视短片、短剧、动漫、MV 和自媒体视频等场景。
这里面有很多很具体的类型,比如古典武侠、苏联粗粝美学、新中式产品广告、无厘头喜剧、汽车 TVC、旅拍 Vlog,甚至还有专门用来复刻参考视频的 Skill。
比如我想做一个老剑客在破庙里等待决战的故事。正常情况下,我需要自己研究古典武侠的画面风格、镜头语言和人物造型,再一点点拆成分镜。
现在可以直接选择一个古典武侠相关的 Skill,剩下的,它会帮我搞定。有点像请来了一位熟悉这种题材的导演。
Skill 在这里:

当然,最后的故事讲什么、哪些镜头需要保留,依然需要我们自己判断。Skill 主要帮我们省掉前面大量摸索的时间。
#01
完整的教程
我这次想做的是一支讲人生阶段变化的短片。这个点子,是我在今日头条看到的一条评论。我当时觉得,这句话说得太有道理了:
少年时觉得友情最重要,青年时觉得爱情最重要,中年时觉得父母、爱人和孩子最重要。老了以后才明白,自己最重要。
于是我开始把自己的想象的几个画面,用语音输入法表达出来。最后再交给 ChatGPT 说我要做一个小短片,请它帮我基于这些信息生成一个剧本的初稿。

GPT 5.6 在这方面的能力非常强。远远好于 Opus 4.8 之类的模型。大家一定要用 GPT 5.6 来生成剧本的初稿。
但注意,有了初稿之后,还是需要自己二次迭代优化。
总结下,我的剧本生成的核心逻辑就是:
创意是我的,故事是我的。我把所有的这些想法通过语音输入法表达出来,最后让 AI 帮我生成初稿,我在初稿的基础上再继续优化。
这样就可以极大程度降低我的剧本创作成本。
故事里的男主从 15 岁走到 68 岁。
15 岁时,他觉得朋友最重要。20 岁时,他把爱情放在第一位。43 岁时,父母、爱人和孩子成为生活重心。到了 68 岁,他才慢慢意识到,照顾自己同样重要。
这类故事对画面的要求比较高。四个年龄阶段必须让人看出是同一个人,友情、爱情、家庭和老年生活又要有不同的环境与情绪变化。
单纯把剧本交给模型生成,容易出现人物变脸、年龄不对、场景跳跃,以及关键剧情没有被画面表现出来的问题。所以我先从人物形象开始处理。
我先用 Lib Image 把男主 15 岁、20 岁、43 岁和 68 岁的形象分别生成出来。
首次生成时,需要先签署人像安全协议。这一步和后续使用 Seedance 2.0 模型有关。
协议确认后,LibTV Agent 会根据我的要求生成不同年龄阶段的人物形象。

人物生成完成后,LibTV Agent 会整理出一份人物锚点清单。
这份清单里会记录人物的脸型、发型、年龄状态、服装、性格气质和其他识别特征。
对我来说,最有用的地方是,它把原本比较主观的形象要求整理成了后续可以重复参考的视觉条件。
做长时间跨度的故事时,人物一致性往往比单张图片好不好看更重要。只要男主在某个镜头里换了脸,观众就会立刻从剧情里跳出来。
先有锚点清单,再进入场景和分镜生成,对于后面的调整会有明确的方向。

主人公形象定了后,我就开始选择 Skill 进行创作了。

这里我选择的是,是枝裕和电影美学这个 Skill,它适合温情家庭主题和生活化叙事。大家看看效果。
LibTV Agent 顺带给了我一个锚点速查表。编号是 Agent 给锚点起的简称,node_key 是图片唯一 ID。
这个表是让 Agent 查阅用的,不用每次调用都去翻历史记录,直接用编号就能对应。
我们其实也可以用,想补某个分镜、替换某个场景、或者新增一段剧情,可以直接告诉 Agent:用 A02 男主 + S02 雨夜场景重新拍一条,Agent 能立刻找到对应的素材节点。

紧接着它和我确认我场景图和分镜表是否确认无误,准备要开始生成视频了。

因为故事中的人物关系会推动情节发展,张磊、妻子和女儿等配角形象,都会影响观众对剧情的理解。
所以,我让 LibTV Agent 先把主要出镜配角的形象定下来,再进入后面的镜头生成。
这样做的好处是,后面发现某个镜头不满意时,可以只调整人物或分镜头,不需要整支片子重新抽。

按照 LibTV Agent 视频脚本规划,中间有个视频通话的镜头,它问我需不需要把这个画面设计出来,还是简单略过。

人物锚点都生成好了后,选择确认,开始生成视频。

我想的最后跑出来的画布展示效果,就是一系列分镜头,最后给我合成一个成片。没想到它直接把完整的工作流给我整出来了,一目了然。

每个都是引用了参考图,然后写上提示词,去生成,对于不满意的分镜,可以直接重抽。

接着,因为这是第一版,需要调整的地方还有不少。所以这里的问题,我选择先不做后续处理。

在工作流画布里,可以看到每个分镜对应的参考图、提示词和生成结果。它适合检查完整的制作链路,也方便定位哪个分镜需要重抽。
如果画布里的节点比较多,那可以切换到故事板模式。
LibTV Agent 的故事板分为锚点元素,文本,图片和视频这几大块,展示上回比工作流规整很多。
其中视频模块,所有分镜头会按照时间线排开,我可以快速看出哪一段空镜太长,前后两个镜头是否重复,片子的情绪在正确的位置有没有发生变化等。
还可以点击“成片”手动对片子进行剪辑,最后直接导出到本地或者画布中。不过,现在它的剪辑功能还是比较简单。

之后,经过几轮调整后,效果就差不多了。

最后,我让 LibTV Agent 给片子加了双语字幕。这个功能真是非常方便。

还可以把这次做片子的过程保存成了自己的 Skill。在对话框里,点击 “Skill”,把鼠标悬浮到创建入口,点击将本次对话转化为 Skill。
前面这次创作里用到的人物年龄变化、场景规划和分镜安排等,都会被整理成一套可以重复使用的创作流程。
这一步对我来说挺实用。毕竟之前做完一个短片,方法和步骤基本就抛之脑后了,下次遇到类似题材,还要重新再跑一遍。现在 Skill 可以直接把经验固化。
保存完成后,这个 Skill 会出现在我的 Skill 里。点进去可以看到它的名称和适用说明,之后也能像调用其他 Skill 一样直接使用。
我刚刚用一份新的剧本测试了一遍,想看看这个 Skill 能不能独立完成一次创作。
这个 Skill 会先按照之前沉淀下来的方法拆解人物和场景,确定不同年龄阶段的人物形象后,再安排场景、分镜头和提示词.....这个体验,真的太爽了。
感觉经验要做一类短片的同学,一定要创建自己的Skill,至少能提效50%。

这个 Skill 一次直出的效果,还算可以吧。
#02
写在最后
以前看到一段 AI 生成的视频,我会下意识注意人物或者肢体语言真不真实。现在如果内容本身足够好,我已经不太在意它究竟是怎么制作出来的了。
就像前两天,我刷到一个博主,他一直在用 AI 把小学课本里的课文制作成视频,比如朱自清的《背影》,还有《火烧云》等等。
我去,这个就很有意思。
我把这些视频拿给孩子看,孩子很喜欢。毕竟小学生对文字的理解还有限,有些课文读完之后,脑子里很难形成具体的画面。
配上视频以后,人物、环境和情绪都变得直观了,我们家孩子孩子就更容易进入课文的语境。
由此往下想,还有太多类似的内容。
成语、寓言、神话、地方传说,以及散落在各个地方的民俗故事。再往大了说,还有诗歌、历史故事、中式科幻、玄幻和仙侠。
这里面很多故事以前很难被影视化。
一个题材的受众可能很窄,制作却需要演员、摄影、服装、场地和后期。投入几十万元拍摄出来,最后可能只有几万人愿意观看,怎么算都不划算。
当 AI 视频把尝试的成本降低到几百元,甚至更低,很多过去无法成立的题材就有机会成立了。
这让我想到移动互联网带来的变化。
以前还没有智能手机和短视频平台的时候,我在网上搜索老家的一道家乡菜,可能根本找不到它是怎么制作的。
因为当时拍摄、剪辑和发布一段教程,当时对普通人来说还是一件挺麻烦的事情。即使有人拍了,也很难找到愿意观看它的人。
后来,手机降低了拍摄成本,短视频平台降低了发布和分发成本。一个普通人站在自家厨房里,拿起手机就能录制教程。再小众的一道菜,也可能有人认真教我们怎么制作。
于是,互联网上突然出现了大量过去搜索不到的信息。AI 视频可能会带来一次类似的变化。我心荡漾。







