你今天听到的,和你真正做出来的,是两回事。
去年,MovieFlow 的系统里还有 20% 的代码是人写的。今年,这个数字变成了零,100% 由 AI 完成。
同一批人,正在把 200 到 300 人的传统电影剧组,压缩到 20 人。
这两个数字放在一起,就是 AI 视频行业此刻的真实水位:执行层的活儿,机器吃得比所有人预想的都快。
过去一年,这个行业被反复讨论的问题是“抽卡”。偶然生成一条好片不难,难的是每一次都能稳定生成一条好片。
在非凡资本最近的一场圆桌里,四家从不同方向解决这个问题的公司坐到了一起:做3D和物理可控视频生成的极泛流形、做视频 Agent 平台的 MovieFlow、做漫剧和 AI 视听的极速引擎 Anigo、做工业化批量生产的炫佳科技。
听完整场,我的感受是:“抽卡”这个老大难,正在被工程化快速消灭。但它消灭之后露出来的东西,比抽卡本身更值得琢磨。
消灭抽卡:四条完全不同的路,都走通了
角色一致性是抽卡的重灾区。单条视频里角色好不好看,难度不大;难的是第 15 个镜头里的人,和第 2、第 3 个镜头里还是同一个。
四家公司的解法,几乎没有重叠。
炫佳科技 CEO 秦林给的答案最“工科”。他的判断是:只要大模型还在用 Transformer 架构,去噪过程中每次生成的角色就必然有差异,单靠模型侧不可能彻底解决。
所以他们在模型外面套了三层工程约束:输入主角时做样本锚定,生成差异过大就自动重绘;角色主体库和场景主体库双重约束;再拿大量专业摄影和导演术语做提示词工程。
效果可以量化:95% 的机械化生产,剩下 5% 人工调优。他们的 KinoAuto 模块,丢进去一本小说,4 小时后生成一部影片,接近零人工干预。一部 120 分钟的短剧,成本压到 5000 到 10000 元,一个人一天就能完成。

MovieFlow 创始人梁巍的路子完全不同:真人打底。他们原来是做电影的,现在的做法是建一个真人演员库。
物理世界里这个人真实存在,采集得足够清楚,再做加权和训练,之后调用他就跟调用照片和素材一样,基本不会有一致性问题。
这套打法的市场反馈也不错:MovieFlow 上线快一年,全球 150 万用户,覆盖 170 多个国家。

极泛流形的黄乃元最坦诚。被问到角色一致性怎么解决,他直接说:“还是要交给大模型去提升。”
他们All in的是3D和物理可控的视频生成,就是保持场景背景和物体的一致性,让空间关系和镜头运动更可控,让生成结果更符合物理逻辑。例如,先明确场景结构和机位,再交给视频生成模型执行,从而提高同一场景在不同镜头下的一致性。

Anigo 的王俊则把宝押在智能体工程化上:把什么任务交给什么样的 Agent,决定了角色稳不稳。

四条路,原理互不相同,但每条都拿出了能交付的结果。这本身就说明一件事:角色一致性已经从一个技术攻关问题,降级成了一个工程选型问题。选哪条路都行,反正都能到。
脸不崩只是入门,戏不崩才是难题
但聊深了会发现,“脸保持一致”只是最容易的那层。
王俊把一致性拆成两层:视觉一致性和叙事一致性。视觉层面,大模型本身的能力已经做得很好。难的在长篇:单次生成有 30 秒上下的边界,超过这个长度,问题就变成了 Agent 之间如何协同,维持角色在叙事层面的连贯。
他举的例子很形象:前一个镜头里角色还非常兴奋,下一个镜头突然变得拘谨。王俊的原话是:“一开始他可能是个疯子。”
梁巍管这个叫表演一致性,话说得更直。
我们看戏看的是表演,光是脸像其实没有意义。
一场戏里,角色可能从愤怒到平和,再到愤怒,最后和解。这个状态的流动才是一场戏。纯 AI 要做到这一点,目前确实麻烦。
秦林那边也承认边界。95% 之外的那 5%,集中在极端情况,比如大幅逆光。但他给了一个有意思的对照:现实拍摄里,逆光同样会让面部难以识别。
AI 的短板,有一部分本来就是摄影的短板。
“镜头再收一点”,收多少?
镜头控制聊出来的结论,跟技术关系不大。
王俊说,很多人会跟 AI 提“镜头推进一些”这种需求。但什么叫推进一些?真交给执行导演,他一定会把需求追问到非常细:怎么走,走多少。这是个极其模糊的指令。
梁巍把这个话题彻底挑明了。他说,今天把任何一个人放到正式片场,都能坐上导演椅喊“Action”。AI 也一样:你提出需求,喊一声 Action,全剧组几百人开始干活,演员拼命演,摄影机拼命拍。
难的是喊“Cut”。
“你喊了 Cut,全场停下来看你,他们在等另一个结果:这一条到底 OK 不 OK?”
王俊补了一句所有用过 AI 生成的人都会心一笑的话:一般用户只会说,“我感觉不太对,你再想想。”
那到底什么才叫行?梁巍的判断是,大语言模型处理了中间 98% 的工作,但所有人期待的,是最后那个导演判断。
大语言模型处理了中间 98% 的工作,但所有人期待的,是最后那个导演判断。
所以工具层没有本质区别:“今天你有 3D 导演台,明天我也能有。”真正的区别在于使用者,让张艺谋来做同一场戏,出来的就不是一回事。
AI 把所有人的底线从 0 分拉到 80 分、90 分,结果导演专业反而更值钱了。
200 人砍到 20 人,砍掉的全是执行
剧组从 200 人压缩到 20 人,谁留下了?
梁巍给的清单是:编剧、导演、融合了摄影指导能力的美术指导、懂表演和剧情的表演指导、物理世界里的主要演员,还有剪辑。
剪辑被单列出来讲。短剧、漫剧可以一键剪,因为 2 秒、3 秒、8 秒、10 秒都有相对标准。但电影剪辑没有标准。
蒙太奇可以在某个瞬间“咔嚓”一剪,让你吓一跳;也可以故意一直不剪,让你烦,让你期待后面到底有什么。
剪辑是第三次创作,AI 目前无法替代。
秦林从另一个角度给出了同样的结论。他说有两个环节是智能体和模型解决不了的。
第一个是剧本:很多人用 AI 写小说、写剧本,但都触及不了人类情感的灵魂,因为“机器只能从已知导向已知,不能从已知导向未知”,而人最厉害的地方,恰恰是想象未知世界。
第二个是顶级导演对镜头感和美感的把握,审美很难被参数化、被蒸馏。没有人工干预,纯 AI 成片的天花板就是七八十分。
于是未来的协作框架很清晰。梁巍的表述是:人负责最前面的 1%、交付结果后的 1%、提出下一轮要求的 1%;中间每次执行的 98%,交给 AI。
这 20 人剧组减少的,是大量执行性的体力工作。而从事创作、有判断力的人,一个都没走。
下一个 Vibe Coding,会是视频生成吗?
聊到这里,还有一道绕不开的判断题:AI 产品的下一个 Vibe Coding,是视频生成吗?
秦林拆过 Vibe Coding 能跑通的原因:代码有规范、有标准、重复频率高。越标准、越高频,越容易商业化。
沿这个逻辑,现阶段 AI 视频真正跑通的单一场景就是短剧,因为短剧恰恰最符合代码的逻辑:公司化、流程化、标准化,创意占比低,是典型的爆米花式内容产品。
他眼里的未来视频分两块。一块是精品电影:好导演加好工具,几百万到 1000 万就能做出原来要几个亿的电影。
另一块是纯工业化生产的短剧、广告、电商、数字人。两块加起来,未来 10 到 15 年,可能是一个 10 万亿级的产业。
黄乃元的提醒更冷静:Vibe Coding 大概率只能解决视频生成里的一小部分问题。做产品要看清楚,哪些事是视频生成基模中短期内不会覆盖的。水位一涨,只做简单加工的产品会先被淹没。
梁巍的答案最锋利,也最像给所有人的建议。第一,不要焦虑技术。今天讨论的一致性、剧组管理工具,一定会有人做好,不需要每个创作者亲自操心。
第二,抓紧入场。技术进步已经远超想象,他们和香港电影人合作的成熟剧集,成片已经完全看不出 AI 痕迹。
他甚至判断,未来可能出现一部“非洲版《甄嬛传》”,背后制作团队全部来自中国,因为全世界 AI 视频制作最强的地方就是中国。
他最后一句话,我想直接用作这篇文章的结尾:
你今天听到的,和你真正做出来的,是两回事。
更多对话细节
嘉宾
极泛流形 COO 兼联合创始人 黄乃元
MovieFlow 创始人 梁巍
极速引擎 Anigo 创始人兼 CEO 王俊
炫佳科技 CEO 秦林
主持人
非凡资本 合伙人 王朝超

开场:四家从不同方向解决“抽卡”的公司
王朝超:过去一年多,大家反复讨论的一个问题,就是如何从偶然生成一条好片,走到每次都能稳定生成一条好片。大家都想减少“抽卡”的损耗,提高成功概率。
今天邀请到的四位嘉宾,都在致力于减少抽卡,让每一次交付都能产出好作品。所以今天的关键词就是“稳定的工作流”。
话不多说,请四位嘉宾分别介绍一下自己。秦总,从您这边开始。
秦林:大家好,我叫秦林,我们公司叫炫佳科技。我们从母公司算起,在视频行业已经耕耘接近 30 年,最早的创业团队全部来自清华大学。我们的前身是 1997 年从清华独立出来的清华永新。
从清华分离出来以后,我们独立完成了技术突破,其中一项就是推动视频从模拟电视转向数字电视。在这个过程中,我们于 2007 年在纽交所上市。
上市以后,又分出了二十多家企业,也都紧密围绕视频产业:有做云游戏视频流化的,有做视频网站的,有做直播软件的,也有做机顶盒的。
我们这家公司在南京,一直围绕视频超分、修复、压缩和解码来做。2022 年,我们开始全面投入 AI,也是省内第一批完成自主大模型研发、模型工具和视频工具开发,并打通视频技术底座的企业。
今年是我们走向 AI 的第四年,过程中有很多心得,也踩过很多坑。非常感谢主持人给我这次机会,跟大家分享过程中的心得和收获。谢谢。
王俊:很高兴来到非凡,跟大家见面。我是王俊,我们也是一家南京企业,公司叫极速引擎。我们从最开始做动画,到接触所谓的 AI 动画,再到现在做漫剧和 AI 视听,整个产业阶段都经历过。
我们从做内容,到技术驱动内容,再到现在做自己的智能体,也经历了一段时间,几乎什么都碰到过。所以我一直自嘲,前几年是在跟甲方和观众斗智斗勇,最近几年是在跟 AI 斗智斗勇。
我们也希望,未来能在视频产业里,和现在非常卷的大厂一起找到一线生机。
梁巍:我是 MovieFlow 的梁巍。我们原来是做电影的,All in AI 是从 2025 年到 2026 年,也就一年多。正好这个月是 MovieFlow.ai 上线快一周年。
现在我们在全球有 150 万用户,覆盖大概 170 多个国家。C 端方面,去年上线时,我们应该是全球第一批视频 Agent;今年已经有一千多个,实在太多了。
我们在全球 C 端市场做得还可以,有画布、工作流、Agent,也有对话式生成。但从今年年中到现在,MovieFlow 更多地开始深度进入专业内容。
因为我原来是做电影的,所以从今年五六月份开始,我们已经深度参与到目前为数不多、还在实拍的重要影视项目中,用 AI 帮助它们降本增效,真正进入实际制作。
另一方面,我们也借助 AI 工具完成新的专业故事创作,重新组建线上的“剧组”。
未来影视环境里会出现两种内容:一种以实拍为主体、AI 为辅助,实拍比例可能从原来的接近 100%,慢慢降到 20% 至 30%,AI 则提高到 70% 至 80%。
另一种是,专业影视工作者和年轻一代影视工作者,把原来影视剧组里的十几个专业分工重新合并、打散。原来一个 200 人的物理剧组,可能变成线上 15 人的剧组。
这支剧组依靠一套专业工作系统,能跨时区、跨地域,甚至跨国家完成专业创作,最终拿出专业作品。这些作品肯定不局限于现在的短剧和漫剧,会更加专业、质量更高。我相信接下来会进入这样一个阶段。
MovieFlow 现在正和专业电影人一起做内容,并在这个过程中构建这套创新的协作系统。这也是我们看向下一阶段的判断:大模型今年开始要进入实际工作,真正交付了。
王朝超:所以这是一个从电影转向 All in AI 的团队。好,黄总,您这边。
黄乃元:我是极泛流形的黄乃元。我们做的是3D和物理可控的视频生成,主要提供底层技术解决方案。简单来说,我们解决短剧的2个问题:
1. 精确镜头语言的控制(自由运镜、角色站位等)从而不用反复抽卡
2. 同时确保场景、角色(尤其高矮胖瘦)、道具的跨镜头的长程多视角一致性,场景还是可编辑、可布景的。
王朝超:四位嘉宾介绍完了。我准备了四个问题,分别关于角色、镜头、工作流和质检。我们先从第一个问题开始,这是一个非常具体、也让创作者很头疼的问题:角色一致性。
单条视频里的角色好不好看,难度没那么大;难的是第 15 个镜头和第二、第三个镜头里仍然是同一个人。行业里目前的解法差异很大,有的用 3D 资产绑定,有的用身份特征锚定,有的用 Agent 约束,也有的干脆把人物做成资产库来管理。
所以我的问题是:在四位各自的产品和技术体系里,角色一致性通过什么技术路径实现?当镜头大幅切换,人物有大幅动作,或者场景光照剧烈变化时,你们的机制边界在哪里?一共两个小问题。先从乃元这边开始。
角色一致性:人不变,怎么实现
黄乃元:我们做剧还是小学生,主要提供底层技术。我们的方向是3D和物理可控的视频生成,希望保持场景背景和物体的一致性,让空间关系和镜头运动更可控。比如,在生成前明确场景结构、分镜和运镜,再把这些信息作为约束交给视频生成模型。
王朝超:这已经是第二个问题了,还没到镜头,现在说的是角色。
黄乃元:对。
王朝超:我说的是,人不变怎么实现。
黄乃元:如果说的是人物长相的一致性,我觉得仍然需要大模型持续提升。我们更关注场景背景和物体的一致性,以及空间关系和物理逻辑的可控性。
王朝超:好,梁总。
梁巍:角色一致性其实非常简单。因为我们已经进入实际做片的阶段,用的是物理世界里的演员,所以 MovieFlow 未来会提供一个比较大的演员库,以真人演员为主。
物理世界里有这个人,只要采集得足够清楚,再对人物资产和造型做一定的加权和训练,那么不管是在工作流、画布还是 Agent 创作工具里,基本都不会再有一致性问题。后面就跟调用照片、资产和素材一样。
王朝超:就是真人打底。
梁巍:对,用稳定的真人素材打底。
王朝超:好,王总您这边的答案是什么样的?
王俊:我想把“一致性”拆开,从视觉一致性和叙事一致性来聊。视觉层面,不管是 3D 还是 2D,也不管具体用多视图还是其他方式,通过大模型本身的能力,其实已经可以做得很好。除非遇到非常特殊的镜头或运镜,才可能稍差一些,出现幻觉。
比较难的还是长篇,或者视频比较长的时候。单次生成毕竟有时长限制,大模型在 30 秒这里存在边界。超过这个时间,我觉得最难的是 Agent 之间协同,如何维持角色在叙事层面的一致性。
比如前一个镜头里他还非常兴奋,下一个镜头突然变得非常拘谨,这就比较难处理。Agent 之间交互时,需要交代清楚各自的任务。我觉得,这可能比普通用户理解的角色长相一致性更难。
王朝超:也就是说,长相一致性问题不大,但角色在不同情绪下的表达一致性更难。
王俊:一开始他可能是个疯子。
梁巍:老王说的是表演一致性。一个角色从戏的前面演到后面,因为我们看戏看的是表演,光是脸像其实没有意义,演出状态很重要。
要把故事讲下去,他可能从一开始的愤怒到平和,再到愤怒、平和,最后和解。这个过程才是一场戏。如果是纯 AI,这一部分确实有时比较麻烦。
王朝超:那王总你们是通过什么样的技术手段去实现?
王俊:它可能还是需要做好智能体的工程化,关键是怎么交付信息:把什么任务交给什么样的 AI Agent,这非常重要。比如刚才说的从愤怒到平和,也可能要考虑,这个人的性格是不是就不应该这样做。
王朝超:既怕它超纲,又怕它随意涌现,是吧?
王俊:对,是的。
王朝超:好,秦总。
秦林:只要现在的大模型仍然采用 Transformer 架构,人物一致性就不可能单靠模型侧彻底解决。因为在去噪过程中,每次生成出来的角色都会有差异。恰恰因此,在做 Agent 或工具的过程中,工具是非常重要的一环,它可以对大模型做优化。我们从三个路径解决这个问题。
第一,在输入主角时做样本锚定。我们会根据主角的五官比例、面部特征和个体差异,用自研算法约束和锚定主体。在去噪过程中,我们会在检测对抗的 GAN 环节加入约束。如果生成角色与我们锚定的角色差异过大,就让模型重绘,从而避免人工抽卡。
第二,我们提供双主体库:一个是角色主体库,一个是场景主体库。角色库和场景库双重约束,会大幅降低抽卡概率。
第三,我们用提示词工程对智能体流程进行约束。在这个过程中,会大量采用专业摄影和影视导演术语,尽量减少人工介入,让生成面部接近初始输入。但这种情况下也只能做到约 95%,因为一定会有极端情况,比如大幅逆光。
现实拍摄中也会遇到逆光造成面部难以识别;角色或场景快速切换时也可能产生面部扭曲,很难仅靠工程化方法解决。这时就需要人工补足。现在基本能做到 95% 机械化生产,另外 5% 仍需人工调优。
我们有两个单独的模块。一个叫 KinoAuto,只要丢进一本小说,4 个小时后就可以生成一部影片,几乎是零人工干预、零抽卡。另一个是 Plus 2.0 版本,也能以接近零抽卡的方式,用工业化、批量化方式生产内容。
一部 120 分钟的短剧,成本几乎可以压缩到 5000 至 10000 元,一人一天就能完成。这是我们通过工程优化达到的效果。谢谢主持人。
镜头控制:什么叫“推进一些”
王朝超:刚才聊了角色。角色稳定下来之后,下一个问题就是:如何让 AI 听懂导演在说什么、导演想要什么?景别、运镜、轴线、节奏,都是视听语言的基本语法。但对模型来说,它更多给出概率性的建议,也就是抽卡,而不是执行确定性指令。
目前行业在镜头控制上主要有两个方向:一种是把分镜做成可预览的中间态,先在 2D 或 3D 空间里锁定静态图或运动图,再交给 AI 把它们连起来做成成片;另一种是多 Agent 协同,让摄影、分镜等不同 Agent 翻译导演意图。
所以我的问题是:在你们各自的实践中,镜头控制最有效的方式是什么?从分镜意图到最终画面,最大的信息损耗发生在哪个环节?你们选择在前端施加更强的约束,还是在后端做更多筛选和修复?黄总,从您这边开始。
黄乃元:刚才讲到,我们的方向是3D和物理可控的视频生成。在镜头控制上,可以通过明确场景结构、机位和运动路径,为模型提供更精确的约束,同时保持场景背景和物体的一致性。但这些操作目前仍然比较复杂,对普通用户不够友好。所以我们希望通过Agent和自然语言交互,把这些控制能力变得更容易使用,包括运镜。
前段时间大家应该看到李飞飞博士发布的一个 Demo:可以在场景里从多视角浏览整个场景,也可以做类似“子弹时间”的效果。
我们要把这样的流程做得足够简单、足够 Agent 化。现在,我们可以通过比较自动化的方式,把物体直接摆到场景里的合适位置。不管是人物还是产品,都能放到合适位置。
运镜也可以 Agent 化:你在与 Agent 交流的过程中,它可以自动生成想要的各种运镜。生成后,你只需要做简单微调,比如这里稍微改一下、那里稍微改一下。对大多数普通用户来说,这就比较容易上手。
所以,我们希望把这些控制能力融入更简单的Agent工作流,在保持场景背景和物体一致性的基础上,让用户更容易调整空间关系和镜头运动,做出更符合自己意图、也更符合物理逻辑的视频。
所以我们会 All in 整套 3D 流程,尽量让它足够 Agent 化、足够简单,让大家更容易控制和调用。
王朝超:这听起来更像是真人在真实空间里的视觉感受。
黄乃元:对,这是其中一种方式。我们整体做的是3D和物理可控的视频生成,既关注场景背景和物体的一致性,也关注空间关系和镜头运动的可控性,让生成结果更符合物理逻辑。
王朝超:物理空间不变,镜头放在哪里、怎么用,都不会有太大出入。
黄乃元:对,没错,是的,可以这么理解。
王朝超:也就是从 3D 空间出发去控制。
黄乃元:对,没错,是的。
王朝超:好,梁总,你们这边的方案是什么样的?
梁巍:其实,“听懂导演语言”这件事,首先你得是个导演,对吧?
王朝超:也就是说,你得有审美。
梁巍:你也可以直接口述需求。现在不管是大语言模型本身,还是各个工具内嵌的模型,不管是 OpenAI、Claude、Kimi,还是其他模型,都能推演出来。比如你说:“我想拍一场对手戏,我是导演,请给我一套三个人对话戏的分镜。”它都能推演。
我觉得,大语言模型依托各类视频模型和多模态能力,已经具备这种推演能力,也掌握相关知识,所以这本身不是特别难。难的是,你到底想创作什么、想做什么东西。
MovieFlow 为什么下场做专业内容?因为我们发现,即使把工具和平台放到大家面前,一键生成也未必解决问题。
我们刚上线时就做一键生成;今年 1 月已经能一次生成 10 分钟,那时还没有人谈这件事,前两个月大家才开始说能一键生成 10 分钟。包括多 Agent 体系,我们去年九、十月就上线了,只是没有在国内推广。
从我的角度看,导演语言还是要放到具体场景中:你到底要完成什么视频创作需求?
如果做广告、电商或其他展示型内容,我觉得可以直接和 Agent 聊,再找到合适的素材,甚至合适的样板。现在包括我们在内,都有大量一键复刻功能。
你看到一条 YouTube、TikTok 或抖音广告,可以直接复刻;大语言模型帮你拆解它的运镜逻辑和展示逻辑,再换上你的产品,它就成了你的广告。你复刻的是节奏和展示过程。
现在不管是大模型、多模态语言模型还是视频模型,本身都有 Agent 能力。所以模型本身具备导演能力,区别只在于大家如何调用。你只要跟它讲清楚就好。
更重要的是,在具体应用场景里,你是否知道导演要做什么、最终要作出什么决定。
未来,我们会把一些专业影视项目中,专业导演实际创作的过程全面开源。你看上去可能根本感觉不到 AI 参与,但我们会像海外的 Higgsfield 那样,开放大量制作过程。
把一场戏的制作过程开放给用户后,专业导演在创作中沉淀下来的工作能力和交付能力,就能供大家参考和模仿。这比大家在 B 站“拉片”又往前走了一步——你可以直接复刻片子,而其中就包含导演语言。至于最终怎么讲故事,还是取决于你。
所以镜头控制这件事,在 MovieFlow 或其他具备 Agent 能力的平台上,目前都不难。难的是,你首先要确定自己在做导演的工作。
王朝超:技术不是问题,好创意、好内容,或者说好的想法,才是核心。主要方式是多聊天,但输出给 AI 的内容,仍然要来自真正好的想法。
梁巍:是的。
王朝超:好,俊总你们这边。
王俊:我认同梁总的意思。很多使用工具的人毕竟不是导演。所以如果问 AI 如何理解、把控或翻译导演意图,前面的定义可能就不成立:那不一定是导演意图。这个前提很重要。
沿着这个问题往后说,大家在使用 Anigo、MovieFlow 这类工具时,要先确定自己需要的是确定性还是不确定性。你希望把多少不确定性交给 AI,又要保留哪些确定性?
比如刚才黄总提到的 3D 机位,我们也可以做;二维分镜也是一样。确定性和不确定性之间要有平衡,而这个平衡会影响人机交互的次数和环节。
所谓全自动化,其实建立在几个问题上:你要什么内容,要多少确定性和不确定性,又想让 AI 承担多少创意。
话说回来,我们也会尝试翻译导演意图。举个简单例子,有人说“推进一些”,到底什么叫推进一些?真交给执行导演,他一定会追问,把需求问得非常细。
梁巍:对,什么叫推进一下?最重要的是,他得是个导演。你说镜头再收一些、Close 一些,到底要收多少?
王俊:没错,怎么走?这是一个非常模糊的需求。
王朝超:这里就有一个问题:AI 或大模型提升得太快,导致导演“平民化”。你们刚才口中提到的导演,指的是专业导演。
梁巍:我的理解里,导演有很多层次。今天把任何一个在场的人放到正式片场,大家都可以坐在导演椅上喊“Action”。这很像大家现在使用 AI:你提出一个问题,喊“Action”,所有人就开始做。
但最终你还要喊“Cut”。喊完以后,全场几百人的剧组都看着你,因为他们在等另一个结果:这一条 OK 不 OK?你喊了“Cut”,就得作出决定。AI 也是一样,它帮你做完这件事,等着你说这条到底行不行。
王朝超:然后我也不知道。
梁巍:如果你不是导演,怎么判断这个镜头?今天的视频模型、大语言模型和 AI,好像把所有人的底线一下拉得很高:原来是零分,现在大家觉得做视频很简单,一下就到 80 分、90 分了。但这并不意味着导演专业不重要,反而更重要。
大语言模型只处理中间 98% 的工作。你坐在片场喊“Action”,全剧组几百人开始干活,演员拼命演,摄影机拼命拍;只要你喊一声“Cut”,全场停下来看你。大模型就是这样,大家期待的是导演判断:这条到底行不行?
王俊:一般用户都会说:“我感觉不太对,你再想想。”
梁巍:所以,“感觉不行,你再来一条”,那到底什么才叫行?
王朝超:瓶颈不在 AI。
梁巍:一定在于使用者的专业能力。让张艺谋导演坐在这里,跟王俊、梁巍做同一场戏,结果就不是一回事。所以一切还在使用者。
工具层没有那么难,因为模型能力已经很强,所有人调用的都是模型能力,这一点没有疑问。去年我们做的时候,会强调工具层、应用层的价值。今年应用层当然仍有价值,但更多在于实际工作中沉淀的垂类经验,继续往下深挖。横向的通用能力,大模型已经都有了。
你说 [原音不清]、MovieFlow 和 Higgsfield,没有本质区别。今天你有 3D 导演台,明天我也能有。真正的区别在于,使用者到底来做什么。
还要看,如何在垂直场景里让使用过程更接近交付。也就是说,把一个人扔到片场时,给他配一个特别厉害、很有经验的执行导演,站在旁边告诉他:“老板,这条可以过。”有人在他耳边提醒。
我觉得很多做工具、技术和 Agent 的人,应该做到这一层:把你扔到片场时,在旁边放一个非常专业的助手。这样就可以了。但你不可能既不懂导演,也不学习这件事。
王朝超:好,秦总,您这边的答案是什么?
秦林:因为我是工科生,擅长用工科思维理解世界。AI 带来的是技术平权。什么是技术平权?就是人人都有可能做导演。我们可能做不了 100 分或 120 分的导演,但经过训练,可以做一个 70 分、80 分的导演;再努力一点,也可以做到 90 分。
我们怎么用技术解决这个问题?第一步,我们会做两个智能体:一个是分镜智能体,一个是摄影智能体。它们主要替代导演工作中的一部分专业任务,比如怎么切分镜、怎么选择摄影角度。
前期我们会请大量专业导演,一起训练提示词、修正参数,把很多导演几十年的功力和理解,通过参数和提示词做成模型的后训练。它未必能达到 100 分或 120 分导演的水平,但我们会尽量让它在产出过程中达到入门级甚至更高一级,保证第一步输出接近专业水准。
第二步,在生产过程中,我们先生成低分辨率动图,作为过程解释。不会一次性直接生成成片,而是先生成动图,让更专业的导演判断画面是否符合摄影和影片需要。如果符合,就继续生成;如果不符合,可以进行二次生成。这样能大幅降低算力消耗和返工概率。
第三步是在生成片子之后,加入一个类似剪辑的过程。前期同样会有很多专业摄影师和导演跟我们一起,不断优化和调整参数,保证片子生成时尽可能模拟导演在真实场景里的需要。
现阶段,AI+视频这个行业其实非常年轻。真正算起点,可以从 2024 年 4 月 Sora 第一个版本发布开始,到现在也只有两年多。很多原来不是导演的人也站了出来,做出了非常好的片子。
比如前段时间在国外比较流行的《僵尸清道夫》,创作者是一个没学过摄影、也没学过导演的中专生。技术平权以后,随着技术工程化越来越成熟,再往后推三年、五年,可能有更多环节会被工程化定义。
现在最核心的问题,是我们的工具和模型在理解导演意图时仍有偏差。我描述一段话、导演描述一段话,或者普通人描述一段话,在模型理解中差异很大,所以还需要用后续的多参数不断优化,逐渐逼近我们想要的影片效果。这条路还很长,值得期待。
工作流:哪两个环节 AI 解决不了
王朝超:思路跟梁总有点类似:把导演或者厉害的创作者的经验“蒸馏”、数字化,再通过提示词工程先做动图,然后生成成片,对吧?
刚才聊的两个问题,角色和镜头,都属于单点能力。但讨论过程中,大家已经扩散到其他话题。接下来聊工作流。在整个工作流里,哪些环节最难标准化?第二,哪些环节保留着人工随时打断、切入和调整的能力?
黄乃元:要不让秦总先来。
秦林:好。这个问题和上一个问题其实一样。我们这四年多一直在做模型、工具和智能体开发,也和无数导演交流。到目前为止,有两个环节是智能体和模型解决不了的。
第一是剧本。真正一部影片最核心的灵魂就是剧本。目前有很多人用智能体写小说、写剧本,但我感觉都无法触及人类情感的灵魂。这个环节到目前为止,人工智能还无法完全解决。
现在的编剧和作家会用 AI 辅助,生成一些框架,优化过程中的文字。但真正的主线和情感输入仍来自人。
因为机器和人工智能只能从已知导向已知,不能从已知导向未知;而人类最厉害、无法被超越的地方,是可以想象未知世界,推测我们尚未见过的东西。这是人类思想层面的能力,人工智能短期内很难超越,至少目前还看不到超越的可能。
第二是导演刚才提到的环节。现阶段,仅靠 AI、没有人工干预,能做出的片子大约到 70 分、80 分,这就是目前的极限。未来会怎样不知道,但现在还做不到顶尖导演对镜头感和美感的把握。人类对审美、视觉和镜头的把握,很难用参数、量化和蒸馏来解决。
所以目前还是需要顶级剧本、顶级导演,再加上 AI 工具,才能快速做出更好的 AI 作品。
王朝超:谢谢。您的意思是,AI 或大模型能做到七八十分,但人工干预的天花板很高。那么在你们的工作流里,哪些环节允许人工随时介入和打断?
秦林:每个环节人工都可以介入。不管是工作流还是画布,我们所有环节都允许人工干预和修正。导演是全程把控的。在影片还没做出来时,导演脑子里已经有一幅完整的画。这就是好导演和普通导演的区别。
王朝超:这里有一个问题:从剧本到动图,再到生成成片,整个过程如果随时可以被人工打断,就意味着人必须一直盯着工作流。
秦林:如果想做出 100 分或 100 分以上的片子,确实需要这样。要么你干脆不管,全程靠 AI 完成,一点都不介入。
王朝超:好,行,俊总。
王俊:我换一个思路。现在市面上的 AI 公司大概有两类:一类做内容,一类做电商、跑流量。
王朝超:现在还有一种叫“内容电商”。
王俊:那也可以,结合起来也没问题。如果纯粹做流量,我觉得每个环节都还好,几乎都不用保留人工;一致性也不需要考虑。但这种情况下,最重要的可能仍然是内容。
比如最早那种小说切片引流视频,具体画面根本不重要,观众最后可能只是放在那里听。我身边有很多人以前真的“看”熊猫头视频,但其实不是看,只是在听。后来我才明白,为什么抖音会有“听抖音”模式。
但如果问哪个环节比较重要,我觉得每个环节都很重要。内容重要,美术设计重要,交付也重要。
我们刚才一直提到“分数”,这个分数到底是你认为的,还是机器认为的?就算由人来评,每个人看同一部片子的感受也不一样。比如前段时间《牛来》单开一桌,有些人觉得还可以,说真的,有人觉得它确实还行,正能量,也表达了一定价值。
但从专业电影人的角度看,可能会觉得方向或表达形式不合适。这是非常主观的事,机器也很难理解我们的意图。所以我觉得,没有哪个环节可以被单独认定为最重要。还是回到刚才的问题:要看如何交互,你想要什么、想确定什么。
我们内部为了提效,更多会在第一次视觉化时介入,比如先看剧照、质量和风格,最后再看成片,这样会更快。现场这些智能体里,我们可能是唯一主要自用的,用它批量交付定制内容。未来目标是开源,但开源之前,先让它有一些收入。
王朝超:我们自己先用得顺手,再给大家用。
王俊:对,没错。
王朝超:梁总,我的问题是:整个工作流里,哪个环节最难标准化?第二,什么环节会保留人工随时打断、介入的能力?
梁巍:我这么说吧。我们现在把一个传统电影剧组从 200 到 300 人压缩到 20 人。我讲讲从我的角度看,哪些岗位要保留。
王朝超:20 个人,拍一部剧,也不少了。
梁巍:剧组从 200 人变成 25 人、20 人以后,编剧要保留,导演要保留;融合了摄影指导能力的美术指导要保留;对表演和剧情有认知的表演指导或 Casting 要保留;还要保留一些主要演员,也就是物理世界里的演员;剪辑同样不可替代。
剪辑师要用音乐、音效和剪辑技巧制造观感、观看体感和视听感受,这一点 AI 无法替代。一键剪辑如果用在电商、投流素材和广告上,就让它一键剪。短剧、漫剧也可以一键剪,因为 2 秒、3 秒、8 秒、10 秒都有相对标准。
但电影剪辑没有标准。蒙太奇可以在你突然看到某一刻时,“咔嚓”一剪,让你吓一跳;也可以故意一直不剪,让你烦、让你期待后面到底有什么。剪辑是第三次创作,目前 AI 无法替代。
即便以后 AI 能做,除非 AGI 到了,每个人都能一键说“为我拍部电影”,但那样我觉得也没意义了。
一个 200 人的剧组缩成 20 人,少了一个数量级,但真正从事创作、有判断力的人仍然在,减少的是大量执行性体力工作。导演、编剧、剪辑,以及重要的美术和摄影指导都还在。
王朝超:15 个人,最后可能变成 3 个人。
梁巍:其他剧组成员减少了,因为 AI 替代了大量剧组执行工作。问题墙上有人问:“AI 产品的下一个 Vibe Coding 是视频生成吗?”其实是一个意思。
今天代码已经可以由 AI 来写。去年我们 20% 的代码量由 Cursor 完成,今年 MovieFlow 这么复杂的系统,已经 100% 由 AI 写了。剧组也是一样。
人负责最前面的 1%、交付结果后的 1%,以及提出下一轮要求的 1%;中间每次执行的 98% 交给 AI。MovieFlow 的产品功能往前走,也是以这个目的为标准:我们一定要给人留下空间。
我们现在正和专业影视导演一起做 AI 剧集,追求电影级的质感。我们会用真人演员,不会只用纯 AI 演员。纯 AI 演员没有人味,对吧?
而且如果全是纯 AI 演员,我也没法开线下发布会,总得让几个演员坐在这里。要是我们几个人说“现在由我们拍个戏”,线下还能握手,还能多挣一道钱,这件事仍然有意义。所以从我们的角度看,AI 只是压缩了剧组规模。
王朝超:好,黄总。我觉得……
黄乃元:大部分观点大家已经讲到了。我觉得,好的导演、好的编剧……
王朝超:希望从您这里听到一些不一样的声音。
黄乃元:如果要把内容进一步细分,我觉得除了电商和短剧,还有一部分内容只是为了满足个人的情绪价值。比如我想自己创作,并不是为了给别人看,只是通过创作满足自己的情绪;作品做出来,我自己看着很开心。
现在抖音或小红书上,有些博主会做非常精致的内容;但也有人发布内容只是为了记录生活,并不追求精致。
不同人的诉求不一样,内容也有很多层次。电商、短剧或漫剧,只是更接近消费场景。但在创作这个场景里,每个人都可以参与。
顶尖导演、编剧和剪辑,确实主要服务于那些需要被大众消费的内容;但对普通人来说,只要 AI 能以尽可能低的成本,帮助他创作出自己想表达的内容,就足够了。
他想拍一个东西,系统应当尽量做到完全可控,不需要抽卡,成本和进入门槛也都尽量低。可能只要像与 AI 对话一样,用自然语言交互,就能创作出来。我觉得这对大多数人也非常有价值。
回到刚才的问题,面向消费的内容仍然需要好剧本、好导演和好剪辑。但对一般内容来说,普通人能借助 AI 或 Agent 真正表达出自己想表达的东西,就是一种很好的方式。
王朝超:也就是说,市场需求是多层次的。作品发出去以后,能打中属于你的那一群人就可以,这是一个后验指标。
现场观众也提了很多问题,比如怎么减少 NG、怎么减少每次生成消耗的 Token。我们一直聊的稳定工作流,就是要解决这个问题。过去一两年大家一直在努力,但这件事没有止境。
我们从问题墙里挑一个作为结尾:“AI 产品的下一个 Vibe Coding 是视频生成吗?”黄总先来。
下一个 Vibe Coding 是视频生成吗
黄乃元:这个问题很难回答。我不确定提问者的主要目的是什么:是想通过 Vibe Coding 做一个商业产品,并判断视频生成类产品是不是更容易变现吗?
如果是这个意思,我的理解是,Vibe Coding 大概率只能解决视频生成中的一小部分问题。如果只是做一些很简单的内容或加工,视频生成基模能力一提升,水位一涨,产品就可能失去价值。
真正用 Vibe Coding 做产品,要看哪些事情是视频生成基模在中短期内不会覆盖掉的。即使技术继续进步,也不至于一下把你做的事情全部淹没,这样的产品才具有相对长期的价值。
所以不能简单地说,Vibe Coding 就是做一个视频生成产品。要理解视频生成基模在短期和中短期能做什么,以及模型提升后,哪些能力不会被它覆盖。
王朝超:这些都是通用问题,但不同人的解题思路和所处背景不一样,所以会给出不同答案、不同维度。好,梁总。
梁巍:Vibe Coding 肯定和视频生成属于一大类。而且视频生成才刚开始,还有很大空间。不管是做工具、产品还是内容,都有太多事情可以做。
还有一个问题是:“内容出海,寻找制作团队,有推荐的国家吗?”全世界只有中国是 AI 视频制作最强的,所以就在中国找制作团队,成都、杭州到处都有。
王朝超:内容工业化还得看中国。
梁巍:这是离火大运。中国第一次可以像好莱坞输出电影制作能力一样,把用 AI 制作内容的能力输出到全世界。放眼全球,也许有一天,非洲观众看到一部“非洲版《甄嬛传》”,背后的制作团队全部来自中国,这很容易成立。我们也没有语言和故事理解的障碍了。
对于爽剧、爽文、网文、游戏和影视的内容节奏,我们并不比好莱坞差,进化速度甚至远远快于他们。现在他们也反过来吸收短剧题材。
最近,好莱坞的导演、编剧和演员工会也开始认可竖屏短剧,允许工会成员参与拍摄。我们已经通过抖音、TikTok 和内容输出,把整套竖屏内容带向全球。未来真的才刚刚开始。
最后我给大家几个建议。第一,不要焦虑技术。技术不是问题,不用担心。今天讨论的一致性、剧组管理工具,一定会有人做好,不需要每个创作者亲自操心。
我们做不好,会有别人做好;大模型、大厂、小厂都可能做好。有人做这个应用层,也有人做另一个应用层。所以第一,不要焦虑技术,技术进步已经远远超过大家的想象。
第二,抓紧入场,做真正对你有意义、有价值的视频内容。做广告,就用它做广告赚钱;也可以做电商,或者做自己喜欢的故事。
接下来的内容市场不会走向全中心化。AI 带来的最大动力之一是去中心化、去权威。所以老王刚才提到《牛来》,对吧?
《牛来》代表的是:2026 年,中国电影第一次开始迎来去他妈的、去精英、去中心化的电影时代。电影院里播的不一定都叫传统意义上的电影。
过去我们理解的电影,好像只有那样的导演、那样的小圈层才能做。但今天、当下和明年,在座各位都有可能制作自己的电影,并在电影院上映。
我相信政策和审查也会推动全民参与,带来文化繁荣。所以不要焦虑技术,早点找到自己喜欢的内容和垂类,快速用 AI 去做。只有真正下场,才知道今天模型的能力。
你今天听到的,和你真正做出来的,是两回事。今天没机会给大家展示,我们正在做的一些片子,已经让人感觉跟 AI 没关系了。
在座各位可能还以为 AI 只能做短剧、漫剧,但我们已经在做成熟的剧集和影像,也在和香港的一些电影人合作,成片完全看不出 AI 痕迹。你也不用关心它是不是 AI。
技术进步很快,普通人也已经能够使用。所以尽快进入 AI 视频创作,早点拥抱它。如果只想当观众,就乐于做观众;如果想当创作者、创业者,或者把它做成一门生意,那就去做。
王朝超:AI 产品的下一个 Vibe Coding 时刻,会是视频生成吗?
王俊:这个问题让我想起以前和一家 VR 眼镜内容方合作。那时我们还是手工做,AI 都没有,只有 ComfyUI 这类东西,Stable Diffusion 也才刚出来。我们要抠图、贴图、贴到 3D 里,再做 VR 视频,出框、入框之类的效果,实在太费劲。
现在视频生成已经发展得很不错。最近李飞飞他们的世界模型发展很快,那有没有可能接下来进入 VR 时代?那也可以看成视频的一种,或者理解为空间内容,都没问题。按照现在的速度,技术发展确实太快。单纯说“视频产品”,我觉得有点局限,概念可能太窄了。
王朝超:对。
王俊:比如互动视频,它其实进入的是游戏的框架和概念,不再只是视频。所以如果单纯说视频,我觉得可能稍微窄了一点。
刚才还提到一些其他问题,我也很有感触。比如内容出海,以及美国好莱坞最近也开始与 Seedance 和解。我觉得,这些都是让步和发展。
我们和日本的一些动画老师合作时,也看到一些转变。去年跟他们聊时,日本大部分 IP 和中国不太一样,不在平台手里,可能主要在创作者本人手里。他们很在乎作品的原意,不希望使用 AI 破坏原有语义。
但最近已经出现很强的转变,可能是因为制作速度太慢、手绘太贵,也可能是视频模型本身的发展。中国确实迎来了一个很好的时代,否则也不会提出“出海新三样”——网文、网游、网剧。我觉得这是件挺好的事。
王朝超:对,好,秦总。
秦林:从 2023 年 GPT-3.5 发布以后,人工智能逐步进入每个人的视野,至今走了四年。这四年里,真正跑通商业模式的主要有两个方向:一个是 Vibe Coding,一个是 AI 视频。
Vibe Coding 解决的核心问题是,代码在很多人眼里是很高大上的职业技能,但对码农来说,它更像传统手工业。它能跑通,最主要的原因是代码有规范、有标准,而且重复频率高。越规范、越标准、重复频率越高,就越可能商业化。
沿着这个逻辑理解,现阶段 AI 视频真正跑通的单一场景主要是短剧,而短剧特别符合代码的基本逻辑。
你可以看到,短剧是公司化、流程化和标准化的,创意相对少,更多像好莱坞电影一样,是典型的爆米花式、刺激荷尔蒙的内容产品。所以它是典型的公司化产物。
短剧能在 AI Video 侧较快跑通,其中一个原因就是它标准化、重复、频次高,能够工业化。主持人刚才问,下一个是不是 AI 视频。
从现在看,未来视频会分成两部分。第一部分是精品电影。随着 AI 到来,会出现越来越多精品,这些精品由大导演加 AI 工具完成,因为 AI 把成本拉低了。原来拍一部电影可能要几个亿,现在不需要。一个好导演加一个好工具,可能用几百万元甚至 1000 万元,就能做出一部好电影。这就是精品电影的时代。
第二部分是纯工业化生产的 AI 视频。短剧、广告、电商和数字人都是方向。这些方向会产生大量标准化、工业化、可复制、可重复的智能体。几乎所有广告也是标准化、套路化、层次化的产品。
从这两个角度看,主持人的判断是对的。下一个一定是“AI+视频”。可以被量化、复制的环节,都适合工业化生产。视频侧一定会被快速催生。在未来可以预见的 10 到 15 年里,它可能成为一个 10 万亿级的产业,也就是最具想象力的产业之一。谢谢。
王朝超:我们刚才聊了角色、镜头和工作流。AI 视频是一场双向奔赴:一端是技术流,把各种技术手段、Agent 和模型封装成产品;另一端是导演和内容创作者,从审美、创意出发,追求稳定产出好内容。
技术进步可以帮你做到七八成、七八十分;但要做到高质量、批量化,有好审美,也满足市场需求,还是要靠人的创意。人的创造力没有天花板。







