Token导航 LogoToken导航

生数科技张金涛谈实时生成视频想象空间

更新时间 2026-09-24来源 晚点LatePost正文 9010字阅读约 29分钟1 张图片

图片

实时生成视频技术路线为什么是一门好生意?

文丨申远

“选择的方向比努力重要得多。” 在采访里,类似这样笃定的句子张金涛说了很多,对他而言,实时生成视频是一个毋庸置疑的好方向。

大多数人熟悉的视频生成,仍然是输入一段描述,等待模型交付一段视频。实时视频想做的事情有所不同:画面持续生成,用户可以随时开口、输入指令,改变接下来发生的内容,张金涛把这种体验称为 “使用即消费”,意味着每个人拥有属于自己的独立会话,在张金涛看来,人一天里除了看电影、刷短视频,其余时间其实都在进行某种实时的视觉交互,因此这个市场 “最终是能完全超越语言模型”。

作为清华大学计算机系朱军教授的 00 后博士生,张金涛是注意力加速算子 SageAttention 和视频生成加速框架 TurboDiffusion 的作者,目前在生数科技负责 S 系列实时生成视频模型的研发和所有模型的推理工作。

在实时生成视频模型 S1 发布两个月后,生数推出了升级版的 S2。这次升级包含两个模型:S2-Avatar 可以让数字角色更清晰、更能跟随指令,也支持在交互过程中加入新的参考图;S2-Editing 则可以实时修改输入的视频流,换衣服、换角色、换背景,或者改变画面风格。在 S2 的技术报告里,生数团队还在探索通过 VR 眼镜观看实时空间视频。

张金涛对这个方向很有信心。不仅因为海量需求,还因为成本可控。视频模型的参数规模只有主流大语言模型的几十分之一甚至更小,推理所需的算力相应低得多,而推理,恰恰是张金涛的老本行。

当然,他也不回避眼下的问题,最难的还是竞争。大厂在离线视频模型上已经很强,生数在实时生成视频上的领先身位不是一条不可撼动的竞争护城河。张金涛自己也说,一家数据和训练基础扎实的公司只要 “好好去做”,几个月就能追到不错的水平,生数眼下的优势,很大程度上源于对技术的前瞻性理解,但商业竞争仅仅靠前瞻性还不够。

在这期播客里,我们和张金涛聊了有关实时生成视频的技术进展、商业模式和产品形态,也聊了一个 00 后研究者,如何从一个人埋头写算子,走到带领一支三四十人的团队。

以下是经过编辑整理的对话:

实时视频是使用即消费

晚点:S1 发布才两个月,S2 就来了。新模型有哪些提升?

张金涛:先简单回顾一下 S1。它主要是一个数字人模型,用户上传一张图片,图片里的角色可以是真人、动漫人物,也可以是宠物,再选择一种声音,就可以跟它聊天,让它做一些动作。

S2 包含两个模型。第一个是 S2-Avatar,还是数字人,但真人感更强,指令跟随也更好,包括跳舞这样的大幅度动作。画质提升到了 720P,仍然能保持每秒 25—40 帧的实时生成速度。

我们还引入了一套基于视觉语言模型的 Agent 系统,根据用户的意图和已经生成的视频,规划下一步动作。它支持实时参考生成:你可以在交互的任何一个时刻,输入一张参考图和一条指令。比如给它一张杯子的图片,让它从屏幕下方拿起来,用你指定的姿势展示。

另外一个模型是 S2-Editing,它可以实时地把一段视频流编辑成另一段视频流。比如打开摄像头,给画面里的自己换一套衣服,同时保留动作和背景;也可以把正在玩的游戏,变成二次元或者赛博朋克风格。换背景、换角色,也都可以做。

晚点:实时编辑是生数第一次推出的能力。它和在生成过程中随时输入新的 Prompt,有什么区别?

张金涛:更准确地说,Avatar 和 Editing 都可以在生成过程中接收反馈。你想让人物坐下、去屏幕外拿一个东西、跳舞,这些指令都可以实时地给。这是一个基础能力。

Editing 最主要的功能,是对输入的视频流做实时编辑。这个视频流可以来自摄像头,也可以是游戏或者直播。比如给主播换衣服,甚至换成另一个角色,原来的口型和动作仍然可以对应上。

晚点:在你的设想里,它会以插件的形式出现?

张金涛:可能会作为很多应用的插件。比如你在 Steam 上有 100 个游戏,每个游戏都可以换很多种画面风格,那体验就会丰富很多。

我们还做了一些实时空间视频的探索。Avatar 和 Editing 都有空间视频的版本,可以通过 VR 眼镜观看,也可以实时交互。

晚点:很多人觉得,实时生成的视频模型,跟我们已经熟悉的视频生成模型,是两种东西。你也这么看吗?

张金涛:我觉得是的。模型上可能有相似之处,但从应用和需求上看,它们很不一样。

目前主流的视频生成,可以理解为离线视频生成:上传一段 Prompt,等一段时间,拿到一个十秒或者十五秒的视频。它主要面向创作者,普通人很少直接使用这些模型。

实时视频的输入和输出都是持续发生的。你希望下一秒发生什么动作、出现什么内容,可以在过程中去控制。它就不只是一个创作工具了,而是 “使用即消费”,每个用户都直接在使用这个模型。

晚点:今年初决定投入这个方向,是基于什么判断?

张金涛:首先是需求。人一直都有实时的视觉、多模态交互需求。比如我们今天坐在这里聊天,也是在进行一种实时交互。

如果看离线视频生成,它的需求量可以理解为创作者的数量,乘以每个创作者的生成需求。一段视频可以被很多人反复观看,所以观看需求不会全部转化成生成需求。

但实时交互不一样,每个人都需要自己的会话。它的需求量,是每个人对实时多模态交互的需求,乘以总人数。我觉得这个市场非常大。

第二是技术。今年年初,我们看到了一些技术上的可行性,自己也做过科研探索,发现路线初步行得通。生数又有基础模型的数据和训练系统,可以复用很多积累,这是一加一远大于二的事情。

晚点:这个判断是朱军老师做的,还是你们一起商量的?

张金涛:大的方向判断来自朱老师,具体怎么做,需要一起商量。我们一直交流得比较多,我也会跟他聊一些最新进展,所以当时并没有特别惊讶。大概一二月份开始讨论,三月份正式启动 S 系列。

晚点:朱军老师把通用世界模型分成五级,第一级是生成世界,第二级是与世界交互。S2 对应的是第二级?

张金涛:对,我觉得 Avatar 和 Editing 都符合第二级,就是可以和世界实时发生交互的模型。

有一百种方法可以把它做得更好

晚点:从 S1 到 S2,为什么能迭代得这么快?

张金涛:主要有两点。第一,S 模型需要一套很完整的能力:准备数据、训练模型、推理加速,再到云端部署,每一环都要保证实时性。

流式视频的训练环节也比离线视频更多、更复杂。你要先把离线阶段训好,再逐步把它变成可以实时生成的模型。发布 S1 之前,我们已经把这些问题探索过一遍,有了一套能够运行的基础方案。

所以 S1 发布当天,全球用户就可以使用,API 也直接开放。这背后是数据、训练和工程上的积累。

我们也比较清楚,接下来还有哪些问题要解决。包括现在,我也可以说,S2 还有很多问题,我有一百种方法可以把它做得更好,而且这些方法都非常明确。这两个月,我们主要是把 S1 里最明显的一些问题解决掉了,所以会比较快。

第二是团队。我很以我们的团队为骄傲,大家凝聚力很强,也很有热情,愿意往前冲。做事情自然会快一点。

晚点:所以也可以期待 S3 很快继续迭代?

张金涛:对,没错。

晚点:S1 为了速度,对画质做了一些妥协。S2 的画质提升是怎么实现的?

张金涛: 一个重要的方法叫 Refiner。前面有一个基础的实时生成模型,主要生成画面里的结构和低频信息;后面用一个只需要一步扩散计算的 Refiner,把分辨率、细节和美学效果补上去。

另外,推理基础设施也在优化,包括把算子做得更极致,把视频生成的调度做得更好。这些一起带来了画质和效率的提升。

晚点:S 系列和 Q 系列是什么关系?是不是基础模型越好,实时模型就会跟着变好?

张金涛: 先给一个结论:Q 系列做得越好,肯定对 S 系列有正向帮助,但这个帮助没有想象中那么直接。不是说基础模型的画质、一致性、复杂镜头做好了,我们直接就能拿到这些收益。

能复用的,首先是数据储备。我们可以从海量数据里,筛选出适合实时交互的部分,比如人物对话。其次是训练和推理的基础设施。

但具体的模型效果,没有那么容易复用。基础模型为了提高效果,往往会扩大模型尺寸,计算量也会上升。实时视频有两个很强的约束:成本要低,生成速度必须比播放速度快。我们很难直接拿一个很大的模型来做实时服务。

另外,实时视频的训练链路很长,效果很大程度上来自自己的后训练阶段,也不能完全依赖基础模型。

晚点:所以是有关联,但相对独立的两条技术路线?

张金涛: 对,技术路线上相对独立。

晚点:成本和速度,哪个更难?如果一定要取舍,你会怎么选?

张金涛: 我觉得它们不是一个严格取舍的关系。速度首先是硬指标,你没有办法妥协。不管用什么卡,都必须用少于 0.1 秒的时间,生成一段 0.1 秒的视频,比如用 0.09 秒。

晚点:为什么不是越快越好?比如用 0.01 秒生成出来。

张金涛: 因为播放这段 0.1 秒的视频,还是需要 0.1 秒。你即使用 0.01 秒生成好了,也要等这一段播放完。

所以对这里的实时播放来说,首先要达到这个速度要求。成本则是越低越好。我们目前已经可以在消费级显卡上达到实时生成,接下来希望在满足实时性的前提下,把成本继续降低,甚至探索在端侧、更低端的显卡上运行。

数据比模型大小更重要

晚点:回过头看,S 系列最难的地方是什么?

张金涛: 难点很多。比如数据,你不可能只用一段段五秒的视频,就把一个能连续生成几个小时的模型训练好。

训练算法也有很多需要探索的地方,我们提出了 Self-Replay Forcing。但如果一定要挑一个最难的,我觉得还是数据:怎么把数据组织成更适合实时视频学习的形式,怎么把它标注好。

晚点:之前聊的时候,你说过一句让我印象很深的话,“Diffusion 只是一个渲染器”。你怎么理解这句话?

张金涛: 先从需求上看。语言模型要帮人解决复杂任务,所以需要比较强的思考和推理能力。图像、视频生成面对的很多需求,是看电影、刷短视频这样的观看和娱乐需求。

再从比较上层的原理看,Diffusion 学习的是文本到图片、视频的映射。你把信息描述清楚,它把对应的画面生成出来。从这个角度,我把它理解成一个渲染器。

这里最重要的有两件事:第一,训练里的图片和视频质量要好,要符合人的偏好;第二,标注要足够详细、准确,跟画面里的内容对应上。对应得越好,模型学习这个映射就越容易。

晚点:这也解释了为什么你这么看重数据?

张金涛: 对。举个例子,你想学 Transformer 的原理,上网找博客。如果看了一百篇写得不好的博客,可能学了五天,还是不知道它到底是什么。

但如果找到一个真正懂原理、又能把事情讲清楚的人写的博客,你可能只看一个小时,就恍然大悟了。

数据起的就是这个作用。模型架构和大小,现在已经相对收敛了。大家大体上都是基于 Transformer 做一些改动,但数据上可以做的事情还有很多。

晚点:那 Scaling Law 对视频模型还有效吗?模型参数量和后训练继续扩大,会不会带来提升?

张金涛: 结论是会,但我觉得不会像语言模型那么有效。直接把模型做大,带来的收益没有语言模型那么明显。

语言模型是智能密集型任务,要解决很多复杂问题。视频生成在我看来,更关键的还是数据。扩大模型当然有用,但相比之下,提升数据质量会更有效。

晚点:实时视频的架构和算法,也已经收敛了吗?

张金涛: 架构上相对收敛,总归还是视频生成任务。但算法还没有,我觉得还有很多探索空间。只是跟数据相比,我还是认为数据更重要。

晚点:那数据是不是一个护城河?

张金涛: 数据是最关键的一个部分。但它到底能不能成为护城河,多久会被追赶上来,我也很难判断。

晚点:你对生数目前的数据储备满意吗?合成数据会是一个方向吗?

张金涛: 目前相对满意,尤其最近三四个月,数据质量、储备和人才密度都有很大提升。当然还有一些细碎的问题,以及认知上的小偏差,我们会继续补。

合成数据是个好方向,但没有那么直接。不是说一下子就能合成大量高质量视频,合成之后也还是要标注。

标注和处理可以依赖视频理解模型,也可以用一些专家模型,比如人脸检测、目标检测、音频分离。这些都能帮助我们把数据处理得更好。

晚点:简单理解,实时视频需要标得更细、标得更多?

张金涛: 可以这么理解,但我还要补一点:要更加准确、正确,不能有错误。

竞争对手能不能追上来

晚点:视频生成领域玩家很多,为什么你对实时这个方向这么有信心?

张金涛: 把画质做好,把离线创作工具做好,当然有价值,这些积累也会促进实时视频生成。

但实时交互的多模态需求,真的非常大。每个人都有自己的独立会话,跟一百个人、一百万人刷同一条视频,生成需求完全不在一个量级。我觉得,从需求量上说,它最终能超过语言模型。

晚点:跟其他做实时视频的公司相比,生数的差别在哪里?

张金涛: 技术路线不会差得特别多。有的专注数字人,有的专注实时编辑,有的专注通用世界探索,做的是一些比较类似的事情。

我觉得我们目前的效果比较领先。技术报告里有一些公开基准上的评测,大家可以看,也可以直接体验。

还有一点是可用性。S1、S2 发布当天,全球用户就能在网页上使用,API 也开放了。现在已经有企业接入我们的 API 做产品。模型究竟做得怎么样,大家用了就可以评价。

晚点:最近有人把视频生成模型加速,做成了无限流直播,挺受关注。你怎么评价这件事?

张金涛: 先解释一下原理。一个模型可以生成五秒的视频,通过更快的 GPU、推理加速、蒸馏等方法,把生成时间压到五秒以内,就可以让视频连续播下去。

我们之前发布的 TurboDiffusion,已经可以在消费级显卡上用两秒生成五秒的视频。用类似的方法,也可以实现这种效果。我觉得这个应用很有趣。

但生成得快,和能不能实时交互,是两件事。你给它一条 Prompt,它生成得更快了;可你给下一条 Prompt,可能还要等十几秒,甚至二十秒,它才开始生成对应内容。那它还不是我们这里说的实时交互模型。

晚点:生数现在的优势,更多是先发优势,还是技术、数据积累?如果大厂认真做,追赶的难度在哪里?

张金涛: 我首先想到的是朱老师的一些前瞻判断,我们在视频生成、实时视频生成上都布局得比较早。公司和朱老师也能把很优秀的人凝聚起来,做同一件事。

当然,头部几家对手都很强,有训练基础、数据储备,也有人才。对于一家有这些基础的公司,我不会说实时视频是一个特别难、别人做不出来的东西。他们认真做,能够做到比较好的水平。

但需要多长时间把数据做好,把训练方法探索清楚,再把工程和基础设施做到一个比较好的状态,很难判断。

晚点:所以短期内,门槛主要还是时间?

张金涛: 短期内是时间,以及认知。大家到底觉不觉得,这是一件重要的事情。

晚点:那你现在最大的担忧是什么?

张金涛: 两个点。第一个还是数据。我们能不能一直在数据标注、数据认知上保持领先?能不能获取最优质的数据源,有很好的视频理解模型做标注,有一套好的数据处理流程?

我担忧这件事,也就会更重视它,把它做好。

第二是产品。实时视频是 “使用即消费”,用户在用的过程中,就已经在消费模型。我们能不能做一款好产品,把生态做好,真正理解用户偏好,再用这些反馈改善模型?能不能让用户愿意持续使用?这些都很重要。

谁会为实时视频买单

晚点:按你的说法,离线视频更像工具,实时视频更像应用,会有生态、用户和黏性。它最终是一个 To C 的模式吗?

张金涛: 要看你处在什么位置。生数最主要还是模型提供方。我们会做自己的产品,但只靠我们自己做,肯定比不过让更多人加入进来,用我们的 API 做产品。

所以我们主要是对外提供模型服务。至于实时视频最终的消费和需求,我觉得肯定是 C 端驱动的,因为直接使用它的是每个用户。

晚点:实时视频最先落地的场景会是什么?

张金涛: 直观上看,直播、电商可能会率先用起来。但我觉得更有潜力的还是陪伴,因为每个人都可能独立地使用它。

晚点:做一款有用户黏性的产品,在国内是很难的。你们有什么初步想法?

张金涛: 我们在准备一款产品,目前产品团队也是我直接管理。主要想做社交、陪伴,解决情感陪伴的需求。

比如在数字人交互里,借助实时参考生成,用户可以用一张图片、一句话,更好地跟角色交互。我们会先把真实的情感需求调研清楚,再去做能够满足这些需求的产品。

晚点:但情感陪伴不是一个新方向。除了形象逼真,用户还希望对方有同理心、有逻辑,甚至觉得它 “有灵魂”。这好像不是实时视频模型能提供的。

张金涛: 对。更逼真的视觉形象,加上实时交互,是我们很突出的优势。但比视觉形象更关键的,可能是产品能力,以及背后那套 Agent 的能力:能不能真正懂用户,有没有记忆。

晚点:这些能力来自另一个模型?

张金涛: 不完全依赖一个特别强大的模型。简单的图像生成模型和语言模型结合,也可以做得比较好。

用户喜欢一个产品,可能是因为它有趣,能记住之前的会话。这些更多来自对用户的理解,而不只是某一个模型特别强。

晚点:你们一边给 B 端客户提供 API,让他们做应用,一边自己做应用,这两者会不会有点抢?

张金涛: 我们提供 API 服务,让大家用模型做产品,同时也做自己的产品,这两件事本身并不冲突。

我们自己做产品,不完全是为了收入。更重要的是建立模型的竞争壁垒:更懂用户的需求,依靠用户反馈和数据闭环,提高模型训练的效果。

晚点:但通过 B 端客户调用 API,不也能回流用户数据吗?

张金涛: 还是不够直接,跟用户之间隔了一层。

晚点:所以还是希望通过自己的应用,跟用户建立更直接的连接。

张金涛: 对。实时视频是使用即消费,你必须很懂用户,所以我们希望有这样一款产品。

晚点:API 模式在 Coding 领域已经比较明确,但很多视频应用还在探索怎么收费、怎么定价。你怎么看?

张金涛: 先看需求。Coding 是每个人都在独立使用,离线视频生成的直接使用者没有那么多。比如我们部门每个人都大量使用 Coding 工具,但你问身边的人用不用视频生成,可能用得就很少。

但也不能说视频模型卖得不好。下游生态的建立需要时间。以前大家就在写代码,现在接入一个 Agent,马上可以写得更快。视频生成下游的应用和创作需求,还没有被完全释放出来。

晚点:每个人都有自己的会话,也意味着算力需求跟着用户数量一起增长。这会不会反而不是一门好生意?

张金涛: 我觉得恰恰不是,这是更好的一门生意。每个人有独立的会话,需要独立的推理服务,就意味着推理需求会很大。

它确实消耗更多算力,但在我的理解里,推理服务本身是赚钱的。所以使用的用户越多,推理需求越大,赚得也越多。

另外,我们现在可以在消费级显卡上提供实时服务。这样的卡比较常见,所以我觉得,算力供给本身不构成这里的瓶颈。

从写算子到带三四十人的团队

晚点:做 S 系列之前,你主要聚焦推理加速。突然要负责从训练到部署的整条链路,朱军老师第一次让你来做的时候,你是什么感受?

张金涛: 很兴奋。我终于能做一番大事业了。

我一直有创业的想法,很想带一支团队,做一件伟大的事情,也觉得自己能做好。我能把事情讲清楚,知道每个人需要什么、适合做什么,怎么把大家凝聚起来,提高团队效率,减少内耗。

做负责人以后,对技术、产品需求的理解也要更深。我觉得这些是我愿意做、也能做好的事情。所以接到这个任务时很开心,到现在也一直很开心。

晚点:当时没有觉得哪些地方特别困难吗?

张金涛: 其实在三月份来生数之前,我已经在为带团队做准备了。去年底到今年初,我有过创业的想法,想看看能不能在朱老师支持下,做一些基础设施方面的创业,也跟投资机构聊过。

那段时间我在伯克利,也接触了一些美国的投资机构。到三月份,朱老师问我要不要来生数,这里有更好的资源支持,我觉得很兴奋。做的事情跟我之前想做的,其实很接近。

晚点:实时视频就是你当时想创业的方向?

张金涛: 是的。当时的商业计划,做的就是实时视频生成的基础设施、后训练,也包括空间视频。

那时候我就跟别人说,选择的方向比努力重要得多。什么是好方向?实时视频生成就是一个好方向。

晚点:现在团队有多少人?从自己写算子,到管理一个团队,最大的变化是什么?

张金涛: 大概三四十人。三月份部门刚成立的时候,其实就我带两个人,后来一个一个招进来。

2024 年我主要是自己写算子,做 GPU 线程编程、精度对齐。把一个东西做出来,做到工业界能用,也很开心。

以前关注的是技术细节,每行代码怎么写,把一个东西真正跑通。现在更多是怎么协调团队,让大家朝同一个目标做事,怎么把沟通做好,以及怎么保证自己的认知是正确的、先进的。

晚点:这对你来说,不是特别难的事情?

张金涛: 可能确实不是特别难。我感觉自己天生就适合做这种事情。

晚点:天生适合当领导?

张金涛: 可能吧,这个不知道。

晚点:你觉得生数现在更像一家商业公司,还是一个大学实验室?

张金涛: 肯定是一家商业公司,这一点毫无疑问。比如做流式视频生成,我们不会做太多纯研究,做的事情要服务业务和收入目标。

但我们确实有比较强的学校、实验室背景,解决问题的思路会更像做研究。我觉得这不是坏处。

晚点:你马上博士毕业了,毕业论文是什么?

张金涛:《高效注意力计算方法研究》,跟推理和训练的基础设施相关,主要面向视频模型。当然,这些注意力算子也可以用在语言模型上。

晚点:主流叙事还是大语言模型。朱军老师也有很多学生在那个方向做得很好,你会觉得可惜吗?

张金涛: 不会。我还是坚持刚才的判断,实时视频是一个很好的方向,需求很大。

语言模型帮人解决复杂问题,这当然重要。实时视频解决交流、娱乐这些需求,也很重要。方向不一样,但我没有觉得遗憾,也没有觉得自己应该去做语言模型。

晚点:如果给现在的实时视频画质打个分,相比传统的离线视频生成,做到什么程度了?

张金涛: 我觉得大概百分之五六十,还是有比较大的差距。但通过数据和算法上的改进,我觉得这些问题基本都能解决。

晚点:如果明年这个时候再聊,你希望 S 系列长成什么样?

张金涛: 我期待它能生成更丰富的内容,画质以假乱真,同时还是实时的、延迟很低,也能准确理解用户意图,精确满足用户需求。

我觉得一年时间,基本够我们把画质做到离线模型百分之八九十的状态。

晚点:最后,还有什么想说的?

张金涛: 两个点。第一,我们是很坦诚的。发布第一天,就把模型交给全球用户使用,开放 API。它肯定还不完美,但我们愿意让大家直接用,也欢迎大家提意见。

第二,我们 Vidu S 团队的使命,是为人类极致的多模态交互体验做贡献。这是最终的目标,也是我们一直以来做事情的标准。

有时间的话,大家可以上传一张图片,跟数字人聊聊天,看看它能做什么动作;也可以用 Editing 给自己换换装。

晚点:或者开发一些好玩的案例。

张金涛: 对,用我们的模型,做更多好玩的东西。

题图来源:晚点 LatePost

资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多