诺亚 发自 凹非寺
量子位 | 公众号QbitAI
有没有人跟我一样,天天对着AI小猫小狗短视频傻笑?谁说观众不喜欢看AI啊,这AI可太好了!(战术后仰.jpg)
今天,家人们有福了!生数科技发布了Vidu S2模型,不仅能让你和虚拟数字形象实时互动,还能对着正在播放的视频,现场换装、换人、换背景、换画风。
不管你是想给屏幕里的小奶狗男友换套西装,还是想让二次元小偶像一秒切到赛博朋克风,甚至想把老板变成一只“尖叫鸡”……它都能丝滑搞定。
数字人这边,也开始接“新活儿”了:跳舞、转身,动动嘴就能安排;聊到一半再递张参考图,还能让它换上同款衣服、拿起指定物品。你负责出主意,它负责加戏。
好家伙,这哪里是AI视频生成模型,这分明是“某迹暖暖Pro Max之导演剪辑版”啊!
这项神奇的能力来自生数科技最新发布的Vidu S2,不仅让数字人更加能说会动,也能像P图一样P视频,边播边改。
要知道,就在短短两个月前,上个版本的Vidu S1才刚让大家见识了什么叫“数字人成精”。数字人从依赖“音频驱动口型+预设动作库”的传统模式,进化到能通过语音控制数字人的行为,还能实现无限时长连续互动。
Vidu S1一经推出,便被网友玩出了花。有的把自己猫的照片喂给模型,让它开口讲话;有的把Coding界面传给模型,让它扮演“程序员鼓励师”小姐姐;还有的让自己去世的亲人“复活”,互相倾诉思念…
这次Vidu S2带来了全方位升级,一口气放出三个大招:
- S2-Editing:正在输入的视频,可以实时换装、换角色、换背景、换风格。这是本次最值得先上手的升级,堪称视频版“某图秀秀”;
- S2-Avatar:实时互动角色升级到720P,还能接住中途递来的物品参考图,按指令拿起、展示,完成更丰富的肢体表演。
- 实时空间视频探索:进一步把生成或编辑的视频转换成左右眼画面,送进VR头显,探索与角色更有纵深感的互动。

而且Vidu S2发布当天就全量开放,不搞内测、不限名额,这波操作属实是把“技术自信”写在脑门上了!
实测模型,这AI是不是偷偷学了魔术?老规矩,先来测试一波这次更新的Vidu S2。
Vidu S2包含两个细分模型:
Vidu S2-Avatar:实时交互模型,支持语音对话、语音控制数字人做动作、实时交互中输入参考图
Vidu S2-Editing:实时视频编辑模型,可以改变服装、人物、背景和视频风格
老规矩,先上实测。先看Vidu S2-Avatar,除了能在互动过程中接收新的参考图,它执行动作指令的能力也升级了。
到底进步了多少?把上一代请出来,同屏比一比就知道了。
同样让数字人跳舞、转圈和跺脚,左边的S1没能完成要求,右边的S2则跟着指令动起来了。
以前S1主要是聊天互动,现在S2将大幅度的身体动作也安排上。“嘴上答应”和“身体力行”的区别,这下终于有画面了。
不仅动作更听指挥,画面也更清楚了。Vidu S2-Avatar将实时输出分辨率从上一代的540p提升到了720p,数字角色面部和衣服上的细节等变得更加丰富。这种提升放在持续互动里很直观:人物在动、对话在继续,清晰度也得跟上。
接下来,轮到参考图发挥作用。
你可以在互动过程中随时递给数字人一张新图片,让它拿起图里的物品、换上指定的衣服,或者进入新的场景。既能听指令做动作,又能照着参考图调整内容,这位数字搭档能接的“活儿”,明显更多了。
再来看看Vidu S2-Editing ,它带来的实时视频编辑能力,是这次最大的更新之一。
画面对准一位正在接受采访的女士,秒切不同款式的服装,它们都非常合体,好像本来就穿在她身上似的。
人物动作连贯,脸部一致性很好,服装随着动作产生的形变也非常真实。尤其是最后一套驼色大衣,袖口半遮住了女士佩戴的首饰,处理得非常真实。
非要挑刺的话,第二套衣服在呈现色块时仍有一点涂抹感;人物佩戴帽子时,头发仍然有一点穿模。
不仅能换装,还可以更换背景。看看这个视频,小姐姐在各个场景丝滑地跳着女团舞,我感觉自己在看一个制作精良的MV。
不换背景只换人?听说《牛来2》要来了?在办公室的我变成了牛来跟大伙say hi……
嚯!我感觉自己好像加班加出幻觉了。
最离谱的是,我变成的这些奇怪东西居然完美融入了办公室环境,透视、遮挡都挑不出毛病。建议各位打工人收藏此功能,开会时把自己替换成财神爷,说不定老板看你都顺眼了。
再来看看视频风格转换的表现。
小哥哥切换不同的风格,视频全程的画面一致性以及风格的迁移能力表现得相当不错!
小小总结一下,Vidu S2-Editing,对正在进行的画面提供四类实时编辑能力:
- 实时人物换装:淘宝店家、穿搭博主狂喜
- 实时更换背景:足不出户环游世界
- 实时更换主体角色:万物皆可打工,包括财神爷
- 实时风格渲染:审美疲劳?换个滤镜继续嗨
这意味着,直播间的视觉效果、虚拟角色的演出、创意视频的玩法,都有了更多临场发挥的空间。
观众弹幕发个“想看主播穿恐龙服”,下一秒可能就真穿上了。观众聊着聊着就当上了导演,主播演着演着就成了NPC。
69天完成版本更迭只用了69天,Vidu S2就完成了一次大版本跃迁,视频模型赛道现在真的是卷麻了!
两个月前,Vidu S1的亮相同样惊艳,有必要来回顾一下这位“前辈”。Vidu S1、Vidu S2的全链路研发均由清华大学朱军教授的博士生、生数科技流式视频生成与推理负责人张金涛负责。
之前绝大多数数字人,都是“音频驱动口型+预设动作库”的传统模式,本质上跟一个会动的PPT没太大区别。
而Vidu S让AI视频从“离线生成”跨越到“实时交互”。只需要上传一张照片,模型就能生成一个可以和你实时互动的AI角色。
这里要划个重点:实时交互视频,和传统视频生成模型走的是不同的路。
实时交互视频的每一帧,都是根据用户输入现场算出来的。这意味着模型的生成速度必须跑赢播放速度,不然用户看到的就是PPT式的卡顿。
这可不是简单地“把生成速度拉高”就完事了,而是要重塑整条生成链路。团队用SageAttention等技术给计算提速,再通过多GPU协同调度减少模块间的等待,让显卡少闲着、整条生成链路跑得更顺。
到了S2,这种交互又向前迈了一步:画面从540p提升到720p,数字人能执行更复杂的动作,还能在互动中接收新的参考图;新增的Editing模型,则把换装、换人、换背景和换画风带进了实时视频流。

此外,还有一件事值得单独唠唠。
最近“实时空间视频”成为了视频模型行业的竞争前沿,业内有公司刚开始布局,而生数已经把空间视频做成了可体验的产品。

所谓的空间视频,是一种能够呈现三维立体深度和沉浸感的立体视频格式。它基于人类的双目立体视觉原理,利用两个不同视角(例如主摄和超广角摄像头)同时录制影像,记录下景物的立体深度信息。
空间视频需要在支持空间计算的设备上观看,比如Apple Vision Pro,在普通设备上它只是普通的二维视频。
如今,基于Vidu S2-Avatar,用户可以实时生成空间视频;基于Vidu S2-Editing,用户还能实时编辑空间视频。
你可以把一段普通视频实时转成空间视频,还能将你通过头显摄像头看到的真实物理世界,当成“画布”来创作。
也就是说,Vidu S2不光能让AI角色在屏幕里跟你互动,还打算让它们“走出屏幕”。
当然,团队也坦诚地表示:头显对分辨率和延迟的要求极其苛刻,画面糊了会晕,延迟高了转头和画面会“打架”,这块还在持续优化中。
未来,团队计划从固定视角扩展到全景空间视频,让你转头就能自由探索AI生成的场景。元宇宙真的要实现了?!(doge)
技术揭秘:如何做到“边播边改”?看完这些让人惊艳的视频效果,问题来了:Vidu S2到底是怎么做到的?
在数据处理方面,为了让数字人表现出更丰富的动作与表情,团队补充了舞蹈、二维动画和三维动画等训练素材,并对符合条件的视频进行背景稳定处理,在保留大幅动作的同时,减少镜头运动带来的干扰。
标注方式也围绕连续互动重新设计:按照事件发生的顺序,记录动作何时开始、带来什么变化,以及结束后人物处于什么状态。片段描述根据事件边界划分,训练时,每个时间片段都有对应的条件。这让“抬手、拿起杯子、端着杯子继续说话”中的动作衔接与状态变化,都有了更清晰的学习依据。

流式训练一直是一个难点,因为这个过程像一场接力:下一段画面接着上一段往前走,前面的一点偏差,也可能被一路传下去。
Vidu S2选择先通过Hybrid Forcing学会逐段生成,然后让模型练习接住自己产生的偏差。为此,Vidu S2引入Self-Replay Forcing:先让模型连续生成一段视频,再给生成结果分块加噪,进行一次可训练的因果回放。
这次“复盘”把前后片段连起来训练,让后续片段的训练反馈也能影响较早片段的表示,帮助模型学会:即使前面出现偏差,后面也能尽量接得稳、接得顺。

接着是画质和实时性的问题。Vidu S2采用了Backbone-Refiner两阶段架构。Backbone先在低分辨率下生成画面的主体结构、运动和语义内容,确定“画面里有什么、正在做什么”;Refiner再负责生成细节,把画面做得更清楚。
可以把它理解成两位画师配合:一位负责打底稿、抓动作,另一位负责精修。
关键是,两位不用排队等着干活。通过异步流水线,细节重建与后续内容生成可以并行推进,这让模型在720P输出下仍然不掉帧。
而换装、换背景能做到“边播边改”,靠的是“时间戳对齐”。
用户中途发来一张衣服图片,模型需要知道的不只是“换成什么”,还有“从什么时候开始换”。
Vidu S2通过重新设计位置编码,将参考图的注入位置与时间戳对齐,让模型知道新条件应该从哪个时间点开始生效。
因此,新参考图中的内容可以根据指令进入后续画面,并保持运动与光照的连续性,实现生成条件的平滑过渡。
模型光会换装还不够,还得学会看场合换。于是Vidu S2请来一位盯着现场的“执行导演”:VLM Agent。
实时互动时,用户可能接连提出要求。模型在执行下一步之前得先搞清楚:画面里现在有什么?人物正在做什么?上一条指令执行完了吗?
VLM Agent是基于视觉语言模型的智能体,会持续解析已经生成的画面,跟踪这些状态,再据此规划后续生成,并在合适的时机调整生成条件,让互动更好地结合画面状态与用户意图。
最后是强化学习。Vidu S2在双向与流式两个阶段都加入了偏好与奖励优化,让模型生成的内容更符合人的期待。
双向阶段采用DPO,改善画质、表情、动作自然度和音画同步,为后续流式训练提供更强的教师模型。
流式阶段则采用Streaming NFT,直接优化承担持续生成任务的因果模型。模型先生成自己的视频轨迹,再沿用SRF的回放思路进行奖励优化,让训练贴近实际运行时的状态,进一步提升画面质量、动作可控性和指令遵循。

从Vidu S1的语音互动,到Vidu S2更清晰的画面、更准确的动作响应、随时加入参考图和实时编辑视频,再到空间视频体验,人与AI的交互正在变得更加自然、丰富。
一个虚拟数字人能理解你此刻在做什么,并且立刻跟着指令行动,这事放在两年前听着还挺科幻。现在Vidu S2把它做成了直播间里随手一点的功能,仔细想想也真是奇妙。
传送门:
立即体验:
https://vidu.cn/vidu-stream
️ API平台:
http://platform.vidu.cn/vidu-stream/doc
技术报告:
https://arxiv.org/pdf/2609.11638







