Token导航 LogoToken导航

SkyReels-V4 登 Artificial Analysis 榜单第二

更新时间 2026-09-29来源 极客公园正文 3941字阅读约 13分钟13 张图片

本文首发于 Founder Park 公众号 · 2026 年 3 月 2 日

Seedance 2.0 还在持续震惊行业的时候,AI 视频赛道又有一份权威榜单刷新了,来自昆仑天工的 SkyReels-V4 冲进了最前列。

Artificial Analysis 是目前 AI 领域最有公信力的第三方评测平台之一。它的机制,是让不同模型生成答案,然后由真人用户盲选投票,谁的作品被选中的次数多,谁的 ELO 分就高。整个过程不看品牌,不接受企业自报成绩,OpenAI、Google 这些大厂都在上面被公开打分。

在这份最新的文生视频榜单(带音频)上,SkyReels-V4 排到了第二。ELO 评分 1090,仅落后第一名快手 Kling 3.0 Pro 三分。Google Veo 3.1、OpenAI Sora 2、xAI grok-imagine-video 都排在了它的身后。

图片

在包含所有历史版本的全量排名里,SkyReels-V4 也排到了第四。

图片

值得注意的是,Text To Video Leaderboard(with Audio)不是一个只看「画面好不好看」的榜单,它评的是带音频的完整视频,画面、声音、两者的同步程度,全都算分。

SkyReels-V4 能在这个维度拿到全球第二,说明它做对了一些和大多数视频模型不太一样的事情。


超 22000 人的「AI 产品市集」社群!不错过每一款有价值的 AI 应用。

邀请从业者、开发人员和创业者,飞书扫码加群: 
图片
进群后,你有机会得到:
  • 最新、最值得关注的 AI 新品资讯; 

  • 不定期赠送热门新品的邀请码、会员码;

  • 最精准的 AI 产品曝光渠道


01 

「万物可参考」的创作自由

要理解 SkyReels-V4 的能力,最直观的方式是看一个案例。

上传一段迈克尔・杰克逊的经典舞蹈视频和一张二次元图片,告诉模型:把舞者替换成这个角色。

几秒钟后,视频里的舞者变成了那个动漫人物,但每一个转身和手势的时机都和原版严丝合缝。

这已经很厉害了,但还没完。换一张狼的图片再试一次。

这回模型需要把一个人类的舞蹈动作,映射到一只四足动物身上。结果狼的动作流畅自然,身体的重心转移和节拍卡点依然对得上原视频。

这说明模型不止是抓取像素的外观,更是本质上理解了动作的语义。

难度还可以继续升级。例如《低俗小说》里乌玛・瑟曼和约翰・特拉沃尔塔的经典扭扭舞,给模型两张图:一只狗,一只猫。指令是把左边的舞者换成狗,右边的换成猫。

图片

这个任务的挑战在于,模型必须同时跟踪两个主体的运动轨迹,分别完成替换,还不能把两边的动作搞混。

SkyReels-V4 交出的结果是:狗和猫各跳各的,动作和原版舞者一一对应,互不干扰。

这套能力叫「运动参考」。对于短视频创作来说,它的想象潜力巨大。一旦你有了一段动作素材作为骨架,就可以把任何形象「穿」上去。同一段舞蹈,今天换成品牌 IP 角色做一版广告素材,明天换成二次元形象做一版粉丝二创,后天换成吉祥物做一版节日版本。

对于短视频创作者和内容团队来说,这意味着素材的复用率被大幅拉高,同一段动作的商业价值可以被反复释放。

02 

全栈能力:

整个工作流,一个模型搞定

运动参考只是 SkyReels-V4 多模态参考能力的一个切面。这个模型真正的野心,是覆盖整条视频创作工作流。从生成到编辑,从画面到声音,在一个模型里全部完成。

先看短剧生成。给模型两三张人物照片,再给一段对话剧本,它能直接输出一个带对白、带背景音乐、有正反打镜头切换的短剧片段。

图片

注意了,这是一个真的有镜头语言的视频。男人说话的时候镜头对着男人,切到老人的反应,再切回来,节奏是对的。

更值得关注的是音频部分。生成出来的台词清晰度很高,口型都对。而且带有情绪,紧张、警惕、怀疑,这些在剧本里写的情绪指令,模型都能在语音层面体现出来。仔细听还能听到紧张悬疑的背景音乐,完全契合剧情。这种音频质量放在一年前,单独拿出来都算得上一个独立产品的卖点。

而且它不只支持中文,英文、法语、日语,每种语言的语音都可以由模型原生生成。这意味着同一套角色素材,换一种语言的剧本就能产出另一个版本,对做海外内容的团队来说效率提升非常明显。

同样,在视频编辑方面,去水印、抹掉硬字幕、清理台标,也都能轻松搞定。

快速去除字幕

这些过去要靠 After Effects 或者好几个 AI 小工具拼在一起才能完成的操作,现在一个模型、一条指令就能搞定。

它还能做更复杂的事情:给一段女团舞蹈视频里的 C 位舞者凭空加上一顶帽子。

图片

帽子的颜色和细节都跟参考图一致,整段舞蹈就像她本来就戴着这顶帽子跳的。

或者反过来,从一段多人探险视频里把两个人直接删掉,删完之后背景自然补全,没有任何穿帮痕迹。

从生成完整短剧到精细化编辑修复,SkyReels-V4 试图让创作者的工具箱大幅简化:过去需要在好几个软件之间来回切换才能完成的工作流,现在可以在一个模型内完成。

03 

魔法背后的技术力

前面展示了这么多能力,一个自然的问题是:为什么这些事情能在同一个模型里完成?

答案藏 昆仑天工 SkyReels-V4 的技术报告里。如果只挑两个最关键的技术点来讲,统一拼接框架解释了「为什么一个模型能干这么多事」,双流 MMDiT 架构解释了「音视频怎么做到真正同步的」。

图片

论文:https://arxiv.org/pdf/2602.21818

先说第一个。SkyReels-V4 之所以能用一个模型干这么多事,核心在于它把所有视频任务都变成了同一种操作。

具体怎么做的?模型的输入被拆成三样东西拼在一起:一段待生成的视频底片、你提供的条件画面、以及一张遮罩。

遮罩的作用是标记哪些区域保留,哪些让模型重新生成。文生视频就是遮罩全空;图生视频就是第一帧锁定;去水印就是把水印的区域挖掉。任务千差万别,但在模型眼里只是遮罩的配置不同。

参考素材的注入是另一个维度。如果你提供了角色照片或动作视频,这些素材会被编码后拼在生成序列的前面,像一本摊开的参考手册。模型生成每一帧时都能回头翻看,从中提取外观、动作和风格信息。这就是为什么你可以同时给它一张角色图和一段舞蹈视频,它能理解「用这个外观,跳那段舞」。

两层拼接配合在一起,就有了一个真正统一的接口:生成、编辑、迁移,全部走同一套框架,同一套参数。

再说第二个。大多数视频模型生成画面之后,音频是后面单独加上去的,两者之间的对齐靠的是后处理。

SkyReels-V4 不是这么做的,它的架构叫「双流 MMDiT」:视频和音频各有一条生成线,但这两条线在每一步都能互相看到对方在做什么。

图片

打个比方,就像两个乐手看着同一份乐谱在合奏:视频这边画到嘴巴张开,音频那边就同步输出对应的语音;音频这边的节拍到了重音的位置,视频那边的动作也跟着卡点。两条线共享同一个文本编码器来理解指令,再通过双向交叉注意力机制在每一步互相校准。

但这里有一个工程上的难题:视频和音频的时间尺度完全不同。视频一秒 32 帧,音频一秒 44100 个采样点,两者的信息密度差了好几个数量级。

SkyReels-V4 用了一个叫 RoPE 频率缩放的技术来解决这个问题。本质上是让音频的时间坐标系「压缩」到和视频对齐,确保两边在注意力计算的时候看到的是同一个时间轴上的对应位置。

这就是为什么前面短剧案例里,多角色对话的唇形和语音能做到毫秒级的精准对齐,因为音视频从生成机制的底层就是绑定在一起的。

04 

从工具替代到工作流统一

把视角拉远一点看,昆仑天工 SkyReels-V4 做的这件事,其实是整个 AI 行业正在发生的一个大趋势的缩影。

语言模型从纯文本走向多模态,图像模型从生成走向理解,视频模型从单项能力走向全流程覆盖,所有方向都在往「统一」这个词收敛。SkyReels-V4 的统一框架不只是一家公司的技术选择,它更像是视频生成赛道演进方向的一个信号。

对创作者来说,这种变化的体感可能比技术叙事更直接。过去做一条完整的视频内容,工作流是「工具链串联」:用这个工具生成画面,用那个工具配音乐,再换一个工具做剪辑和后期。每切换一次工具就丢失一次上下文,素材在不同软件之间反复导入导出。

SkyReels-V4 则是让这条链变成一个框:所有素材进去,成品出来,中间模型始终理解你在做什么。创作的门槛在降低,但更重要的是,创作的连贯性在提升。

对更广泛的影视和内容制作行业来说,影响可能比「换一个更好用的工具」更深。传统影视后期是一条高度分工的流水线。特效、配音、音效设计、字幕处理,每个环节对应专门的软件、专门的人才、专门的外包预算。当一个模型能同时覆盖这些过去分属不同工种的任务,产业链里一部分中间环节的存在逻辑就开始松动了。

尤其在短剧、短视频、品牌内容、电商素材这些对产出速度和成本高度敏感的中腰部市场,制作的「最低可行团队」正在被重新定义。过去需要十个人干一周的活,现在可能三个人加一个统一模型,两天就能交付。当然,高端影视制作对精度和创意的要求,靠当前 AI 还不能完全替代,但「全栈统一」的意义已经从技术架构的故事,变成了产业效率的故事。

回到昆仑天工自身,SkyReels 系列的迭代节奏也值得留意。V1 主攻人物表演和影视级质感,是中国最早面向 AI 短剧创作的垂直场景视频生成模型;V2 引入自回归扩散架构,实现了无限时长的连续视频生成;V3 强化了多模态参考驱动,支持图像、视频、音频等多种条件输入;到了 V4,音视频联合生成和全场景统一编辑被装进同一个架构。每一步都不是在某个单项上刷分,而是在把更多能力往同一个框架里收。

这条路不轻松。统一意味着每一代都要做架构层面的改动,而不是在已有框架上微调;意味着要同时把生成质量、编辑精度、音频同步这些互相制约的指标都拉上来。但走到 V4 这一步,Artificial Analysis 第二的成绩单至少说明了一件事:这条「把所有东西装进一个模型」的路,昆仑天工走通了。

图片

图片
转载原创文章请添加微信:founderparker
文章标签AI资讯
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多