智象(HiDream.ai)的视频模型 HiDream-O1-Video-1.0(下文简称 HiDream V1) 这两天又成为了视频生成赛道的热点。确实做的不错。
不过,我发现很多人还是习惯拿它和 Seedance 2.5、MiniMax H3、阿里 Wan 3.0、Kling 这些视频模型做类比。
它们当然属于一类产品,基本逻辑也差不多,都是用户输入图片、文本或者其他素材,最后生成一段视频。
但看得再深一层,你会发现智象走的是一条非共识的路:大家比的是画质、时长和价格,它反复强调的却是物理规律和智能水平。
但从官方的 Release Blog 能够看出来,智象绝对不是单纯想做一个视频模型,和 Seedance 2.5 比个高低。
不是的,醉翁之意不在酒,智象的逻辑是用同一套底层架构,把图像、视频、3D 空间和动作逐渐衔接起来,最后目标是世界模型。

这次的视频模型,只不过是他们在做世界模型过程中沿途下蛋罢了。
我今年曾经系统研究过这家公司。他们之前已经陆续发布了 Image、World 和 Embodied 三个模型。这三个模型,其实也都是他们走向世界模型过程中陆续长出来的阶段性产物。
我简单解释一下这几个模型之间到底是什么关系。

Image 我们已经非常熟悉了。它先让模型学会理解一张图片,比如画面里有哪些人物、有哪些物体,它们分别处在什么位置,彼此之间是什么关系。
其实可以这么理解,一张图片记录的,就是现实世界某一个瞬间的状态。
在这个基础上,这一次 Video 模型补上了对世界动态演化的理解。
它让模型从理解静态的二维画面,走向理解包含时间维度的动态世界:不仅知道画面中有什么,还能理解事物如何运动、状态如何变化,以及前后事件如何沿着物理规律发生。
所以,Video 不只是让图片动起来,而是让模型开始理解世界如何随时间演化。这也是从图像模型走向世界模型的关键一步。
发布同期,HiDream V1 在 Artificial Analysis Image to Video Leaderboard(With Audio)榜单中位列全球第 4,跻身全球视频模型第一梯队。
这一成绩也进一步印证了智象在动态世界建模与音画一体化生成上的技术积累。

再往前一步是 World 交互式世界模型。
World 要做的,是让模型进一步理解三维空间,知道这个空间里面前后左右是什么关系,甚至可以在里面移动和交互。这个模型我之前其实专门写过。
再往后是 Embodied。
Embodied 考虑的是物理世界。因为世界模型最终还是要给具身智能打底的,所以模型不能只是理解空间,还得理解动作。
而要真正理解动作及其反馈,模型首先要理解世界如何随时间变化,以及这些变化背后的物理规律。这正是 Video 模型为整个模型体系补上的关键能力。
举个例子,一个球从手里掉到桌上,并不会直接从一个位置跳到另一个位置。它会先下落,撞到桌面后再反弹,接着一次比一次低,最后停下来。
模型如果真想理解这个过程,就得知道这些变化为什么会发生,以及前后状态之间存在怎样的因果关系。
这也解释了为什么智象未来的 HiDream V1 始终强调物理规律。在全行业卷时长、卷单价的当下,把最重的研发资源押在对物理规律的理解上,本身就是一步非共识的棋。
大家如果去看官方的 Release Blog,其实很容易看出来。我之前写过很多次,Release Blog 里面往往有非常重要的一手信息。
听话听音,一个团队发布新模型的时候,到底反复强调什么,基本就能看出他们这次真正想解决的问题是什么。

我们看几个 Case 感受下。下面这是提示词:

这是最后生成的视频。这个例子挺考验模型对物理规律的处理。拉拉链这个动作,我之前用很多模型试过,虽然也能拉开,但看起来不真。
大家看一下 HiDream V1 这段。拉链头往前走的时候,包身会被轻轻带动,已经拉开的地方自然分开。这个细节其实很重要,我之前试过很多模型,动作一眼看着就假。
这里连摩擦声都比较符合我们的日常经验。
再看这个撕包装袋。这个 Case 我主要看两个地方,一个是袋子受力之后的形变,另外一个就是细节。手一用力,包装袋会自然起皱,撕开的边缘也比较真实。
尤其这种近景很容易露馅,但你看手指、铝箔的纹理,甚至撕开的边缘都还挺真实的。
再看一个生活化的,下面是提示词:
拍一个 15 秒的轻松生活短片:一个短发、戴圆框眼镜、穿橙色上衣的人在家偷偷练舞,越跳越觉得自己特别帅。
跳舞时自然转了一次身,随后发现自家的猫一直坐在旁边看着自己,瞬间有点尴尬,假装若无其事地整理了一下衣服。
在 15 秒内把这个小故事讲完整,自行安排各阶段节奏和镜头,可以自然切换全身、中景和面部近景。人物表演和猫的反应自然,笑点靠前后反差与短暂的停顿,不要夸张表演。
全程保持同一个人的面部、发型、眼镜和服装,保持同一只猫、同一个房间。声音配合情绪变化,无旁白。
大家看我的提示词,其实我没有写具体的分镜,也没有告诉它第几秒切近景、第几秒让猫出现。
我只是讲了一个很口语化的小故事,一个人在家偷偷练舞,跳着跳着发现猫一直盯着自己,于是有点尴尬。
但模型需要自己理解这个笑点在哪里,然后安排人物表演、猫入镜等等。最后生成出来,整个故事是成立的。
再看一个物理规律的 Case。把最下面的支撑书突然抽走,看看中间那本书和橡皮会怎么掉下来。整个下落过程,其实比较考验模型对重力和受力变化的理解。
大家也可以拿其他模型试试,这种受力变化的细节其实很容易露馅。
但反过来说,一旦模型真正理解了物理规律,生成视频里的运动轨迹、物体交互和前后状态就会更自然、更连贯。
它带来的不只是画质上的提升,而是让视频生成从看起来像真的,走向事情真的会这样发生,这才是决定视频模型能力上限的关键。
还有一个细节,我不知道大家有没有注意到。智象其实一直在强调一个词,叫原生全模态。之前发布其他模型的时候,他们也反复讲这个概念。
但行业里我们听得更多的,还是原生多模态。当行业都在讲多模态的时候,智象偏要讲全模态,一词之差,又是一次非共识。

那全模态跟多模态到底有什么区别?
我的理解是,过去我们讲多模态,更多是在说一个模型能不能同时处理不同类型的信息。比如既能理解文字,也能看图片、视频,还能听声音。
通常支持两种以上的模态,就可以叫多模态。
但智象做 UiT 架构的设想是让图像、视频、声音、3D、动作这些信号,尽可能从底层就进入同一套 Transformer 架构里,让模型直接学习不同模态之间的关系。
最后想做到的是 Any to Any。理想状态下,只要输入任何一种模态,输出也可以是任何一种模态:
输入文字,输出视频。
输入图片,输出视频。
输入视频,输出文字。
甚至以后输入动作、空间信息,再输出别的模态。
所以最简单的一句话可以这么理解,多模态强调我能处理很多种信息,原生全模态强调这些信息尽量从底层就在同一个模型里一起学,最后可以互相转换。
前面我们讲过,智象这家公司做视频模型,其实有点醉翁之意不在酒。HiDream V1 当然是一款视频模型,但他们真正想去的地方,还是世界模型。
不过世界模型今天其实还没有收敛成一条标准路线。
Yann LeCun 那条 JEPA 路线,更强调预测接下来的状态。简单理解,就是给定现在,让模型预测世界接下来会变成什么样。
不过它更关注在抽象表示空间里预测,而不是逐像素生成下一帧。
李飞飞这条路线则更强调空间智能,把 3D 空间作为核心,让模型能够生成、重建和模拟一个可以持续存在、可以交互的世界。
智象走的是第三条。在 JEPA 和空间智能两条明星路线之间,从视频出发、直接学物理规律,是更少人走的路。
他们的创始人梅涛博士大家可以去查一下,在视觉和视频生成这个领域做了近 20 年,是国内在视觉生成领域少有的 ACM、IEEE、IAPR 和 CAAI 四大顶级学会 Fellow。
因此智象在视频生成领域有着深厚技术积累。
2024 年 1 月率先实现超 15 秒视频生成技术突破,同年 7 月推出全球首个商用 DiT 大模型 HiDream 2.0,12 月发布采用扩散自回归架构的 HiDream 3.0,持续推动视频模型从生成能力向深层理解演进。
再到本周发布的 HiDream V1 则实现了在面向世界模型方向的新一代 UiT 架构上的再次升级。
他们的思路是从视频模型出发,让模型去看大量真实世界的视频,然后直接从这些数据里学习这个世界的物理规律。
这也能解释为什么他们这么重视 Video。
因为在他们的判断里,视频是现在规模最大、最丰富的真实世界数据之一。
这里面既有大量第三人称的视频,比如我们平时拍摄的各种内容,也有越来越多第一人称的数据,比如人戴着头显、摄像设备去完成各种操作。
模型如果看过足够多这样的东西,它就有机会从里面学到一些更底层、更通用的规律,最后得到更好的泛化能力。
智象一直把图片看成入口。图片先解决一个瞬间怎么看,视频再往前一步,让模型开始理解这个世界接下来会怎么变化。但真实世界显然不只有画面和时间。
还有声音、空间、动作,以及动作之后产生的反馈。
所以他们又往原生全模态走,希望把这些不同的信息逐渐放进同一套底层架构里学习。只有这些能力慢慢接到一起,最后才有可能走向真正的世界模型。
话说,我感觉,智象最值得盯的,是它在视频模型上连下的几步非共识的棋:
别人卷时长、卷价格,它卷物理规律;行业讲多模态,它坚持原生全模态;别人把视频模型当产品终点,它把视频当作通向世界模型的路。
世界模型这场仗还早,共识让人不掉队,但真正拉开身位的,从来都是非共识的判断。







