智东西(公众号:zhidxcom)
作者 | 毕伟豪
编辑|漠影
近几月,AI视频生成赛道持续升温。7月31日,Seedance2.5与MiniMax H3同日发布;8月,阿里发布Wan3.0;进入9月,智象HiDream-O1-Video-1.0(下文简称HiDream V1)发布并冲上权威榜单全球前四。

短短两个月,多家厂商接连推出新一代视频生成模型,行业竞争进一步加速。以字节Seedance、MiniMax H3、阿里Wan 3.0和智象HiDream V1为代表的中国模型,开始在全球主流榜单头部形成集群。中国视频生成模型正在从“单点领先”转向“多家并进”。
其中,智象作为创业公司进入这一竞争区间,也意味着全球视频模型的头部牌桌上,除了大厂和上市企业,开始出现新的玩家。
几轮密集上新的背后,AI视频生成也逐渐从单一的内容创作走向影视、广告、电商等诸多生产场景,与此同时,行业竞争的重点也开始发生变化。
除了对画质、时长和人物一致性等方面的基础要求,模型对复杂运动、物理规律等真实世界的理解,正在成为新的竞争维度。随着视频模型开始处理越来越复杂的动作、空间关系和物理规律,视频生成也成为当前探索世界模型的重要路径之一。
9月15日,智象(HiDream.ai)发布了原生全模态音视频生成模型HiDream V1,其图生视频能力在Artificial Analysis排名第4,在Arena.ai的图生视频模型榜单中排名第8,双榜前十,跻身全球视频生成模型第一梯队。

相比于榜单排名,更值得注意的是它的位置,从今年4月的HiDream-O1原生全模态架构算起,智象在图像、3D交互、具身方向的模型已相继落地,随着HiDream V1的加入,这套围绕世界模型路线构建的模型矩阵,也补上了视频这一块重要拼图。
这款模型的发布,不仅宣告了智象的原生全模态世界模型矩阵路线完成闭环,也在产业角度标志着智象正式跻身视频生成的核心决赛圈。
一、听得懂人话,也敢不凑时长
现如今,人们使用视频生成工具的常规姿势,是把提示词写详尽:镜头、光线、动作、时长一项项交代清楚。但真实场景里,撰写专业提示词存在门槛,用户给模型的输入常常只是一句口语、一个模糊的念头。
在这种情况下,模型能否根据用户偏口语化、细碎、模糊的输入理解意图并生成视频,变得尤为重要。
HiDream V1的解法是,在生成前先通过多模态意图理解模块分析用户需求,再调用多模态理解模型进行结构化规划,规划字段覆盖人物、动作、镜头、光影、台词、声音等关键信息,将一句自然语言需求拆解成可执行的分镜信息后,再进入联合生成。
其中,时长也是规划的一部分。多数模型的生成时长由提示词预先设定:输入5秒,模型就在5秒窗口内完成内容,动作即使没有结束也只能压缩处理。
HiDream V1则让模型根据内容自行规划时长,结合事件展开、动作完成和叙事节奏决定生成长度,原生支持5—20秒任意时长生成。这样一来,时长不再只是固定参数,而会根据内容同步变化。
在此基础上,1080p高保真输出保障单镜头画质,为连续叙事提供基础。视频生成也由单纯的“按提示词生成画面”,进一步走向“理解用户意图后组织完整镜头”。
为了检验这套机制在真实输入下表现如何,智东西用三个场景做了实测。
首先来测试一下意图理解能力,我们用语音输入的方式提供了一段简单的提示词,并附上了一张从故事的中途切入的参考图,看看HiDream V1会怎样编排镜头。

其实我们最终想要的就是抚摸小狗、小狗跑走,男生接着赶路这条线,同时,“下班”和“有点累”这两个关键词对主人公的状态存在约束。
能看到HiDream V1在生成视频时,根据参考图截取了故事情节,然后精确还原了人与狗的动向。同时在一些细节上,比如男生摸完狗以后手臂搭在腿上,起身时身体微微前倾和打晃等,透露出疲惫姿态。

接下来,我们输入了一个非常短的提示词,来测试HiDream V1动态调整时长的能力,提示词和参考图如下:

这个提示词根本撑不住十秒钟的情节,HiDream V1并没有强行凑时长,比如拉长等待时间、安排突然跳出一个鸟,或者是猫咪反应超大等情节。猫咪只是简单抬了下头,视频时长仅为7秒,鸟叫、猫咪抬头动作、懒洋洋的姿态都保持得很好。

最后再来看一下HiDream V1在音画一致性上的表现,我们提供了一张参考图和一段说唱舞台的提示词,并且在提示词中的台词部分故意漏掉了一个字,提示词如下:
生成一段约10秒的真实嘻哈音乐节现场。一名年轻说唱歌手站在大型舞台中央,手持麦克风高能说唱,穿大众街头服装,巨型LED屏幕播放动态,视觉舞台灯光跟随鼓点变化,台下观众挥手欢呼。镜头结束场景紧随歌手前方移动,再切到近景捕捉表情、口型和嘴巴,最后拉远展示整个舞台。歌手说唱一首原创歌词:“低轰进胸口,今晚就看谁先出手。”要求中文说唱节奏明显,咬字充足,口型与歌词准确同步;鼓点、贝斯、歌声、灯光和人物动作保持同步,随着说唱逐渐推高现场情绪,最后以观众欢呼和音乐高潮结束。
可以看到,HiDream V1在音画同步方面做得相当不错,人物的嘴型和歌词都一一对应。HD-V1还把我们所提供的残缺歌词进行了补全,“低音轰进胸口”这句歌词非常清楚,并不是含混的略过。
二、从生成动作到理解运动规律:一句话生成超燃百米飞人大战、NBA绝杀
视频是人类观察动态世界最直接的方式。视频模型要跨过的分水岭,是让画面里的运动符合真实世界的因果。
比如,人在跑步时肌肉会颤动,篮球出手后会划出抛物线,手部施力会影响线的走向。让物体动起来,和让它按真实规律动,是两件事。
HiDream V1在生成与叙事规划中进一步强化了对物理规律的建模:物体在重力下如何落下、碰撞如何反馈、惯性如何延续、光影如何衰减、空间如何保持连续等等。
关于这部分能力,智东西进行了三次测试,其中两个测试为多人运动场景,一个是细致的手部动作生成。需要观察的是模型面对动作描述和参考图片,能不能生成符合现实规律的完整运动过程。
首先,我们从精细的手部动作切入,选择了“拧螺丝”这一需要双手协作的场景,让一只手固定螺丝,另一只手使用螺丝刀旋转,将螺丝逐渐拧入木板,观察模型能否处理手、工具和小型物体之间的精细空间关系。

生成结果显示,HiDream V1成功理解了连续动作关系。螺丝刀保持着与螺丝位置的对应,随着旋转动作推进,螺丝逐渐进入木板,双手与工具之间的空间关系整体自然,最后也完成了拧紧动作。

第二个测试,我们根据NBA比赛最后时刻的三分绝杀场景,做了一张参考图,并附上提示词,看看HiDream V1在这种人物繁多的情况下,能否生成符合物理规律的视频。

HiDream V1所生成的视频效果相当不错,在多人同时运动的场景中,每个球员的动作都很流畅,特别是在运球单打的后撤垫步和起身跳投的过程中,球员的肌肉线条、篮球的飞行轨迹和旋转都符合现实物理规律,只在最后出现了一点人物位置的偏移。

最后一个测试是奥运会百米飞人大战。我们设置了8名运动员同时起跑的场景,从发令、起跑,到中段逐渐拉开差距,再到最后两名运动员几乎并肩冲刺,观察HiDream V1能否处理多人同时运动时复杂的空间关系,以及不同运动员之间速度变化和相对位置的变化。

从生成效果来看,HiDream V1基本还原了百米比赛的完整运动过程,运动员的跑步姿态、摆臂和腿部动作保持了较好的连贯性,人物之间也没有出现明显的肢体穿模,脚步声和步频也能对应。

三组测试分别从精细操作、多人运动和复杂运动三个层面进行了验证。可以看到,HiDream V1能够很好地持续维护人物、物体和空间之间的关系。
支撑这些能力的,是智象“先规划、后联合生成、再以多模态Reward对齐”的技术思路:先在全局层面规划叙事与角色状态,再在联合生成中约束画面、动作与语义,最后用多模态奖励信号对齐画质、连贯性与物理合理性。
在后训练阶段,智象采用Diffusion RL技术,并设计与人工认知对齐的多模态Reward模型。这套训练链路的背后,是DMSampler、DiffusionCompass、EvoID三篇论文,从扩散强化学习采样效率、生成质量控制和身份保持等方向为模型研发提供技术支撑,分别收录于2026年ICML、ECCV、CVPR三大顶会。

智象(Hidream.ai)联合创始人兼CTO姚霆说:“视频生成的代际进化不仅仅是像素的提升和时长的延续,而在于模型是否真正理解创作者的意图和真实世界的物理规律。HiDream V1从架构设计之初便面向文本、视频与音频的统一表征,原生全模态技术使之从‘看得清、动得顺’,迈向‘听得懂、说得准、演得连贯’。”
从实测来看,这种能力变化体现在了具体的视频生成任务中,模型需要理解的不再只是某一帧画面,还有人物如何运动、物体如何变化,以及一个动作发生后会带来怎样的结果。
对于视频生成而言,这或许也是其走向世界模型的重要特质。
三、不止路线图:一个UiT底座,四大模型的体系化落地
HiDream V1的意义不只是新增一个视频模型,更在于它进一步补上了原生全模态世界模型矩阵中的Video一环。围绕这一统一底座,智象已经形成了图像、视频、3D、具身四个模型方向。
图像解决视觉生成与理解,视频进入时间维度,3D对应交互式环境,具身进一步深入真实动作与具身反馈,四个模型分别对应着四个观察世界的切面。

此前,HiDream-O1-Image商用版1.5在Artificial Analysis文生图榜取得中国第一、全球第三;HiDream-O1-Video在两项图生视频榜单分列第4与第8;HiDream-O1-World在交互式世界模型基准WBench的Navi分榜以平均分80.9位列第一,物理一致性73.3分同样第一;HiDream-O1-Embodied在RoboColiseum的Robustness(扰动适应)子榜以平均分0.692登顶。

这些模型共享UiT(Unified Transformer)统一底座,文本、图像、视频、3D与具身数据能够在同一个表征空间里进行处理。
智象(Hidream.ai)联合创始人兼CEO梅涛在谈论智象的路线时坦言:“智象致力于构建‘一个原生全模态底座、四大模型同源演进’的模型矩阵。我们所构建的,不是四条彼此独立的能力线,而是一套以统一技术架构为底座、面向世界模型持续进化、走向可落地的原生全模态体系。”
HiDream V1发布后,原生全模态世界模型矩阵路线的闭环,让智象在全球世界模型探索中,进一步形成了从视觉生成到真实世界交互的完整能力布局。
结语:中国AI视频生成,再添一股全球竞争力量
从整体实测效果来看,HiDream V1于各类复杂场景中,在连续动作、人物关系、物理规律以及音画同步等方面的表现可圈可点。
尤其是在篮球绝杀和百米飞人大战的视频中,HiDream V1体现出了极强的预测能力,仅通过一张图片就生成了后续场景,而且物理定律并没有崩坏。
这一点能够反映出视频生成和世界模型路线的一个切口,视频所记录的是现实世界不断变化的过程,而当模型能进一步理解时间、空间、物理规律以及因果关系,视频生成所覆盖的能力边界也会随之不断扩大,逐渐成为模型理解和模拟真实世界的一种路径。
HiDream V1的发布,不仅是智象在视频生成领域的全新进展,也让其“一个原生全模态底座、四大模型同源演进”的模型矩阵布局真正显现出来。







