Token导航 LogoToken导航

Einsia AI发布世界模型物理理解测试最高仅57分

更新时间 2026-10-08来源 机器之心正文 3464字阅读约 11分钟12 张图片

一个小球从空中落下,一束光照向镜面,一块包着石头的浮冰慢慢融化。对人来说,这些都是熟悉的物理现象。对模型来说,它们却是一场并不轻松的考试。

现在的模型,画面可以生成的很清晰,物体可以生成的很连贯,运动也可以看上去很顺畅。但小球是否遵循自由落体规律?反射光线的角度是否正确?冰融化之后,液面又会怎样变化?这些问题,需要从视频里真正测量。

Einsia AI 旗下 Navers Lab 的最新工作 「World Models' Last Exam in Physics」,用 40 个任务、9 类物理现象,对 8 个视频生成模型展开测试。当前模型中,Seedance 2.5 排名第一,但平均分也只有 57.76 / 100。

它想探究的本质是:

「现有的视频生成模型,是否能够遵守物理规律?」

图片

  • 论文题目:World Models’ Last Exam in Physics

  • 项目主页:https://lab.einsia.ai/phys-last-exam

  • GitHub:https://github.com/Einsia/phys-last-exam

  • arXiv: https://arxiv.org/pdf/2610.08791

画面连贯了,物理就对了吗?

要判断画面连贯的背后,物理规律是否同样成立,研究团队构建了 40 个视频生成任务,覆盖 9 类物理现象,涵盖力学、光学、流体、相变、电磁等方向。从小球下落到单摆振荡,从光线反射到浮冰融化,每道题都要求模型生成一个具体的物理过程,并接受相应物理关系的检验。

对模型来说,任务非常直接:

「给定一张初始图像和一段生成提示,生成接下来发生的物理过程。」

输入规定了场景的初始状态,以及接下来需要发生的事件的 Prompt;输出则是一段由模型生成的视频。模型需要保留图像中的物体与场景关系,让指定过程持续发生,并使其中的运动和变化符合相应的物理规律。

从确定的初始状态出发,生成一个在物理上成立的后续过程,正是模型需要完成的任务。

难点也恰恰在这里。

图片

视频里的物理,究竟怎么测?

评测一段生成视频,需要分别回答两个问题:视频是否完整、连贯地呈现了要求的场景?场景中的过程是否符合物理规律?

这套评测因此将评分分为两部分:一致性分数 C 和 物理分数 P,两者均采用 0—100 分制。

一致性分数 C,衡量视频中的主体、事件和场景能否保持连贯,并提供完成任务所需的观察依据。

例如,评测自由落体时,小球应当持续可见,不能突然消失、变成另一个物体,或出现无法连续跟踪的位置跳变。评测两根单摆时,需要能辨认两根摆、观察释放和摆动过程,并看清比较周期与摆长所需的部分。

一致性分数由视觉语言模型 Qwen3.6-27B 给出。评测为每道任务设置专门的提示词,引导模型检查所需主体是否存在、关键事件是否出现,以及画面中的对象和过程是否保持连续,最终输出一个 0—100 分的分数。

一致性分数 C 反映的是视频是否呈现了可辨认、可观察的任务过程。

图片

一个小球可以始终沿着连续轨迹下落,但它的位置随时间变化的关系仍然可能不符合自由落体规律;两根单摆可以平稳地摆动,但周期与摆长之间的关系仍然可能是错的。

这种差别会影响视频模型的下游应用。例如,机器人如果借助生成视频预演推动物体的后果,就需要模型正确描述受力和摩擦。预测的滑行距离一旦有误,机器人就可能选择错误的推动力度,使物体偏离目标。

因此,还需要物理分数 P,该指标衡量从视频中测出的物理量,与预先定义的物理关系有多大程度的一致。

「物理分数由测量结果决定,无需与参考视频比较,也不依赖视觉语言模型直接判断物理正确性。」

这套方法覆盖光学、流体、相变、电磁等不同领域,让多类物理现象都有具体的检验依据。

它的核心思路是:把视频中的「物理量」测出来,再检查它们是否满足相应的物理关系。

程序通过分割、跟踪、几何拟合和事件检测,从视频中提取轨迹、周期、角度、液面等可观察量,再按照各任务的指标计算误差和得分。物理分数由这些测量结果决定,无需与参考视频比较,也不依赖视觉语言模型直接判断物理正确性。

以两根长短不同的单摆为例,在小角度近似、重力条件相同的情况下,周期之比的平方,应当等于摆长之比。程序从视频中测出两根单摆的周期 T₁、T₂ 和摆长 L₁、L₂,计算这一关系的相对误差:

图片

如果测量结果完全符合这条关系,e = 0;偏离越大,e 就越大。随后,程序将误差换算为该指标的分数:

图片

其中,0.20 是该指标预先设定的误差尺度,对所有模型保持一致。按照这一规则:

  • 误差为 0,得 100 分。

  • 这条关系的相对误差为 20%,得 50 分。

  • 相对误差为 40%,得约 33.3 分。

一道任务可以包含多个指标。单摆任务除了检查周期与摆长的关系,还检查重复摆动时周期是否稳定。各项指标按任务规则计分后,对已定义指标取算术平均,得到物理分 P。若各项指标均已换算为百分制:

这样,分数就对应着具体的测量结果:模型究竟保留了哪条物理关系,又偏离了多少。

图片

Seedance2.5 生成的视频评测(左 72.54 分,右 97.70 分)

总分 S 将一致性和物理性结合起来:一致性占 15%,物理性占 85%:

图片

但物理部分有计入条件。当 C ≥ 80,才计算物理分记录,否则,物理部分不计入总分。

例如,C 为 100、P 为 60 时,总分是 66;如果 C 只有 60,即使记录到较高的物理分,总分也只有 9。这样可以避免主体缺失、关键事件未发生等问题,被局部物理指标的高分掩盖。

每项评测还保存中间测量结果和可视化证据,帮助研究者追查低分的原因:究竟是运动偏离了规律,关键事件没有出现,还是画面缺少足够的测量依据?

这套评测希望回答的是:当模型已经能生成逼真、连贯的视频时,画面中的物理过程,是否同样是正确的?

Seedance 领跑,但最高分仍只有 57.76

图片

在本次参评的 8 个视频生成模型中,Seedance 2.5 以 57.76 分取得最高平均综合分,MiniMax H3 以 54.89 分紧随其后。

物理规律的理解,仍是当前模型的软肋

相变是一种常见的物理现象,比如冰变成水。对于这一简单现象的生成,只有 Seedance 2.5 一家领先,取得 95.61 分,而其余模型最高为 15 分。这一现象说明,大部分模型对基本的物理规律缺乏理解。

图片

冰块融化,液面高度不变,Seedance 得分为 95.61,MiniMax 生成的冰块没有融化,不遵循 Prompt,得分为 0.00

光学同样是各模型的共同难点。以 “光的折射与全反射” 任务为例,8 个模型的平均综合分均未超过 40 分。模型能够生成光束和介质界面的视觉外观,却难以在光路变化过程中持续保持相应的物理约束。

图片

折射现象,MiniMax H3 能生成部分折射光线,但是是错的,分数为 31.67;Cosmos 不能生成,分数为 0.00 分

另一个共同难点是自由落体。这项任务中,各模型的平均一致性分达到 98.75 分,平均物理分却只有 13.88 分。小球可以完整、连贯地下落,但测得的运动仍可能偏离任务要求的物理关系。反映出当前模型对时序动力学建模能力的不足。

图片

小球自由落体,两者都是近似匀速下落,不符合物理,Seedance 得分为 29.50,Wan 得分为 22.72

这些结果表明,当前的生成模型,在大部分场景中仍然不理解物理世界的规律。

这套评分,和人类判断有多接近?

为了评估本研究中的物理量评分与人类判断的一致性,研究团队邀请 10 位标注者,对覆盖 40 个任务的 320 段视频进行人工评估,并将测量方法与视觉语言模型直接评分(Direct VLM)进行比较。

比较分为两种:一种先让标注者给视频打分,再检查自动评分与人类评分对视频优劣的排序是否一致;另一种直接展示两段视频,让标注者判断哪段更符合物理规律。

图片

在两项比较中,本研究方法分别比 Direct VLM 提高 8.18 和 7.50 个百分点,与人类之间的一致率仍有约 5 个百分点的差距。

实验结果说明,从视频中提取物理量、依据具体关系评分,比让视觉语言模型直接判断物理正确性,更贴近人类的判断。

从生成画面,到预测世界

一段生成画面看起来连贯,并不意味着它真的遵循了物理规律。

小球如何下落,物体怎样碰撞,冰块如何融化,这些过程都受到明确的物理关系约束。视频模型可以把过程 “画出来”,却未必真正保持住其中的规律。

World Models' Last Exam in Physics 的结果表明,一旦从 “看起来合理” 进一步追问运动轨迹、周期和物体之间的定量关系,当前生成模型的局限便会迅速暴露。

这项研究最终追问的,其实是一个更根本的问题:

「世界模型生成的,究竟只是一个 “像真的” 画面,还是一个真正符合物理规律的未来?」

从生成画面,到预测世界,中间隔着的,正是世界模型下一阶段需要跨越的能力边界。

资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多