
过去几年,世界模型沿着 Scaling 路线快速推进。更多数据、更大模型、更长视频和更高分辨率,让模型越来越擅长生成看起来合理的未来。但当人形机器人从展台走进工厂,换一只杯子、挪动桌面摆设,原本流畅的动作仍可能失灵。
这让行业开始把目光投向一场更深层的范式转换。这意味着,世界模型需要从依赖规模化学习的相关性大模型,进一步走向能够理解变量作用关系的因果大模型。随着模型开始参与真实行动,能否理解动作、环境变化与结果之间的因果关系,正成为新的评价标准。
近日,聚焦因果智能的下一代 AI 公司 Aether AI 发布首个因果世界模型 CausalWM,并将因果思维链(Causal Chain of Thought)引入未来预测过程。
图 | Aether AI 创始人黄碧薇 X 账号官宣发布 CausalWM
作为这一技术范式的阶段性验证,CausalWM 以 CWM 名称参与 TriWorldBench 评测,并以 66.04 分位列综合榜单第一。
CausalWM 的关键设计,是在生成未来视频前先预测物体运动和空间变化,再将每一步结果送入下一步,直至形成最终画面。这条因果思维链关注的不只是下一帧呈现什么,还包括动作经过哪些中间变化影响了最终结果。
TriWorldBench 是面向三视角具身世界模型的公开评测榜单。它通过设置 500 个测试片段和 50 项机器人操作任务,要求模型同时生成头部、左腕和右腕三个视角的视频。评测涵盖三视角一致性、任务对齐和物理与三维一致性等共 6 个维度。除了总成绩位列榜首,CWM 还在透视合理性和图像质量上排名第一,三视角一致性和运动质量均排名第二,任务对齐排名第三。
如果说大语言模型的思维链是在用文字拆解一道复杂问题,CausalWM 则把推理步骤换成了物理变量。它在榜单上的表现,也让一个持续困扰具身智能的问题变得更具体:机器要怎样从“看见未来”,进一步走向“理解未来如何发生”?
机器人需要怎样的未来
当前,具身智能的主流探索大致沿着两类路径展开:一类以视觉语言动作模型(Vision Language Action,VLA)为代表,模型读取视觉信息和语言指令,直接输出机械臂或机器人的下一步动作;另一类则引入世界模型,让机器人在真正行动前,先推演不同动作可能带来的环境变化。
前一条路径缩短了感知到行动的距离,也推动机器人完成抓取、搬运和装配等任务。但机器人执行任务时,未来并非一段供人观看的视频。机械臂靠近杯子、夹爪闭合、杯子被提起,每一步都依赖前一步是否真正发生。
如果夹爪没有接触杯身,后面的画面却继续呈现杯子被拿起,即使视频足够流畅,这次预演也无法帮助机器人判断下一步。
世界模型由此承担起更重要的角色。它根据当前环境和候选动作预演下一时刻,让机器人比较多种结果并选择路径,逐渐成为连接感知、预测和行动的内部模拟器。
行业评价世界模型的方式也在随之调整。早期研究更关注生成视频的清晰度、连贯性和长度,新的评测逐渐加入任务完成、动作一致性和下游规划能力。模型需要生成看起来合理的画面,也要保证机械臂确实靠近目标、完成接触,并让多个相机记录的是同一次操作。
TriWorldBench 榜单正是这一变化的缩影。它没有把头部、左腕和右腕视频作为三段独立内容,而是把它们视为同一个机器人世界,检查不同视角中的动作、物体状态和操作阶段能否相互对应。
图 | CausalWM 位列 TriWorldBench 综合榜首(来源:TriWorldbench官网)
从榜单结果看,CWM 的优势同样不只落在画面生成上。除透视合理性和图像质量排名第一外,它在三视角一致性、运动质量和任务对齐上也位居前列。
此外,团队还在 R-Bench 和 PAI-Bench 上进行了多类预测测试。CausalWM 在多项设置中取得领先,并在 PAI-Bench 上超过 Cosmos 3、LingBot Video 等更大规模的模型,进一步体现了显式组织运动和几何状态的价值。
这项要求比视频生成更接近真实行动。数字空间中的错误画面可以重新生成,机器人在物理环境中的一次误判却可能改变物体位置,甚至影响后续全部动作。模型若只记住常见画面组合,环境一旦变化,原本稳定的预测仍可能迅速失效。
这也把世界模型的任务推向更深一层。模型需要在最终画面之外,追踪动作、接触、位移和空间结构如何共同塑造结果,因果关系由此成为具身世界模型的一道关键分界。
因果为何关键
在更长的技术演进尺度上,Aether AI 创始人黄碧薇将 AI 的演进概括为相关性小模型、因果小模型、相关性大模型和因果大模型四类范式。
前两类模型通常围绕有限变量和特定任务展开,后两类则依靠更大规模的数据与参数学习复杂模式。目前的大模型浪潮主要释放了相关性大模型的能力,但因果大模型的发展仍处于前夕。
相关性学习擅长从海量数据中寻找反复出现的搭配,却不一定能够说明结果怎样形成。因果大模型则希望进一步找出真正影响结果的变量,理解变量怎样相互作用,并判断主动改变其中一个变量后,其他状态将如何变化。
团队认为,视频、机器人和生物实验的关键变量往往藏在像素、轨迹和传感器信号中。如何从原始数据中提取这些变量,是连接因果方法与规模化训练的重要问题。
现有具身世界模型大多采用端到端方式。模型接收初始画面、语言指令或动作信号,随后直接生成未来视频。当训练数据足够丰富时,它可以学习大量常见运动模式,生成连贯且视觉上合理的短时未来。
然而,当预测时间拉长,或者多个物体连续接触时,一次直接映射面对的变化会迅速增多。机械臂先靠近目标,夹爪随后闭合,物体受力后改变位置。前面的运动一旦出现偏差,误差也会随着后续生成继续传递。
端到端模型还容易依赖训练数据中反复出现的画面组合。如果机械臂经常把红色杯子移向右侧,模型可能记住颜色、位置和结果之间的搭配。一旦杯子或摆放方式发生变化,熟悉的关联随之失效,模型便需要重新判断动作、接触和位移之间的关系。
图 | Aether AI 官方 Blog 发布 CausalWM
为了让模型沿着物理变化组织陌生场景,Aether AI 团队在 CausalWM 中引入了一条具有先后顺序的物理推理链。团队从视频中提取光流(optical flow)、深度(depth)和点映射(pointmap)等变量,分别记录运动方向、物体远近和三维空间关系。
按照 CausalWM 的生成顺序,模型先观察当前场景,再预测光流和点映射等信息,最后生成未来的 RGB 画面。前一步的结果会重新进入上下文,成为下一步预测的条件。运动、几何和未来画面由此形成一条连续的推理轨迹。
为了维持这套推理顺序,CausalWM 还设置了阶段有序注意力掩码(stage-ordered attention mask)。例如,模型预测光流时无法提前读取几何信息和最终画面。进入下一阶段后,它才能利用已经生成的运动结果继续推演,从而减少后续信息提前泄露对训练的影响。
图 | 因果思维链分步预测未来(来源:Aether AI 官网)
这套顺序与物理变化本身较为接近。一个物体通常先产生运动或接触,随后改变几何和空间关系,最终呈现为新的观测画面。当模型按照相近次序组织中间状态时,便可以分步处理真实世界中连续发生的变化。
光流、深度和点映射过去也被用于视频预测、机器人建模和视觉理解,但更多充当辅助监督或独立预测目标。在 CausalWM 中,每个中间变量既是当前阶段的结果,也会参与下一阶段。光流继续指导几何预测,几何信息再参与未来画面生成。
沿着这套方法,世界模型的学习对象从最终画面延伸到未来形成的过程。像素渲染仍是模型给出的结果,运动、接触和几何变化则进入推理链条,帮助模型学习当前状态如何一步步抵达未来。这也构成 CausalWM 对“因果大模型”路线的一次具身化尝试。
值得注意的是,为了积累足够丰富的物理经验,Aether AI 为 CausalWM 构建了约 3 万小时的具身视频混合数据,覆盖机器人数据、第一视角视频、多视角操作和其他物理交互场景。训练过程包括像素级预训练、Causal CoT 中期训练和多目标强化学习三个阶段。
图 | 因果思维链的三阶段训练(来源:Aether AI 官网)
在像素级预训练阶段,模型先学习稳定生成未来,并逐步适应头部和腕部等多种视角。团队还使用因果去偏潜在动作模型(Causally Debiased Latent Action Model,CD-LAM),从视频前后变化中提取统一的潜在动作,让没有控制指令的视频也能进入训练。
随后,光流、深度和点映射被加入训练,模型开始沿着设定顺序生成中间状态与未来画面。多目标强化学习再根据物理一致性、视觉质量和任务完成度等反馈,比较不同候选结果并调整整条推理路径。技术重点也从单次生成,转向中间状态之间能否形成稳定联系。
从 Physical AI 走向更大的因果问题
前述技术变化还需要放进更长的演进尺度中观察,世界模型的角色也在发生变化。随着模型逐渐参与行动,行业关心的内容也随之改变。未来视频是否逼真仍然重要,但预测能否帮助机器人完成真实任务,正在成为新的评价尺度。
与这种角色变化相伴,具身智能的路线图也在调整。在过去,VLA 根据感知和指令生成动作,世界动作模型(World-Action Model)预测动作发生后环境会怎样变化,因果世界模型则继续追踪哪些变量推动了变化。模型由此既要提出行动,也要预演后果,再根据预测调整策略。
在这条路线中,Causal CoT 的训练还带来了一项值得关注的现象:模型不断接收光流、深度和点映射等变量,并利用这些信息生成未来。基于此,模型逐渐学会把新增的视觉特征作为上下文条件。这些变量既可以由模型预测,也可以从外部提供。
由此出现的一项意外收获是,原本用来解释未来如何发生的物理变量,也能反过来成为控制信号。
例如,模拟器可以给出机械臂的关节轨迹,再将其转换为画面中的运动提示。CausalWM 把提示编码为视觉 token 后,便可以生成与指定轨迹相符的未来视频,并接受外部条件修正推演方向。
控制接口之外,从相关性走向因果的价值也不只体现在数据效率上。更重要的目标,是让模型找到环境变化后依然成立的关系,适应没有见过、但仍遵循相似物理规律的新场景。
从这里再看团队提出的四代范式,它指向一项更具体的研究任务。模型需要在规模化学习中找出重要变量,理解变量怎样相互作用,并推演主动改变其中一个变量后的结果。CausalWM 先从运动与几何信息入手,把这一思路带进具身世界模型。
这也解释了团队为什么把科学发现视为更远的目标。机器人操作关注“换一种动作,物体会怎样变化”,生物医学研究可能追问“改变某个因素,细胞或疾病进程会怎样变化”。两类场景的机制不同,却都需要从观察走向干预,判断哪些改变真正影响结果。
对 Aether AI 而言,CausalWM 并不是一个孤立的具身世界模型项目,而是其持续推进因果世界模型(Causal World Models)路线的一部分。因此,机器人只是因果智能(Causal Intelligence)进入物理世界的首个应用和验证场景。未来,随着因果推理框架逐步成形,这套能力还可能延伸至生物医学与科学发现,帮助识别关键变量、发现变量之间的作用关系,并推演不同干预可能带来的结果。
目前,CausalWM 已在机器人世界模型的公开评测中交出一张成绩单,Aether AI 也由此提出一个更长远的判断。当世界模型开始参与行动,预测得像不像只是第一步。更重要的问题是,模型能否理解变化为何发生,并进一步推演:当行动或干预发生改变,未来将如何随之改变。
参考资料:
1.https://aetherlabsai.github.io/CausalWM/
2.https://www.triworldbench.com/#leaderboard
3.https://github.com/TriWorldBench/TriWorldBench
4.https://arxiv.org/abs/2607.09185 Aether AI,《Causally Debiased Latent Action Model for Embodied Action Conditioned World Models》
5.https://github.com/AetherLabsAI/CausalWM(CausalWM 代码)
6.https://huggingface.co/AetherLabs-AI/CausalWM(CausalWM 模型权重)
7.https://openreview.net/pdf?id=3pf4d0EEqm Aether AI,《CausalWM: Causal Chain-of-Thought Reasoning for Embodied World Model》
排版:胡莉花
注:封面/首图由 AI 辅助生成







