
过去一年,视频生成正在快速走向 long-horizon generation、streaming generation 和 interactive world model。但随着生成越来越长,一个基础问题也越来越难绕开:模型到底该如何「记住」过去?角色离开画面后再次出现,还是不是同一个人?镜头绕一圈重新回到原来的场景,空间布局还能否保持?一个物体已经被移动,几十个 generation steps 之后,它会不会又回到原位?
与此同时,视频生成/世界模型中以记忆(Memory)为核心的工作也越来越多:历史 frame、VAE latent、KV cache、recurrent state、3D world state,甚至直接将历史信息写入模型参数。这些机制都叫 Memory,但它们究竟应该如何分类?又分别在解决什么问题?
来自香港科技大学、香港城市大学、复旦大学、CMU、NYU、NTU 等顶级机构的研究者,最近共同完成了 110 页综述:《The Past Frames the Future: Memory for Autoregressive Video Generation》,希望将分散在 long video generation、streaming generation、interactive world model 等不同方向中的相关研究,放进统一的 Memory 框架下重新理解。

论文链接:https://arxiv.org/pdf/2609.28466
GitHub:https://github.com/HaroldChen19/Awesome-AR-Video-Memory
为什么长视频生成越来越需要 Memory?
自回归(Autoregressive,AR)视频生成会不断根据已有历史生成下一个 token、frame 或 video chunk。问题在于:历史越来越长,但模型能够直接访问的 context 始终有限。受到 context window、显存、KV-cache storage 和 latency 的限制,实际系统通常只能保留一个有限的 local context。随着 rollout 向前推进,早期的角色身份、场景布局、运动状态和交互结果都会逐渐离开当前窗口。因此,生成得长并不意味着记得久。
该综述将 Memory 定义为一种跨 AR steps 持续维护的历史状态:即使原始证据已经离开当前 local context,它仍然可以影响未来生成。换言之,Memory 并不简单等同于 Longer Context;关键在于历史信息如何被持续保留、管理和重新利用。

在此基础上,论文从五个问题重新组织整个领域:
Forms:Memory 以什么形式存在?
Functions:Memory 需要保留什么?
Operations:Memory 如何运转?
Learning:Memory 如何被学出来?
Evaluation:如何证明模型真的在使用 Memory?

Forms:Memory 到底存在哪里?
论文首先从 memory carrier 出发,将已有方法分成四类:Visual Memory、Implicit State Memory、Explicit State Memory、Adaptive Parametric Memory。

其中:
Visual Memory 直接保留过去的 frame、clip 或 VAE latent,优势是视觉信息保真度高,但存储和计算成本也较大。
Implicit State Memory 将历史保存在 KV cache、recurrent state、SSM state 或压缩后的 neural representation 中,更紧凑,也更接近模型内部计算,但可解释性较弱。
Explicit State Memory 则显式维护 entity、pose、geometry、3D map、event state 等 world-level information。它保存的不只是「过去看到了什么」,还可以表示「当前世界应该处于什么状态」。
Adaptive Parametric Memory 更进一步,将历史写入 fast weights、LoRA 或其他可在线更新的 parameter state,使过去的信息直接改变模型之后的 forward computation。
这四类 Memory 并不存在绝对优劣。实际系统也越来越倾向于混合多种 carrier,以同时兼顾视觉细节、效率、结构化表示和在线适应。
Functions:模型到底需要记住什么?
从「存在哪里」进一步向「为什么要存」,论文总结出五类核心功能:Identity Preservation、Spatial Preservation、Dynamic Preservation、Semantic Preservation、Causal Preservation。

简单来说:
Identity:角色离开画面后回来,仍然是同一个角色;
Spatial:相机离开再返回,场景布局与几何关系仍然成立;
Dynamic:实体即使暂时不可见,其运动和状态仍能继续演化;
Semantic:角色关系、目标、事件和 narrative commitment 不会被遗忘;
Causal:一次 action 真正改变世界之后,这个后果需要持续存在。
其中,Causal Preservation 对 interactive world model 尤其重要:如果用户已经打开了一扇门,那么当这次 action 本身早已离开 context 后,「门已经打开」依然应该成为当前 world state,而不是被模型重新生成成关闭状态。

Operations:Memory 不是一个「库」,而是一套生命周期
保存正确的信息还不够。一个 Memory system 还需要回答:写什么?读什么?什么时候更新?容量有限时删什么?取出来之后怎样真正影响生成?因此,论文将 Memory lifecycle 拆成五个操作:Writing、Reading、Updating、Management、Integration。

这一视角揭示了一个很重要的问题:Memory 被存下来,并不代表 Memory 真正有效。
关键信息可能根本没有被写入,也可能虽然被存储,但之后无法正确 retrieve;甚至已经 retrieve 出来了,却因为 integration 太弱,最终没有真正改变生成结果。
Learning:模型如何真正学会使用 Memory?
视频生成中的 Memory 有一个天然的 closed-loop 特性:模型当前生成的内容,会成为未来的 Memory。因此,一次 generation error 可能被写进 KV、latent、world state 或 parameter state,然后继续影响后续 rollout。
论文从 Memory Learning Objectives、Memory State Distribution、Memory-Aware Learning 三个方面整理已有方法。一个核心问题来自 training 和 inference 的 distribution gap:训练时模型往往使用 ground-truth history,而部署时面对的是自己一步步生成出来的 history。因此,从 history augmentation 到 self-rollout training,越来越多方法开始让模型直接在自身产生的 Memory states 上学习。


Evaluation:视频一致,不代表模型真的有 Memory
论文还特别强调:Long-term Consistency ≠ Memory。
一个角色在长视频中看起来始终一致,并不能证明模型真的使用了很久以前的信息。当前 prompt 可能已经重新描述了角色,模型也可能仅凭 prior 猜出一个合理结果。因此,真正的 memory-revealing evaluation 需要人为制造一个 information gap:正确的未来输出必须依赖过去的信息,而这段信息在当前 context 中已经不可见。
典型场景包括 entity reappearance、scene revisitation、out-of-view state evolution,以及 delayed action effects。

这也意味着,未来的 benchmark 不应该只问「视频看起来是否一致」,还要回答:历史有没有真正被保留?需要时能不能取出来?取出来后是否真的影响了生成?
下一代 Video Memory 会走向哪里?
综述最后总结了六个值得关注的方向:
Unified and Composable Memory:让 Visual、Implicit、Explicit 和 Parametric Memory 不再各自为战,而是共享 entity、time、coordinate、confidence 等接口。
Resource-Aware Memory:不是无限保留历史,而是学习哪些信息值得长期保存、压缩或重新激活。
Trustworthy Memory Updating:避免把 generation error 当成「事实」永久写入 Memory,并支持 confidence、revision、rollback。
Self-Rollout Learning:让模型真正学习部署阶段自己产生的 Memory distribution。
Interactive and Causal Memory:从「记住历史观测」进一步走向「记住 action 对世界造成的持续改变」。
Comparable Memory Evaluation:从单一 endpoint score,走向对 retention、state correctness、accessibility 和 utilization 的逐阶段诊断。

结语
随着 Video Generation 从短片段生成逐渐走向 open-ended video 和 interactive world model,一个问题正在变得越来越重要:过去发生的事情,怎样持续影响未来?
这篇综述最终强调,Memory 并不等于更长的 Context,也不等于存下更多 History。一个真正有效的 Memory,需要让重要的历史状态在长时间 rollout 中依然保持:准确(accurate)、可访问(accessible),并真正影响未来生成(causally influential)。这或许也意味着,Memory 正在从 long video generation 中的一个辅助模块,逐渐成为构建 persistent visual world 的基础能力之一。







