首篇自回归视频生成Memory综述来了,港科大、城大、复旦、CMU、NYU、NTU等联合出品

首篇自回归视频生成Memory综述来了,港科大、城大、复旦、CMU、NYU、NTU等联合出品
2026年10月08日 15:47 机器之心Pro

过去一年,视频生成正在快速走向 long-horizon generation、streaming generation 和 interactive world model。但随着生成越来越长,一个基础问题也越来越难绕开:模型到底该如何「记住」过去?角色离开画面后再次出现,还是不是同一个人?镜头绕一圈重新回到原来的场景,空间布局还能否保持?一个物体已经被移动,几十个 generation steps 之后,它会不会又回到原位?

与此同时,视频生成/世界模型中以记忆(Memory)为核心的工作也越来越多:历史 frame、VAE latent、KV cache、recurrent state、3D world state,甚至直接将历史信息写入模型参数。这些机制都叫 Memory,但它们究竟应该如何分类?又分别在解决什么问题?

来自香港科技大学、香港城市大学、复旦大学、CMU、NYU、NTU 等顶级机构的研究者,最近共同完成了 110 页综述:《The Past Frames the Future: Memory for Autoregressive Video Generation》,希望将分散在 long video generation、streaming generation、interactive world model 等不同方向中的相关研究,放进统一的 Memory 框架下重新理解。

  • 论文链接:https://arxiv.org/pdf/2609.28466

  • GitHub:https://github.com/HaroldChen19/Awesome-AR-Video-Memory

为什么长视频生成越来越需要 Memory?

自回归(Autoregressive,AR)视频生成会不断根据已有历史生成下一个 token、frame 或 video chunk。问题在于:历史越来越长,但模型能够直接访问的 context 始终有限。受到 context window、显存、KV-cache storage 和 latency 的限制,实际系统通常只能保留一个有限的 local context。随着 rollout 向前推进,早期的角色身份、场景布局、运动状态和交互结果都会逐渐离开当前窗口。因此,生成得长并不意味着记得久。

该综述将 Memory 定义为一种跨 AR steps 持续维护的历史状态:即使原始证据已经离开当前 local context,它仍然可以影响未来生成。换言之,Memory 并不简单等同于 Longer Context;关键在于历史信息如何被持续保留、管理和重新利用。

在此基础上,论文从五个问题重新组织整个领域:

Forms:Memory 以什么形式存在?

Functions:Memory 需要保留什么?

Operations:Memory 如何运转?

Learning:Memory 如何被学出来?

Evaluation:如何证明模型真的在使用 Memory?

Forms:Memory 到底存在哪里?

论文首先从 memory carrier 出发,将已有方法分成四类:Visual Memory、Implicit State Memory、Explicit State Memory、Adaptive Parametric Memory。

其中:

Visual Memory 直接保留过去的 frame、clip 或 VAE latent,优势是视觉信息保真度高,但存储和计算成本也较大。

Implicit State Memory 将历史保存在 KV cache、recurrent state、SSM state 或压缩后的 neural representation 中,更紧凑,也更接近模型内部计算,但可解释性较弱。

Explicit State Memory 则显式维护 entity、pose、geometry、3D map、event state 等 world-level information。它保存的不只是「过去看到了什么」,还可以表示「当前世界应该处于什么状态」。

Adaptive Parametric Memory 更进一步,将历史写入 fast weights、LoRA 或其他可在线更新的 parameter state,使过去的信息直接改变模型之后的 forward computation。

这四类 Memory 并不存在绝对优劣。实际系统也越来越倾向于混合多种 carrier,以同时兼顾视觉细节、效率、结构化表示和在线适应。

Functions:模型到底需要记住什么?

从「存在哪里」进一步向「为什么要存」,论文总结出五类核心功能:Identity Preservation、Spatial Preservation、Dynamic Preservation、Semantic Preservation、Causal Preservation。

简单来说:

Identity:角色离开画面后回来,仍然是同一个角色;

Spatial:相机离开再返回,场景布局与几何关系仍然成立;

Dynamic:实体即使暂时不可见,其运动和状态仍能继续演化;

Semantic:角色关系、目标、事件和 narrative commitment 不会被遗忘;

Causal:一次 action 真正改变世界之后,这个后果需要持续存在。

其中,Causal Preservation 对 interactive world model 尤其重要:如果用户已经打开了一扇门,那么当这次 action 本身早已离开 context 后,「门已经打开」依然应该成为当前 world state,而不是被模型重新生成成关闭状态。

Operations:Memory 不是一个「库」,而是一套生命周期

保存正确的信息还不够。一个 Memory system 还需要回答:写什么?读什么?什么时候更新?容量有限时删什么?取出来之后怎样真正影响生成?因此,论文将 Memory lifecycle 拆成五个操作:Writing、Reading、Updating、Management、Integration。

这一视角揭示了一个很重要的问题:Memory 被存下来,并不代表 Memory 真正有效。

关键信息可能根本没有被写入,也可能虽然被存储,但之后无法正确 retrieve;甚至已经 retrieve 出来了,却因为 integration 太弱,最终没有真正改变生成结果。

Learning:模型如何真正学会使用 Memory?

视频生成中的 Memory 有一个天然的 closed-loop 特性:模型当前生成的内容,会成为未来的 Memory。因此,一次 generation error 可能被写进 KV、latent、world state 或 parameter state,然后继续影响后续 rollout。

论文从 Memory Learning Objectives、Memory State Distribution、Memory-Aware Learning 三个方面整理已有方法。一个核心问题来自 training 和 inference 的 distribution gap:训练时模型往往使用 ground-truth history,而部署时面对的是自己一步步生成出来的 history。因此,从 history augmentation 到 self-rollout training,越来越多方法开始让模型直接在自身产生的 Memory states 上学习。

Evaluation:视频一致,不代表模型真的有 Memory

论文还特别强调:Long-term Consistency ≠ Memory。

一个角色在长视频中看起来始终一致,并不能证明模型真的使用了很久以前的信息。当前 prompt 可能已经重新描述了角色,模型也可能仅凭 prior 猜出一个合理结果。因此,真正的 memory-revealing evaluation 需要人为制造一个 information gap:正确的未来输出必须依赖过去的信息,而这段信息在当前 context 中已经不可见。

典型场景包括 entity reappearance、scene revisitation、out-of-view state evolution,以及 delayed action effects。

这也意味着,未来的 benchmark 不应该只问「视频看起来是否一致」,还要回答:历史有没有真正被保留?需要时能不能取出来?取出来后是否真的影响了生成?

下一代 Video Memory 会走向哪里?

综述最后总结了六个值得关注的方向:

Unified and Composable Memory:让 Visual、Implicit、Explicit 和 Parametric Memory 不再各自为战,而是共享 entity、time、coordinate、confidence 等接口。

Resource-Aware Memory:不是无限保留历史,而是学习哪些信息值得长期保存、压缩或重新激活。

Trustworthy Memory Updating:避免把 generation error 当成「事实」永久写入 Memory,并支持 confidence、revision、rollback。

Self-Rollout Learning:让模型真正学习部署阶段自己产生的 Memory distribution。

Interactive and Causal Memory:从「记住历史观测」进一步走向「记住 action 对世界造成的持续改变」。

Comparable Memory Evaluation:从单一 endpoint score,走向对 retention、state correctness、accessibility 和 utilization 的逐阶段诊断。

结语

随着 Video Generation 从短片段生成逐渐走向 open-ended video 和 interactive world model,一个问题正在变得越来越重要:过去发生的事情,怎样持续影响未来?

这篇综述最终强调,Memory 并不等于更长的 Context,也不等于存下更多 History。一个真正有效的 Memory,需要让重要的历史状态在长时间 rollout 中依然保持:准确(accurate)、可访问(accessible),并真正影响未来生成(causally influential)。这或许也意味着,Memory 正在从 long video generation 中的一个辅助模块,逐渐成为构建 persistent visual world 的基础能力之一。

新浪科技公众号
新浪科技公众号

“掌”握科技鲜闻 (微信搜索techsina或扫描左侧二维码关注)

创事记

科学探索

科学大家

苹果汇

众测

专题

官方微博

新浪科技 新浪数码 新浪手机 科学探索 苹果汇 新浪众测

公众号

新浪科技

新浪科技为你带来最新鲜的科技资讯

苹果汇

苹果汇为你带来最新鲜的苹果产品新闻

新浪众测

新酷产品第一时间免费试玩

新浪探索

提供最新的科学家新闻,精彩的震撼图片