![]()
你有没有想过,一个能生成好莱坞级画面的AI,可能连"这个杯子五分钟前在桌上"这种小学生都懂的常识都记不住?
这不是段子,这是2024年AI视频生成领域一个真实存在、却长期被忽略的大问题。
想象这样一个场景:视频里,一个人从口袋里掏出手机拍照,镜头晃了一下切到别处,几秒钟后再切回来,手机变成了另一个型号,甚至颜色都换了。这种事情,在当下最先进的自回归视频扩散模型上,天天都在发生。
**这篇来自斯坦福、MIT、北大、伯克利和字节跳动联合团队的论文,把这个问题起了个名字,叫"长期记忆缺失",并且给出了一套叫Ring Forcing(环形强制)的解决方案。**
先搞清楚问题出在哪
要理解这个问题为什么这么棘手,得先明白视频生成模型是怎么"想"的。
自回归视频扩散模型
:一种逐段生成视频的AI技术。它不是一次性把整个视频画出来,而是像写连续剧一样,看着前面已经生成的画面,往后续写下一段。这种方式能让视频无限延长,但代价是,模型必须依靠"记忆"前面发生的内容来保证连贯。
问题就出在这个"记忆"上。论文作者做了一个直击痛点的实验:一个人举着相机拍照,然后镜头短暂移开1秒钟,再切回来,之前最强的模型(作者称为SOTA,也就是State-of-the-Art,当前最先进技术)生成的画面里,这个人的脸完全变了。仅仅1秒钟。
这不是模型"看不到"过去的信息,因为1秒钟的上下文完全在它的处理范围内。真正的原因更微妙:模型压根没学会怎么去"用"这些信息。
论文把这归结为一个训练数据的系统性偏差。你去看现在网上收集的视频训练数据,绝大多数都是"线性叙事",摄像机跟着一个东西一路拍下去,很少有什么东西消失了又重新出现的情况。模型在这种数据上泡的时间长了,就学会了一种"近视眼"式的生成逻辑,只盯着眼前一两帧画面来推断下一帧,对"三十秒前发生了什么"这种问题完全没有兴趣去回答,因为在训练时从来没被逼着回答过。
这就好比你从小到大做的数学题全都是"1+1=2"这种送分题,你当然可以做得又快又准,但真到考试出现一道需要综合前面三道题条件的应用题时,你根本没有解题的肌肉记忆,哪怕卷子上把前面三道题的条件都印在你眼前,你也想不起来要回头看。不是看不见,是压根没形成"回头看"这个动作的习惯。如果一直不改变训练方式,无论给模型看多长的历史画面,它都只会礼貌地忽略掉大部分内容。
这个问题被论文拆解成两个维度:物体恒常性(object permanence,指精确复现物体重新出现时外观的能力)和记忆容量(能处理多长历史、能从多远的过去提取有效信息)。
作者特别强调了一点,这两者缺一不可。只有物体恒常性但记忆容量太小,等于你记性很好但脑子只能装五分钟内的事;只有超长的记忆容量但没有恒常性,等于你脑子里塞满了信息但完全不会调取,两种情况都无法支撑"分钟级"的连贯视频生成。
如何逼模型学会"回忆"
既然问题出在训练数据的偏差上,解决思路自然也要从训练数据本身下手。
Ring Forcing的核心创意,是把一段视频和它的倒放版本首尾相接,组成一个闭环。
具体是怎么操作的?假设你有一段原始视频V,从第一帧一直放到最后一帧。现在把这段视频倒过来放一遍,得到反向视频V_rev,然后把V和V_rev接在一起,变成一个环状序列V_ring。因为倒放视频的第一帧就是原视频的最后一帧,所以这个环在视觉上是完全连续的,看起来就像一条首尾相连的丝带。
这时候关键的一步来了:从这个环里挑出一段作为"目标片段"(也就是模型需要生成的部分),你会发现,这段目标片段的倒放版本,会作为"未来"重新出现在这个环的另一处,也就是被安排进了模型能看到的历史信息里。
论文管这个叫"未来变成了历史"。听起来有点玄乎,其实说白了就是:我把答案偷偷藏进了试卷前面的材料里,逼你必须往前翻资料才能做对题目。
这样一来,长程检索这件事,就从一个"可做可不做"的选修课,变成了一个"不做就交白卷"的必修课。模型要想把损失函数降下去,唯一的办法就是学会去翻历史,把那段藏起来的"隐藏答案"找出来。
这就像老师改变了考试出题方式。以前的考卷,每道题都是独立的,你只要看眼前这道题就能作答,久而久之你养成了"只看当前题目"的习惯。现在老师故意把某道题的答案,提前写在了试卷第一页看似无关的一段材料里,如果你不回头翻材料,这道题你根本不可能做对。这种"逼迫性"的考核方式,才能真正训练出"回头翻资料"这个能力,而不是靠自觉。如果没有这个设计,你永远只能靠模型自己"顿悟"去学会检索,而现实是,绝大多数模型根本不会自己顿悟。
但这个设计有一个明显的漏洞需要堵上。因为反向视频紧跟在目标片段后面拼接,环上"藏答案的那部分"的开头一帧,其实和目标片段的最后一帧长得几乎一模一样(毕竟只是时间上紧挨着的两帧)。
如果不处理这个漏洞,模型完全可以偷懒:不用去翻远处那段"隐藏答案",只需要瞄一眼历史信息最前面那一帧,抄一下它的样子就行了,压根不需要理解和检索更远的信息。
为了堵住这个偷懒的口子,论文引入了随机头部裁剪(Random Head Crop):随机切掉历史信息开头的一部分内容,但保留住藏在后面的那段"隐藏答案",这样模型就没法靠抄近道蒙混过关了。
光是逼着模型死记硬背历史信息还不够,因为现实中的视频生成不能永远是"背答案"模式,很多时候摄像机往前走,看到的是全新的、没在历史里出现过的场景,这时候模型需要有创造性地续写下去,而不是死板地强行往回套。
为了平衡"严格遵循历史"和"自由创作"这两种能力,论文加入了环形上下文丢弃(Ring Context Drop)机制:训练时以一定概率(默认40%)随机把整个"藏答案"的历史信息完全丢掉,只留下正常的原始历史,这样模型有时候被逼着必须精确回忆,有时候又被放开手脚自由发挥,两种技能都练到。
固定长度里塞进一分钟的记忆
解决了"愿不愿意回忆"的问题,接下来要面对一个更硬核的工程难题:一分钟的视频信息量太大了,直接塞给模型处理,计算量会爆炸。
这是因为AI处理视频用的注意力机制(attention),它的计算复杂度是随着序列长度呈平方级增长的。历史越长,计算代价涨得越猛,这几乎是一个物理定律级别的限制。
于是行业里出现了一个两难困境:想让模型看得更远,就得增加处理的信息量,算力扛不住;想让算力可控,就得压缩历史信息,结果模型能看到的范围又变短了。这个跷跷板效应,长期卡住了长视频生成技术的脖子。
Ring Forcing给出的方案,是利用扩散模型本身的一个特性:它在生成过程的高噪声阶段主要决定画面的整体结构和大致动作,而在低噪声阶段则专注雕琢局部的纹理和细节。
基于这个观察,论文设计了一个时间步组合(Timestep Composition)策略:高噪声时段用一路信号,低噪声时段用另一路信号,让两路信号在不同阶段各司其职。
具体来说,高噪声阶段(也就是模型还在琢磨大方向的时候),使用一个时间上采样密度高、但空间和局部细节压缩得比较狠的"全局流",保证时间维度的连贯性;低噪声阶段(模型在精修细节的时候),换成一个空间细节保留得多、但时间上采样稀疏的"细节流",并且用一种循环位移(cyclic shift)的技巧,让每次采样都能覆盖到历史中不同的时间点,避免某些细节被压缩掉后再也捞不回来。
这个设计其实很像人类看老照片相册的方式。假设你要在一分钟内回忆过去一整年发生的事,你不可能把每一天的所有细节都在脑子里过一遍,那信息量太大了。更现实的做法是,先快速翻一遍所有照片,抓住整体的时间线和大事件(这是全局流在做的事),然后针对其中几张你格外在意的照片,停下来仔细端详细节,比如照片里那件衣服的花纹(这是细节流在做的事)。如果你只做前一半,你会记得大概发生了什么但记不清任何具体样子;如果你只做后一半,你会对个别细节记忆深刻但完全理不清事件顺序。论文的实验数据印证了这一点:只用全局流重建的画面结构SSIM分数是0.745,只用细节流是0.679,而两路结合起来能达到更高,验证了这种"分工合作"确实比单打独斗更有效。
在这套压缩方案下,论文实测把等效的历史长度从原本4.4秒硬生生拉长到了140.8秒,而且计算开销和显存占用跟原始模型的5.4秒生成设置几乎一模一样,这意味着这套方法可以无缝部署到任何能跑得动原版Wan模型的硬件上,不需要额外的算力投入。
给压缩后的信息找准"门牌号"
压缩历史信息之后,还有一个容易被忽略但很关键的细节:模型怎么知道这些被压缩过的信息,原本是在时间轴和空间上的哪个位置?
这里要提一下RoPE
:全称Rotary Positional Embedding,旋转位置编码,是一种让AI模型理解序列中每个元素相对位置关系的技术,被广泛用在Transformer架构里。
原始模型在预训练时,学到的是一套关于"相对时空结构"的先验知识,比如它知道相邻的两帧之间大概应该差多少,某个空间位置的像素点跟另一个位置有什么样的相对关系。这些先验知识是模型在没接触过压缩这回事的情况下,通过海量数据积累出来的宝贵经验。
如果直接按压缩后的离散索引(比如"这是第3个压缩块")来编码位置信息,模型之前学到的那套关于原始物理时空的直觉就完全用不上了,等于逼着模型在一个陌生的坐标系里重新摸索,白白浪费了预训练积累的经验。
论文的解决办法是稀疏RoPE(Sparse RoPE):不用压缩后的离散序号,而是把每个压缩后的token反推回它在原始连续时空坐标系里对应的物理位置,让模型觉得自己看到的还是熟悉的那套坐标系,只是信息被稀疏采样了而已。
这就好比你请了一位老向导带你重新走一条路,但这条路因为施工被临时改道,只留下几个关键路口能通行。如果你告诉向导"从入口数第三个路口拐弯",他会一脸茫然,因为他脑子里存的是这条路原本的完整地图和真实的地标位置。但如果你告诉他"在原来那个邮局门口拐弯",哪怕路已经改道了,他立刻就能凭着记忆里的老地图找到方向。这就是把压缩后的坐标映射回原始物理坐标的意义所在,让模型能继续调用它在预训练阶段积累的那套关于真实世界结构的直觉,而不是逼它在一个全新的、陌生的抽象坐标系里从零学起。
实验数据证实了这个设计的价值:使用标准索引式RoPE训练出来的模型,重建质量的PSNR只有19.05,换成稀疏RoPE之后直接跳到24.22,SSIM从0.58提升到0.71,这不是一个小的量级差距。
数字说话:到底强在哪
论文构建了一个专门的测试基准,叫A-D-R基准,全称是"出现-消失-重现"(Appear-Disappear-Reappear)。测试逻辑很直接:让一个物体先出现5秒,然后消失一段时间(间隔从0秒一路测到60秒),最后重新出现5秒,看看模型有没有把物体的身份认对。
结果相当直白。在0秒间隔(也就是控制组,全程没有消失)的情况下,各家模型表现都还不错,Ring Forcing的纹理一致性分数是0.742,跟表现最好的LongCat(0.737)差不多。但只要间隔拉到1秒,差距就彻底拉开了:LongLive掉到0.181,LongCat掉到0.236,framePack掉到0.252,而Ring Forcing依然保持在0.723的高位。
这意味着什么?意味着仅仅一秒钟的消失,就足以让当时最先进的三个模型集体"翻脸不认人",把重新出现的物体错认成完全不同的东西,而Ring Forcing几乎没有受到影响。
更值得说道的是,其他基线模型在5秒间隔之后的数据就直接消失了,因为论文说明这是"appear"这段片段已经完全超出了它们的最大上下文窗口",它们连处理这个长度的历史都做不到,谈何检索。而Ring Forcing一路测到了60秒间隔,纹理一致性依然维持在0.396,几何一致性0.582,语义一致性0.793。
Gap(消失时长)| 模型 | 纹理一致性 | 几何一致性 | 语义一致性
0秒 | LongLive | 0.578 | 0.896 | 0.886
0秒 | LongCat | 0.737 | 0.950 | **0.925**
0秒 | framePack | 0.605 | 0.949 | 0.913
0秒 | **Ring Forcing** | **0.742** | **0.997** | 0.918
1秒 | LongLive | 0.181 | 0.297 | 0.707
1秒 | LongCat | 0.236 | 0.368 | 0.712
1秒 | framePack | 0.252 | 0.287 | 0.692
1秒 | **Ring Forcing** | **0.723** | **0.839** | **0.823**
5秒 | LongLive | 0.290 | 0.303 | 0.730
5秒 | LongCat | 0.203 | 0.328 | 0.722
5秒 | framePack | 0.250 | 0.264 | 0.701
5秒 | **Ring Forcing** | **0.515** | **0.761** | **0.831**
60秒 | **Ring Forcing** | 0.396 | 0.582 | 0.793
论文还观察到一个特别有意思的副作用:那些依赖"死记住第一帧"这种笨办法来维持一致性的模型(比如LongLive),付出的代价是画面动态性大幅下降,因为它们把注意力全焊死在开头那一帧上,导致后续生成的内容变得呆板、重复。而Ring Forcing因为学会了真正意义上的"检索"而不是"死盯",反而在保持一致性的同时,动态性得分(Dynamics)从LongLive的1.615、LongCat的1.493一路涨到2.617,画面动作更加丰富自然。
这打破了一个业内长期以来默认的假设:一致性和多样性是天然对立的,要一致就得牺牲灵活。Ring Forcing的实验数据说明,这两者其实是可以兼得的,只要方法对了。
在更贴近日常使用场景的一分钟通用视频生成测试里,Ring Forcing在美学质量(5.822分)、自然度(3.922分)、指令遵循度(25.471分)上都拿到了对比模型里的最高分,人类打分的整体质量评价也拿到了4.22分,是所有对比模型里最高的。
模型 | 美学质量 | 动态性 | 自然度 | 一致性(人评) | 整体质量(人评)
LongLive | 5.622 | 1.056 | 3.031 | 4.12 | 2.25
LongCat | 5.808 | 2.196 | 3.875 | 3.59 | 4.19
framePack | 5.728 | 1.790 | 3.656 | 3.71 | 4.04
**Ring Forcing** | **5.822** | **2.261** | **3.922** | **4.35** | **4.22**
这条技术路线接下来要走向哪里
Ring Forcing自己也很坦诚地列出了没解决的问题。
因为整个生成过程本质上是自回归的,也就是一步一步续写下去的,微小的误差会随着时间推移不断累积,哪怕物体身份问题被大幅压制了,极长时间跨度下的细微失真依然可能出现。
论文用环形数据构造这种巧妙但终究是"代理任务"的方式来逼模型学检索,面对真实世界里多个长得很像的物体互相交叉遮挡这种极端复杂场景,现有方法的精细检索能力可能还不够用。
目前采用的固定压缩比率虽然保证了显存开销和原模型完全一致,但这种"一刀切"式的压缩,对极小物体或者快速一闪而过的动作,多少会丢失一些高频细节。论文认为未来一个有前途的方向,是让压缩比率能根据画面内容的复杂程度动态调整,重要的主体保留高分辨率,静态背景可以压缩得更狠一些。
写在后面
读完这篇论文,最让我感到意外的,其实不是Ring Forcing这个方法本身有多精妙,而是它揭示的那个根本矛盾:模型能"看到"历史信息,和模型"愿意用"历史信息,是两件完全不同的事。
这个区分乍一听有点反常识。我们总觉得,只要把足够多的上下文塞给一个足够大的模型,它自然就会学会怎么用。但这篇论文用一个1秒钟消失就能让SOTA模型集体崩溃的实验,狠狠打了这个假设的脸。真正决定模型行为的,从来不是它"能看到多少",而是训练过程有没有真正逼它去用这些信息。
这让我想起一个更普遍的问题:很多AI系统的能力短板,表面看是"容量不够",实际上根本原因是"训练时从没被要求过"。这个逻辑放到别的领域一样成立,一个学生做题永远只做基础题,你不能指望考试出现综合题时他突然开窍。
另一个值得单独拎出来说的细节是,论文里那个"未来变成历史"的构造方式,本质上是一种非常聪明的自监督标签生成技巧,不需要额外的人工标注,只靠对已有视频做一次倒放和拼接,就凭空造出了一个"必须检索才能做对"的训练信号。这种"用数据结构本身逼出监督信号"的思路,在数据标注成本越来越高的今天,值得被更多技术领域借鉴。
论文提到的下一步方向,内容自适应的动态压缩,听起来简单,做起来其实涉及一个很难的判断问题:怎么让模型自己知道"这个物体值得多花点算力去记住,那片背景可以随便压缩"?这本质上是要模型对信息的重要性做出实时判断,而这件事,恰恰是人类视觉认知系统天天都在无意识地做的事情。
如果视频生成模型有一天真的学会了像人一样,凭直觉判断哪些细节值得牢牢记住,哪些可以模糊带过,那时候我们讨论的可能就不只是"物体会不会变脸"这么简单的问题了。
Q&A
Q1:Ring Forcing是什么?
A:Ring Forcing是斯坦福、MIT、北大等团队联合提出的自回归视频扩散框架,通过环形结构训练和压缩技术,让AI生成的长视频具备精准的长期记忆,物体消失重现后不会变身份。
Q2:Ring Forcing如何解决物体消失后变样的问题?
A:它把视频和倒放版本首尾拼接成环,把目标片段的答案偷偷藏进历史信息里,逼模型必须学会检索远处的历史内容才能生成正确画面,而不是只看眼前一两帧。
Q3:Ring Forcing需要额外的算力和显存吗?
A:不需要。通过压缩和时间步组合策略,Ring Forcing能把140.8秒的历史信息压缩到和原模型5.4秒生成设置相同的计算开销,可以直接部署在支持原版Wan模型的硬件上。




京公网安备 11011402013531号