这项由香港科技大学与武汉大学、腾讯视频AI技术中心联合完成的研究,以预印本形式发布于2026年8月,论文编号为arXiv:2608.04964。感兴趣的读者可通过该编号在arXiv平台检索完整论文。
你有没有玩过那种开放世界的3D游戏——角色向前走了十步,然后你让他转身走回来,结果回到的地方和出发点完全对不上号?这并不是游戏开发者的失误,而是一个深藏在人工智能视频生成技术底层的顽固问题。研究团队把它称为"状态返回失效",而这正是他们这项工作要正面解决的核心难题。
研究团队提出了一个名为WorldCycle的框架,以及配套的评测基准CycleBench。这两样东西合在一起,构成了一套完整的"诊断加治疗"方案,专门针对交互式视频世界模型在长时间运行后逐渐"迷路"的问题。
一、视频世界模型究竟是什么,它为何会"迷路"
在正式进入研究细节之前,有必要先搞清楚"交互式视频世界模型"到底是一种什么东西。把它理解成一个极其精密的"动态场景播放器"会比较直观:你给它一张起始画面,然后告诉它"摄像机向前移动"、"向左转"、"向右转"……它就会一帧接一帧地生成对应的画面,就好像你真的站在那个场景里用眼睛环顾四周一样。这类模型正在被广泛应用于游戏模拟、机器人训练、自动驾驶场景预测等前沿领域。
这类模型的工作方式有一个关键特点:它是"接力生成"的。也就是说,它先生成第1帧,然后把第1帧当作参考,再生成第2帧,再把第2帧当参考生成第3帧……以此类推。这种方式在技术上叫做"自回归生成",就像接力赛跑,每一棒都依赖上一棒交来的接力棒。
问题就出在这里。每一步生成都不是完美无误的,总会带来微小的偏差——摄像机位置稍微歪了一点点,场景边缘的颜色轻微变了一点点。单独看每一步,这些偏差几乎察觉不到。但随着生成步数增加,这些微小偏差会不断叠加、不断放大,最终积累成肉眼可见的巨大误差。打个比方,这就像你用尺子在纸上画一条很长的直线,每次接续时笔尖稍微偏了0.1毫米,画到最后,线条早就歪得离谱了。
研究团队把这个现象分解为两种具体的失效模式。第一种叫"空间闭合失效":当你让摄像机先向前走十步、再向后退十步时,理论上应该回到原点,但实际生成的画面和出发时的画面对不上,场景里的树木、建筑物都错了位。第二种叫"时间一致性失效":同样的动作指令,在生成序列的第20帧执行和在第200帧执行,产生的位移量居然不一样——同一个"向前走"的指令,走的距离忽远忽近,模型对于自己在哪里、走了多远完全没有稳定的认知。
这两种失效都只有在生成足够长的序列之后才会暴露出来。如果只看短短几帧,一切看起来都挺正常,这就是为什么现有的评测方法一直没能捕捉到这个问题——因为大家习惯了只评估短片段的质量。
二、症结在哪里:没有"标准答案"可以对照
既然问题已经被识别出来了,为什么不直接用强化学习来修正它呢?强化学习是一种通过"给对的行为打高分、给错的行为打低分"来训练模型的方法,近年来在语言模型领域取得了巨大成功。
答案是:没有标准答案可以对照。强化学习要起作用,必须有一个能打分的"评判者"。对于语言模型,你可以让人类阅读生成的文字并打分;对于图像模型,你可以用人类偏好数据来判断哪张图更好看。但对于视频世界模型的长程轨迹,问题就卡住了——如果摄像机按照一系列复杂的指令移动,最终应该到达哪里?没人知道,因为真实的"正确未来状态"根本不存在于训练数据里,你没办法凭空得到那个参考画面去做比对。
研究团队把这个困境叫做"验证瓶颈"。现有的后训练方法,要么只评估单个短片段的画面质量,要么评估短片段里摄像机移动的方向是否大致符合指令,但都无法对整段长轨迹的累积误差进行评判。最新的对照工作WorldCompass尝试为每个片段打一个动作跟随得分,但这依然是逐段打分,无法捕捉到跨越数百帧的整体漂移。
验证瓶颈的存在,使得"用强化学习改善长程一致性"这件事几乎成了无解之题:你想奖励好的行为,但你不知道什么是好的——因为没有长程参考状态。
三、核心洞见:让摄像机"原路返回"就是天然的标准答案
研究团队的突破口来自一个物理直觉:对于可逆的动作,物理规律本身就告诉了我们正确答案是什么。
具体来说,如果摄像机先向前走十步,然后向后退十步,那么根据物理学,最终一定应该回到原点。这个"必须回到原点"的结论不需要任何外部数据来证明,它是由动作的代数结构决定的——向前和向后互为逆操作,叠加之后等于什么都没发生。同理,先向右转再向左转、先升高再降低,理论上的净效果都是零位移。
这个洞察之所以关键,在于它同时解决了验证瓶颈。当你构造一个"来回闭合路径"时,你立刻就知道正确答案是什么(回到起点),不需要任何人工标注,不需要额外的真实视频数据,完全由动作序列本身的结构决定。这就像给导航软件做测试——你不需要知道目标城市长什么样,只需要让它从A城导航到B城再导航回A城,如果最后回来的地方和出发地一模一样,就证明导航是准确的。
这个"闭合回路即标准答案"的思路,是WorldCycle整个框架的基础。
四、WorldCycle怎么运作:密集打分而非只看终点
有了"闭合回路"这个核心思路,研究团队还面临两个工程挑战需要克服。
第一个挑战是"奖励太稀疏"的问题。如果只在闭合路径的终点判断有没有回到起点,那么整个几百帧的轨迹只收到一个打分信号。这就好比给学生布置了一篇500字作文,但只看最后一个标点符号来打分——前面499字写得好不好,完全无从判断,模型也不知道应该在哪个步骤上做出修正。
研究团队的解决方案是把整段"去而复返"的路径拆成密集的对称点对。具体做法是:构造一个路径,先走m步到达中间点,然后走m步原路返回。那么,正向走到第i步时到达的位置,和反向走到第2m-i步时到达的位置,理论上是同一个地方。于是你可以把这两个时刻的生成画面拿来比较,看它们有多相似。这样一来,整个路径上每一对对称帧都成了一个独立的评分点,密集的监督信号取代了稀疏的终点信号。这个评分机制被命名为"空间闭合奖励"。
打分的具体方式是通过一种叫做"密集点追踪"的技术。系统会在两帧画面之间找出大量对应点(比如某块砖头的角、某棵树的树梢),然后计算这些点的平均位移距离。位移越小,说明两帧画面越接近同一个场景状态,得分越高。这个距离计算公式会除以画面的宽高之和做归一化处理,让不同分辨率的画面可以放在同一尺度下比较。
第二个挑战是"时间漂移"问题——同样的动作在不同时刻产生不同效果。为了对付这个问题,研究团队引入了第二种奖励机制,叫做"时间一致性奖励"。做法是把同一个闭合循环重复执行K次,比如重复执行5次。如果模型的状态管理是正确的,那么第1次循环到第i帧的画面,和第2次循环到第i帧的画面,以及第3次循环的同位置画面,应该是一样的——因为每次都是从同一个返回点出发、执行同样的动作序列。系统把第1次循环作为参考基准,把后续所有循环与第1次的对应帧进行比较,惩罚那些随着循环次数增加而漂移的情况。
这两种奖励合在一起,就像是对模型同时进行"空间正确性"和"时间稳定性"的双重考核。
五、训练策略:先打好基础再上难度
把两种奖励同时扔给模型并不是最优策略。研究团队发现,时间一致性奖励要起作用,必须建立在每次单独的闭合循环已经基本能够正确闭合的前提上。如果连单次循环都闭合不了,那么比较第1次和第2次循环的对应帧就毫无意义,只会给模型发出混乱的噪声信号。
因此,训练过程分为两个阶段。前300个训练步骤是"空间热身阶段",只激活空间闭合奖励,让模型先学会在单次来回路径中保持几何一致性。热身结束后,时间一致性奖励才被激活,两种奖励从此并行生效。这种"先热身再叠加"的策略被研究团队命名为"热身叠加调度",并在后续的消融实验中被验证为最优的训练顺序——无论是"只训练空间"、"只训练时间",还是"从一开始就同时训练两者",效果都不如这种分阶段叠加的方式。
除了训练顺序,研究团队还特别设计了"多尺度循环采样"策略,来防止模型走捷径。如果每次训练都用固定长度的循环,模型可能只是学会了"在第X帧到来时应该开始反向"这个位置记忆,而不是真正理解动作的逆向关系。为了防止这种投机行为,训练时每步随机从多种长度的循环结构中选取一种,让模型无法依赖固定的时间位置,只能真正学习动作与状态变化之间的关系。
最终的训练奖励是四项信号的加权组合:空间闭合奖励、时间一致性奖励、动作跟随得分(确保摄像机确实按照指令方向移动)、以及视觉质量得分(确保画面好看、不出现噪点或模糊)。这四项信号各司其职,防止模型用某种"视觉上崩溃但闭合数字好看"的方式作弊。
在优化算法的选取上,研究团队选择了一种叫做DiffusionNFT的方式,而非通常强化学习中使用的策略梯度方法。原因在于策略梯度方法需要追踪整个生成过程中每一个噪声去除步骤的对数概率,内存消耗极大,而且在长序列优化时容易导致生成结果多样性下降。DiffusionNFT的做法更为直接:把奖励高的生成结果当作正样本、奖励低的当作负样本,分别对当前模型的预测方向做有权重的回归更新。这种方式与自回归的逐块生成结构天然契合,内存效率也高得多。
六、复合动作:出域泛化的意外收获
研究团队在实验中发现了一个格外值得关注的现象。如果把"向前移动"和"向左转"这两个动作同时执行——也就是一边走一边转身——基础模型WorldPlay的准确率会从简单动作的63.5%骤降至13.6%,几乎下降了五倍。
原因不难理解:训练数据里很少有人专门录制"一边走一边转"的视频,所以模型对这类复合动作几乎没有见过真实样例,属于"出域"(out-of-distribution)情况。
WorldCycle对这个问题的处理方式格外优雅。复合动作"一边前进一边左转"同样有它的逆操作"一边后退一边右转",把这两段动作拼在一起,同样构成一个闭合循环,同样可以用空间闭合奖励和时间一致性奖励来评分。也就是说,研究团队根本不需要收集复合动作的真实视频来做监督——闭合循环本身就是监督信号,它的存在与否与训练数据无关。
这使得WorldCycle可以直接对复合动作轨迹进行优化训练,即便这些轨迹从未在预训练数据中出现过。从理论上看,优化闭合循环的过程实际上是在减少每一步动作执行时的"残差误差",当每个单步的误差都降低时,模型对于复合动作的组合关系的理解也随之改善,因为动作组合的代数结构(先做A再做B等于做A+B)得到了更准确的学习。
七、CycleBench:第一个专门诊断"迷路"问题的评测基准
与WorldCycle框架同步发布的是一个名为CycleBench的评测基准,这是该领域首个专门测量视频世界模型"状态返回能力"的系统性测试集。
这个测试集包含47条动作轨迹,从380张初始帧出发进行评测,覆盖四种任务类型和四种场景设置。初始帧的来源有两部分:236张来自一个名为4KLSDB的真实高清图像数据集,另外144张是用GPT图像生成工具合成的风格各异的场景图,两者混合确保了测试场景的多样性。
四种任务类型分别从不同角度考察误差的积累方式。第一种"可逆循环"任务,让摄像机先正向走一段再原路返回,重点检查路径中每个对称帧对之间的偏差,找出误差最先在哪里冒头。第二种"闭合循环"任务,让摄像机走一个矩形路径——向前、向右、向后、向左,走完整圈回到原点。这条路径不是"原路返回",没有对称性可以利用,但理论净效果仍然是回到原点,专门测试模型能否在没有对称走法的情况下维持闭合性。第三种"重复循环"任务,把同一个闭合循环重复执行多次,追踪每次结束时的终点误差是否越来越大,以及每次循环中间过程的帧是否随时间漂移。第四种"级联循环"任务,把两种结构不同的闭合循环前后串联执行,检查第一个循环产生的残差误差是否会污染第二个循环的执行。
四种场景设置则沿两个维度展开。第一个维度是生成长度,分为125帧的短期、253帧的中期和381帧的长期三档,通过对比三档之间的性能差异来度量误差随时间的放大程度。第二个维度是动作复杂性,增加一个125帧的"复合动作"测试场景,使用同时组合多个运动分量的控制指令,直接考察出域泛化能力。
评测所用的指标与训练时使用的点追踪工具刻意分开。训练时用的是CoTracker,而评测时改用了另一种叫做RoMa的独立密集对应估计器,这样可以确保测试结果不会因为"模型在评测工具上过拟合"而虚高。RoMa会在两帧画面之间找到大量高置信度的对应像素点,然后计算这些点的平均位移(单位是像素)。如果找到的对应点数量太少(说明两张图差异太大),系统会直接给出图像对角线长度作为惩罚分,防止严重失败的情况被当作"无法评估"而漏掉。
三个主要指标分别是:终点状态闭合度(ESC),衡量生成终点与初始帧之间的距离;反向路径对称性(RPS),衡量可逆路径中所有对称帧对之间的平均距离;重复循环稳定性(RCS),衡量重复或级联执行时相位对齐帧之间的漂移程度。三个指标均是越低越好。此外还报告两个辅助指标:动作跟随准确率(确保摄像机确实按照指令方向移动)和HPSv3视觉质量分(确保生成画面不因追求闭合而变得模糊难看)。
八、实验结果:数字背后的故事
研究团队把WorldCycle与三个基准系统进行了比较。LingBot World v2是参数量最大的系统(140亿参数),代表"靠堆参数量取胜"的路线。WorldPlay是8B参数的强基线,是WorldCycle的预训练基础。WorldCompass是最新的竞争对手,同样基于WorldPlay进行强化学习后训练,但用的是逐片段的动作跟随奖励。
最引人注目的发现是:参数量是WorldCycle约17倍的LingBot World v2,在状态一致性指标上几乎全面落后——在某些指标上差距高达8倍以上。这清楚地说明,单纯靠增大模型规模并不能解决长程一致性问题,这是一个必须通过专门的训练目标来解决的结构性缺陷,不是简单堆算力就能修复的。
在短期(125帧)简单动作场景下,与WorldCompass相比,WorldCycle将终点状态闭合误差(ESC)降低了32%,将反向路径对称性误差(RPS)降低了44%,同时动作跟随准确率从0.829微升至0.833,视觉质量分也从11.06提升至11.24。这意味着WorldCycle在大幅改善长程一致性的同时,既没有牺牲动作响应的准确性,也没有牺牲画面的视觉质感。
随着生成序列延长,WorldCycle的优势变得更加突出。中期(253帧)场景下ESC降低21%、RPS降低28%;长期(381帧)场景下重复循环稳定性指标(RCS)降低34%,这是所有设置中相对改善幅度最大的一项,直接印证了时间一致性奖励对长期漂移的针对性抑制效果。
复合动作场景的对比最为戏剧性。WorldPlay的动作准确率从简单动作的0.635暴跌至复合动作的0.136,跌幅超过五倍。WorldCompass的后训练将这个数字提升至0.499,有所改善但仍不理想。WorldCycle将其推升至0.553,相对于WorldPlay的提升幅度接近四倍。
研究团队还用另一套独立的VBench视觉质量评测体系进行了验证,包括美学质量、主题一致性、背景一致性、成像质量、时间闪烁程度和运动平滑度六个维度。WorldCycle在几乎所有维度和所有设置下均与WorldCompass持平或略优,大幅优于基础WorldPlay。这套测试的结论与主实验一致:提升长程一致性没有带来视觉质量的代价。
在长期定性对比中,不同模型的退化方式各有特点。LingBot World v2在经过五次重复循环(381帧)后,天空颜色越来越饱和,最终变成一片不自然的深蓝。WorldPlay和WorldCompass则在天空区域出现明显的白化和直线状条纹等视觉伪影。WorldCycle生成的图像在整个过程中颜色稳定、纹理清晰、场景细节保持一致,最终返回帧与初始帧高度吻合。
九、训练动态与消融分析
训练过程中的指标变化曲线呈现出一个清晰的模式。HPSv3视觉质量分在训练开始后持续上升并稳定在WorldPlay基础值之上。三个循环一致性指标(ESC、RPS、RCS)在训练过程中稳定下降并在收敛时低于初始值。两条曲线的同步改善表明,WorldCycle的训练目标提供了稳定的优化方向,没有出现"一个指标好转、另一个指标恶化"的对立现象。
消融实验进一步验证了各组件的作用。只使用空间闭合奖励而不使用时间一致性奖励时,长期和复合动作场景的性能明显下降(长期ESC从0.163升至0.212),说明时间维度的监督对长程稳定性不可或缺。反过来,只使用时间一致性奖励而不使用空间闭合奖励时,几乎所有指标都严重退化,因为时间比较的前提是每次单独循环都能正确闭合,缺少空间锚点后时间比较就失去了参考意义。
训练顺序的消融同样清晰。"直接从头同时训练两种奖励"的效果不如"热身叠加调度",原因在于训练初期的循环闭合质量尚差,时间一致性奖励此时给出的是噪声信号而非有效梯度。"先只训练空间、再只训练时间"的顺序切换策略(序贯策略)会在切换后的阶段逐渐丢失空间闭合能力,出现"灾难性遗忘"。只有"热身后两者并行、永久保留空间约束"的策略在所有指标上都达到最优,这与机器学习理论中关于多任务学习和持续学习的研究结论相吻合。
十、局限性与未来方向
研究团队坦率地指出,WorldCycle的自验证机制依赖于一个前提:动作必须是可逆的,或者闭合轨迹的净变换在数学上是已知的。对于那些本质上不可逆的过程——比如捡起一个物体后放下的过程(物体的位置可能改变,也可能被遮挡)、碰撞后的形变、液体流动——简单地执行逆操作并不能回到原始状态,闭合循环也就无从构造。
这意味着WorldCycle目前的形式最适合摄像机自由运动(前进、后退、旋转、升降)这类典型的可逆场景,对于涉及物理交互、状态改变、对象操作的更复杂动作类型,还需要设计新的自验证机制。研究团队认为,通过物理守恒定律、等效终态约束或其他可解析的闭合关系来扩展这套思路,是下一步最值得探索的方向。
此外,有两项同期工作也从不同角度探索了循环约束在视频世界模型中的应用。一项叫Cycle-World,用辅助的逆向预测模型来修正当前帧的潜变量,作为推理时的误差校正机制。另一项叫"World Models as Group Actions",用群论框架来约束动作的代数结构,通过合成的潜空间数据做监督。这三项工作可以粗略地概括为:WorldCycle把闭合循环用作强化学习的自验证奖励,Cycle-World把它用作训练时的正则化损失,而"Group Actions"把它用作群公理的软约束。三种视角互补,共同推动了这个领域的理解。
归根结底,WorldCycle做的事情,是把一个原本无解的监督问题变成了有解的——只要你巧妙地构造问题的形式。一条"来回闭合路径"里藏着物理定律给出的完美标准答案,研究团队把这个答案变成了密密麻麻的训练信号,让模型在没有任何人工标注的情况下学会了"知道自己在哪里"。这不仅仅是视频生成领域的技术进步,也为强化学习中"奖励从哪里来"这个老问题提供了一个富有启发性的新思路。对于那些同样面临"没有标准答案却想要精确监督"困境的领域,这套逻辑可能同样值得借鉴。如果你对完整的技术细节感兴趣,可以通过论文编号arXiv:2608.04964找到原始论文深入阅读。
Q&A
Q1:WorldCycle是如何在没有真实视频数据的情况下训练视频世界模型的?
A:WorldCycle利用"闭合动作循环"的物理特性来实现无标注训练。当摄像机先向前走再向后退,物理上必然回到原点,这个"必须回到原点"的结论本身就是标准答案,不需要任何真实视频数据来证明。系统通过比较路径中对称帧对之间的相似度来打分,把物理规律转化为密集的训练信号,整个过程完全不依赖人工标注。
Q2:CycleBench和现有视频评测基准有什么根本区别?
A:现有的视频评测基准主要评估短片段的画面质量或单个动作的执行准确度,无法衡量长时间运行后的误差积累。CycleBench专门评测"状态返回能力",通过构造来回路径、矩形路径、重复循环和串联循环等四种结构,在125到381帧的不同长度下测量每次模型"应该回到哪里却到了哪里"的偏差,是该领域第一个专门诊断长程漂移问题的评测工具。
Q3:WorldCycle在复合动作上表现大幅提升的原因是什么?
A:复合动作(如同时前进和转向)在训练数据中极为罕见,基础模型对此几乎没有学习样例。WorldCycle的关键在于:复合动作同样有对应的逆操作,把复合动作与其逆操作拼在一起同样构成闭合循环,因此循环奖励可以直接对复合动作轨迹进行优化,完全不需要复合动作的真实视频作为参考。这使得模型通过减少单步误差、学习动作的组合代数关系,自然地获得了对复合动作的泛化能力。