世界模型正面临记忆问题

视频生成系统已经迅速进步,但一个弱点始终存在:它们往往会随着时间推移而丢失对物理空间的把握。镜头转回时,房间的形状会发生变化。家具位置会移动。表面细节不再与模型片刻之前展示的内容相符。对于所谓的世界模型而言,这种失败尤其具有局限性,因为在这类系统中,连贯性比单纯的视觉质量更重要。

由微软研究院及学术合作方开发的一套新系统 Mirage,被提出为更高效地解决这一问题的一种方式。Mirage 并不依赖传统的基于像素的 3D 记忆管线,而是将场景信息直接存储在模型的潜在空间中。根据原始材料,这带来了更稳定的空间一致性,尤其是在长时间镜头运动过程中,同时还能大幅提升速度和内存效率。

这个项目之所以引人注目,是因为它触及了生成式模拟中的一个实际瓶颈:如何在不让每次视角变化都付出过高计算代价的前提下,记住一个地方。

为什么旧的记忆管线代价高昂

在许多先前系统中,空间记忆是通过基于可见图像数据构建的 3D 点云来维持的。随着模型生成新视角,它会更新该点云,然后反复将其渲染回生成器可使用的形式。这就形成了一个循环,在潜在特征与像素空间结构之间来回传递信息。

Mirage 的作者将这种方法描述为双重瓶颈。它在计算上成本高,而且在反复经过渲染后的图像空间转换时,也有丢失信息的风险。对于长序列,这些损失会累积成可见的不稳定。模型可能生成局部上看似合理的帧,但会逐渐偏离其本应保持的场景几何结构。

这很重要,因为世界模型正越来越多地被讨论为模拟、具身 AI 训练、合成环境和交互式场景生成的工具。在这些场景中,记忆不是可选项。一个无法记住拐角后有什么的模型,无法作为长期可靠的环境模型运行。

Comparison diagram of two video world model pipelines. Top: an RGB point cloud memory with a render-and-encode loop. Bottom: Mirage
并排对比的两种视频世界模型管线。上方:带有渲染-编码循环的 RGB 点云记忆。下方:Mirage 的潜在空间空间记忆,直接在潜在空间中构建并读取。| 图片:Wang 等

Mirage 的核心思路

Mirage 采用了不同的路径,它将内部图像特征直接存储为潜在空间中的空间记忆。它并不只是保留可见的颜色点,而是将这些学习到的特征锚定到 3D 空间中的位置上。当系统需要生成新视角时,它会把这份潜在记忆投影到目标相机视图中,并将结果直接反馈给生成器。

通过避开穿过像素空间点云的渲染与重新编码过程,Mirage 旨在同时节省时间和内存。原文称,它生成视频的速度最高可快 10.5 倍,内存占用最高可减少 55 倍。这样的提升足以影响一种技术究竟只是研究兴趣,还是能够投入实际使用。

这种方法也与生成式 AI 的一个更广泛趋势一致:将更多关键表示工作转移到潜在空间中,让模型能够处理比原始像素更紧凑、语义上更有意义的特征。

该系统看起来改善了什么

Mirage 的核心承诺不仅是效率,更是持续性。该模型旨在让生成场景的空间结构在长镜头路径中保持连贯,减少重复视角返回时被改动的倾向。这使它尤其适用于那些场景连续性本身就是任务的一部分,而不仅仅是视觉加分项的应用。

值得注意的是,原文提到移动物体仍会被从记忆中滤除。这表明 Mirage 目前更专注于维持稳定的场景布局,而不是完整建模那种多个物体会随时间独立运动的动态环境。即便如此,稳定静态世界本身仍然是重要的一步,因为它解决了问题的基础层。

如果一个世界模型能够持续准确地记住建筑结构、房间布局或地形几何,它就为未来可能进一步加入更复杂运动与交互处理的系统提供了更强的基础。

为什么这不仅仅关乎视频生成演示

生成式视频研究常常围绕短片和视觉奇观展开,但更具决定性的进展可能来自支持模拟的系统。如果 AI 模型要被用作机器人、虚拟智能体、规划系统或交互式内容工具的训练场,它们就需要某种形式的持久世界状态。

Mirage pipeline in which a VAE plus depth estimation builds the latent cache from the first frame. Each generation chunk reads from it via readout and updates it via write, while the latent 3D representation grows over time from t0 to tN.
Mirage 以起始图像为种子构建潜在缓存,然后按块读取并写回,在整个生成过程中保持静态场景内容完整。| 图片:Wang 等

这正是 Mirage 值得关注的地方。它指向一种新一代模型,这类模型将场景记忆视为内部、结构化的资源,而不是逐帧预测的脆弱副产物。高效的空间记忆有望弥合令人惊艳的一次性生成与可复用模拟环境之间的鸿沟。

它还具有基础设施层面的意义。计算成本仍然是 AI 部署的关键约束之一。那些同时降低处理时间和内存需求的方法,可以扩大能够尝试高级世界模型的研究者和公司范围。效率提升往往和质量提升一样,会深刻影响采用速度。

值得关注的研究信号

Mirage 仍应被理解为一项研究进展,而不是一个成熟平台。现有材料主要聚焦其架构和基准优势,而非广泛部署。关于它的泛化能力、在更复杂或更动态场景中的表现,以及如何与下游模拟任务整合,仍有不少问题悬而未决。

但这篇论文的方向具有重要意义。Mirage 并没有通过不断扩大规模、以蛮力追求更逼真的视频,而是去解决模型表示空间方式中的结构性弱点。这是一个有意义的转变,因为可靠的记忆是任何试图作为“世界”而非“片段机器”运作的模型的前提。

从实际角度看,这套系统表明,长时间跨度的场景一致性不必依赖昂贵的像素空间记忆循环。一个更精简的潜在空间机制,也许就足以在更低成本下保留更多世界信息。

对于 AI 研究而言,这种组合很强大。更好的连贯性让世界模型更有用,更低的成本让它们更具扩展性。如果 Mirage 的说法在更广泛测试中得到验证,它可能会影响下一波视频和模拟模型处理其最难问题之一的方式:记住自己身在何处。

本文基于 The Decoder 的报道。阅读原文

Originally published on the-decoder.com