浙江大学提出MotionFlow_相机轨迹_物体语义完美融合_视频生成一致性实现SOTA性能碾压

每日最新论文方向涵盖:目标检测图像分割图像识别检索视觉预训练3D/点云/视频图像超分/去噪GAN/DiffusionLLMImageCaptioningVQA视觉语言预训练MLLMText2ImageOpenVocabulary语音技术机器人技术增量/连续学习自动驾驶遥感医学量化/剪枝/加速机器翻译/强化学习NRFVisual Counting时序建模等。

🌐 社群导航 🔗 点击加入➡️【AIGC/LLM/MLLM/3D/自动驾驶】技术交流群

最新论文解读系列

MotionFlow 论文标题与作者信息

图 1:MotionFlow 论文标题页——浙江大学等机构提出,聚焦复杂相机轨迹控制的视频生成

论文名:MOTIONFLOW: LEARNING IMPLICIT MOTION FLOW FOR COMPLEX CAMERA TRAJECTORY CONTROL IN VIDEO GENERATION

论文链接:https://arxiv.org/pdf/2509.21119 | 项目链接:https://yu-shaonian.github.io/MotionFlow/

MotionFlow 定性结果展示

图 2:MotionFlow 定性结果——左侧彩色箭头表示相机轨迹,右侧为按轨迹生成的视频帧序列(鹿、湖泊山脉等场景)

1. 一、导读

通过对扩散模型进行广泛而深入的研究,研究人员显著提升了视频生成的质量和多样性。近年来的模型,如 DynamicCrafter,展现了生成具有复杂动态的长视频的能力。然而,这些方法多以文本、图像、深度图、轮廓图、人体姿态或投影图为提示,往往忽视了对相机运动的精确控制,而这在电影制作、**虚拟现实(VR)增强现实(AR)**等应用中尤为重要。这些领域不仅需要高质量的视频内容,还要求严格遵循预设的相机运动以实现理想的视觉效果。

2. 二、简介

相机轨迹引导的视频生成在实现一致性和泛化能力方面面临重大挑战,尤其是在同时存在相机和物体运动的情况下。现有方法通常尝试分别学习这些运动,可能导致相机与物体之间相对运动的混淆。为了解决这一问题,论文提出了一种新颖的方法,将相机和物体运动转化为对应像素的运动,从而实现两者的融合。利用稳定扩散网络(Stable Diffusion Network),有效学习了与特定相机轨迹相关的参考运动图(Motion Maps)。这些运动图结合提取的语义物体先验信息,输入到**图像到视频(Image-to-Video)**网络中,生成能够准确跟随预定相机轨迹且保持物体运动一致性的视频。大量实验验证了该模型在性能上远超当前最先进(SOTA)方法。

3. 三、方法与模型

方法的核心思想是将语义信息像素级运动信息逐步注入到基于扩散的视频生成网络中。如图 3 所示,采用参考运动网络从参考图像和相机轨迹中提取带有语义信息的像素级运动,作为运动流通过参考注意力引导视频生成。为了进一步识别场景中的潜在运动前景对象和静止背景,引入语义提取器以捕获语义信息。这些信息随后通过像素级相加和对象注意力注入到视频生成网络中。对于视频生成网络,采用预训练的 AnimateDiff(Guo 等,2023b)模型,并在每个 UNet 结构块中加入参考注意力对象注意力进行增强。

MotionFlow 框架图

图 3:MotionFlow 框架概述——上方为参考运动网络(Trajectory Encoder + VAE Encoder 提取参考运动图),下方为视频生成网络(Semantic Encoder 提取语义,融合参考运动图后经 VAE Decoder 输出视频)

本节结构如下:

  • 第 1 节简要介绍基础视频生成网络
  • 第 2 节详细说明相机编码信息
  • 第 3 节讨论语义信息在视频生成骨干网络中的集成
  • 第 4 节探讨将由参考运动网络生成的像素运动逐步引入视频生成框架以引导生成过程
  • 第 5 节对带有语义和相机运动信息的像素级运动进行详细分析

3.1. 视频扩散模型

视频扩散模型是一类生成模型,将扩散概率模型的原理从图像生成扩展到视频合成领域。这些模型学习逆转应用于视频序列数据的逐步加噪过程,从而实现高质量、时间连续性的视频序列生成。正向扩散过程定义为一个马尔可夫链,逐步向原始视频添加高斯噪声;模型学习逆转此过程,通常由神经网络参数化,目标是最小化去噪损失。其中 cond 代表条件输入,可能包括文本提示参考图像相机轨迹场景轮廓。视频扩散模型结合时空结构,捕获空间细节时间动态,通常采用 3D 卷积注意力层循环结构等机制以确保帧间一致性。

3.2. 轨迹编码器

相机运动轨迹可以通过视频序列中各帧之间的相机变换来表示,该变换可以简洁地用旋转矩阵平移矩阵描述。**MotionCtrl(Wang 等,2024c)**通过将相机参数展平为 12 维向量,并将其与基础视频生成网络的时间嵌入拼接来表示相机运动,再用轻量级全连接网络保证新嵌入与原始时间嵌入在维度上的一致。

然而,这种表示在准确描述相机运动方面存在局限,主要原因有两个:

  1. 相机参数本质上反映相机空间的特性,其中旋转矩阵平移向量具有不同的语义意义,应分别处理,而非扁平化为单一向量。
  2. 建模原始相机参数像素空间之间的相关性具有挑战性,可能限制模型的泛化能力,尤其是在大规模复杂户外场景中。

为了更好地描述相机姿态,论文采用 Plücker 嵌入(Sitzmann 等,2021)作为相机轨迹的表示——该嵌入表示从相机中心到像素位置的向量。为了将轨迹表示注入参考运动网络,设计了一个结构类似于 CameraCtrl(He 等,2024)相机编码器的轨迹编码器,并对架构进行了改进:在每个二维 ResNet 块之后,用自注意力(self-attention)取代了时间注意力(temporal attention),并输出多尺度的轨迹特征。

3.3. 语义编码器

为了使视频生成网络能够感知场景中的潜在运动前景对象和静止背景,论文设计了一个语义编码器,用于提取显著对象的语义特征。实现方法之一是标记这些对象的区域,并将其送入语义编码器(如图 3 所示)。为了获得这些细粒度信息,语义编码器采用轻量级架构,能够自适应识别潜在的显著对象区域。该模块在第一阶段进行训练。

3.4. 参考运动网络

近年来的研究主要依赖文本提示进行视频生成,或结合 ViT(Caron 等,2021)提取的特征。然而,由于提示中场景细节的丢失,它们难以准确学习用于表示前景对象运动的特征,可能导致生成质量较低。因此,在相机轨迹控制任务中,通常更偏好使用图像作为条件——因为图像能传达比文本提示更细粒度的场景细节。

一些方法采用图像特征代替文本特征,并通过图像将其输入扩散网络。然而,CLIP(Contrastive Language-Image Pretraining)特征强调文本与图像的对齐,且是在低分辨率图像输入下学习的,仍然偏重于图像的高层抽象,忽略了图像细节。另一种方法是利用 CLIP 架构实现交叉注意力,但其关键限制在于补充的条件信息必须与基础图像特征良好对齐,才能实现有效交互。然而,图像引导中的轨迹信息与 CLIP 特征属于不同领域,使得 **ControlNet(Zhang 等,2023)**难以直接将轨迹信息转化为视频生成网络能理解的运动引导。

论文的想法是引入一个单独的参考运动网络,以整合相机空间图像空间的语义信息,直接生成可在视频生成网络中使用的参考运动图。该网络在空间变换器中结合了图像特征和相机轨迹特征,将多尺度的轨迹特征注入到**稳定扩散(Stable Diffusion,SD1.5 UNet)**层中,以有效捕捉相机运动。

语义像素运动中结合相机和图像条件的加权组合,使得视频潜在空间能够有效整合编码的相机轨迹与初始图像特征。通过端到端训练,网络能够预测与相机轨迹相关的参考运动图,这些运动图以逐帧的方式生成,随后通过参考运动网络注入到基础视频生成网络中。

3.5. 视频生成网络

对于视频生成网络,论文将由参考运动网络生成的与相机相关的逐帧参考运动图,作为参考注意力的输入来引导视频生成过程。具体而言,对于视频生成网络的每个模块,将参考运动图与基础网络特征沿维度拼接,再提取前半部分作为参考运动网络的输入。

随后使用语义编码器处理潜在的像素级运动像素运动信息。这些信息通过像素级相加和对象注意力操作注入到视频生成网络中(如图 3 所示)。不仅在噪声输入过程中整合语义信息,还计算一个**对象注意力(object attention)**来连接语义特征图与参考注意力的输出。同时,受到其他架构思想的启发,对参考注意力的输出应用时间注意力,以增强连续帧之间的一致性。

3.6. 训练策略

对象注意力使用来自 **AnimateDiff(Guo 等,2023b)**的预训练权重进行初始化,时间注意力模型使用预训练权重初始化,**Stable Diffusion V1.5(Rombach 等,2022)**则从基于时间维度的自注意力初始化。所有其他模块均初始化为零。

训练使用多 GPU,每个 GPU 的批量大小为 1。在第一阶段,以较大学习率训练参考运动网络轨迹编码器,为期一天,同时保持语义编码器和相关模块不变。随后,以降低的学习率训练所有部分三天。优化器采用 Adam(Kingma & Ba,2015)。论文使用 **DINO(Caron 等,2021)**数据集进行训练,并在大规模户外数据集 **DL3DV-10K(Ling 等,2024)**上进行测试以验证泛化能力。

4. 四、实验与结果

实验在配备 NVIDIA A800 GPU 的服务器上进行。为了更好地评估方法,论文设计了针对几何一致性视觉质量的单独对比,进行了比较生成视频的摄像机轨迹、视觉质量以及泛化能力的实验。实验结果显示,该方法能够为包含部分活动前景对象运动(如动物)的动态场景生成高质量视频。

4.1. 评估指标

从两个方面评估方法:几何一致性语义一致性。几何一致性通过预测的摄像机轨迹与目标视频的对齐情况之间的距离来衡量——使用相同的方法预测生成视频和真实视频的摄像机轨迹,以消除由不同技术引起的潜在尺度差异。考虑到摄像机矩阵中旋转参数的尺度和差异,分别采用旋转和平移指标进行评估。

采用四个经典的图像到视频生成模型指标,包括:

  • FID(Fréchet Inception Distance)(Heusel 等,2017)——衡量生成视频的视觉质量
  • PSNR(峰值信噪比)(Wang 等,2004)——衡量图像质量
  • SSIM(结构相似性指数)(Hore & Ziou,2010)——衡量结构相似性
  • LPIPS(感知图像块相似度)(Zhang 等,2018)——衡量感知相似度

来评估生成视频帧的质量,还采用FVD(Fréchet Video Distance)(Unterthiner 等,2018)进一步评估视频级一致性。

4.2. 与最先进方法的对比

4.2.1. 几何一致性

几何一致性的有效性通过使用技术估算的摄像机轨迹进行评估。由于部分场景图像之间的重叠较少,常用的图像级质量指标经常无法估算出对应的摄像机轨迹。因此,论文采用基于 SfM(Structure-from-Motion)的方法,能够在复杂和动态场景中估算摄像机轨迹,以获取生成视频的摄像机轨迹。分别评估了T-Err(平移误差)R-Err(旋转误差)

为了全面比较,在基础轨迹和困难轨迹上与 CameraCtrlMotionCtrl 等方法进行对比。使用 COLMAP(Schönberger & Frahm,2016)、**Dust3R(Wang 等,2024b)**和 **VggSfM(Wang 等,2024a)**评估了生成视频的摄像机轨迹与真实轨迹之间的误差。

几何一致性定量比较

表 1:几何一致性定量比较——基础轨迹与困难轨迹上,CameraCtrl / MotionCtrl / Ours 在 Dust3R / VggSfM / ParticleSfM 三种基准下的 T-Err↓、R-Err↓,Ours(红色)误差最低

4.2.2. 视觉质量

采用图像级和视频级的质量指标进行评估。为了确保公平性,所有对比模型均在相同的数据集上训练,基线模型为 ParticleSfM。实验结果显示,论文的模型不仅能够生成高质量视频,还在 T-Err、R-Err 等方面优于同类其他方法。

定性结果——多场景多帧对比

表 2:定性结果——给定参考图像(每组最上方图像),展示 Indoor Scenes / Outdoor Scenes / Wild Animals 三类场景下的生成效果

定性比较——与 CameraCtrl、MotionCtrl 对比

图 4:对控制能力和视频质量的定性比较——泰姬陵、北极熊场景下,CameraCtrl / MotionCtrl / Ours 三行对比,Ours 的相机轨迹跟随更准确、运动更一致

4.2.3. 泛化能力比较

采用在室内数据集上训练的模型,直接在室外数据集 DL3DV-10K 上评估泛化能力。实验结果显示,论文的方法在动态场景适应性和鲁棒性方面优于其他方法。这突显了方法在相机轨迹细节清晰方面的优势,归功于逐步注入的像素级运动,促进了相机姿态与物体运动的同步。

户外场景定量结果

表 3:户外场景视频级质量——Real10k / DL3DV 两个数据集上,AnimateDiff / VideoCrafter / DynamicCrafter / MotionCtrl / CameraCtrl+IC / Ours 在 LPIPS↓、PSNR↑、SSIM↑、FID↓、FVD↓ 五项指标的对比,Ours(红色)综合最优

户外场景泛化能力定性比较

图 5:对户外场景增强鲁棒性的定性比较——房屋、熊场景下,AnimateDiff / VideoCrafter / DynamicCrafter / Ours 四行对比,相机姿态用红色虚线框突出显示

4.3. 消融研究与分析

4.3.1. 参考运动网络

首先验证了参考运动网络的有效性,这是模型中最重要的模块。第一组对比显示了在没有使用该网络的情况下生成的结果——直接将图像特征输入到视频生成网络中。可以观察到,在没有参考运动流提供引导的情况下,所有指标都明显下降。进一步探索了使用预训练参数对泛化能力的益处,结果显示采用预训练参数整体性能有所提升。

这一改进归因于参考运动网络所学习到的强运动先验……