CVPR 2026 | 复旦提出 EffectErase:联合移除与插入任务,实现视频物体及其副作用的高质量擦除

在视频剪辑中,想把一个走动的人或者一辆行驶的车完全抹掉,其实比想象中要难得多。很多时候,人虽然不见了,但地上的阴影、水里的倒影,甚至是物体经过时带起的草地变形,往往还会尴尬地留在原地。这些由于物体存在而产生的环境变化,被研究者们称为物体的“副作用”(Side Effects)。

图1:EffectErase 能够有效移除视频中的目标物体及其诱发的各种副作用,如遮挡、阴影、光照变化、反射和变形。

图1:EffectErase 能够有效移除视频中的目标物体及其诱发的各种副作用,如遮挡、阴影、光照变化、反射和变形。

最近,来自复旦大学的研究团队提出了一种名为 EffectErase 的新框架,专门针对这些难以根除的副作用,寓意不仅要擦掉物体本身,更要彻底清除其对环境造成的所有视觉影响。为了训练这个模型,团队还构建了一个超大规模的混合数据集 VOR(Video Object Removal),为该领域的研究提供了扎实的数据基础。

图片

  • 论文地址: https://arxiv.org/abs/2603.19224
  • 项目主页: https://henghuiding.com/EffectErase/
  • 代码仓库: https://github.com/FudanCVL/EffectErase

背景与动机:为什么“副作用”这么难搞?

为什么现有的视频补全(Inpainting)模型去不掉阴影和倒影?核心原因在于,传统的模型太依赖用户输入的掩码(Mask)了。通常我们只给物体画个圈,模型就只管修补圈里的像素,而圈外的阴影自然就被漏掉了。

虽然之前也有一些研究尝试自动识别这些副作用,但进展缓慢。一方面是缺乏高质量的训练数据——想要拍到完全相同的场景在有物体和没物体时的对比视频,对相机稳定性和光照控制的要求极高;另一方面,模型缺乏一种有效的机制来建立物体与其副作用之间的时空关联。

图2:现有方法的局限性。可以看到,像 ProPainter 或 ROSE 在处理复杂的反射时,依然会留下明显的痕迹。

图2:现有方法的局限性。可以看到,像 ProPainter 或 ROSE 在处理复杂的反射时,依然会留下明显的痕迹。

复旦团队观察到,物体移除和物体插入其实是互为逆运算的两个任务,它们关注的受影响区域(即物体+副作用区)是完全一致的。这种“对称性”成为了 EffectErase 设计的灵感来源。

VOR 数据集:海量真实与合成的完美结合

为了解决数据匮乏的问题,研究团队构建了 VOR 数据集。这是一个包含 6 万对 视频、总时长超过 145 小时 的超大型数据集。

图片

图4:VOR 数据集的构建流程,结合了 3D 合成与真实世界采集。

图4:VOR 数据集的构建流程,结合了 3D 合成与真实世界采集。

它的特别之处在于采用了“真假结合”的策略:

  1. 真实采集:使用三脚架固定多台相机,在 293 个真实场景中拍摄物体存在与不存在的配对视频。为了增加动态感,后期还利用 Ken Burns 效应模拟了相机的平移、缩放和晃动,生成了 14 种不同的相机运动模式。
  2. 3D 合成:在 Blender 引擎中构建了 150 多个复杂的 3D 场景。通过 3D 渲染,可以完美地控制物体运动产生的阴影、反射和物理变形,提供了极其精准的基准数据(Ground Truth)。

研究者将物体引起的副作用细分为五类:遮挡(Occlusion)阴影(Shadow)光照变化(Lighting)反射(Reflection)和物理变形(Deformation)

图5:VOR 数据集中涵盖的五类典型副作用,模型需要学习不同物理现象下的视觉规律。

图5:VOR 数据集中涵盖的五类典型副作用,模型需要学习不同物理现象下的视觉规律。

EffectErase 方法详解:互逆任务的奇妙化学反应

EffectErase 的核心思想非常巧妙:它通过联合学习“物体移除”和“物体插入”,让插入任务作为移除任务的辅助,从而增强模型对副作用区域的感知能力。

图3:移除与插入是互逆任务,它们操作的是同一个受影响区域。

图3:移除与插入是互逆任务,它们操作的是同一个受影响区域。

1. 移除-插入联合学习流程

在训练阶段,模型共享同一个基于 Diffusion Transformer (DiT) 的去噪骨干网络:

image.png

图6:EffectErase 的整体框架图。展示了如何通过 Adaptor 融合特征,并利用 TARG 和 EC Loss 进行联合训练。

图6:EffectErase 的整体框架图。展示了如何通过 Adaptor 融合特征,并利用 TARG 和 EC Loss 进行联合训练。

实验结果:擦得更干净,画得更真实

研究团队在 ROSE 和 VOR-Eval 基准测试上进行了详尽的验证。结果显示,EffectErase 在多项指标上均达到了 SOTA 水平。

1. 定量性能对比

在 ROSE 基准测试中,EffectErase 的 PSNR 达到了 32.161,远超之前的 SOTA 模型。更重要的是,在衡量视频生成质量的 FVD 指标上,它从 ROSE 的 72.177 显著降低到了 55.578,这意味着生成的视频在时空连续性上表现极佳。

表2:在 ROSE 和 VOR 数据集上的定量对比结果,各项指标全面领先。

表2:在 ROSE 和 VOR 数据集上的定量对比结果,各项指标全面领先。

2. 视觉效果展示

从视觉效果上看,EffectErase 的优势更加直观。无论是复杂的地面反射,还是夜晚车灯照亮路面的光影,它都能处理得不留痕迹。

图7:在 VOR-Eval 数据集上的定性对比。可以看到 EffectErase 在处理反射和阴影时的卓越表现,背景修补非常自然。

图7:在 VOR-Eval 数据集上的定性对比。可以看到 EffectErase 在处理反射和阴影时的卓越表现,背景修补非常自然。

在更具挑战性的野外场景(VOR-Wild)中,EffectErase 同样表现稳健。面对多人遮挡、快速运动的体育场景以及复杂的镜面反射,它都能精准地定位并消除副作用。

图8:在 VOR-Wild 野外场景下的测试结果,展示了模型强大的泛化能力。

图8:在 VOR-Wild 野外场景下的测试结果,展示了模型强大的泛化能力。

更多应用:丝滑的物体插入

更有趣的是,由于模型学习了“插入”任务,它在物体插入应用中也表现出色。当你把一个物体放进视频时,模型会自动为它生成匹配的阴影和倒影,让合成效果看起来非常自然。

图9:EffectErase 在物体插入任务上的应用展示,自动生成的阴影和反射非常真实。

图9:EffectErase 在物体插入任务上的应用展示,自动生成的阴影和反射非常真实。

写在最后

EffectErase 再次证明了“任务协同”的威力。将看似对立的移除和插入任务放在一起训练,不仅没有增加负担,反而通过共享的物理常识(即物体如何影响环境)提升了各自的上限。这种“逆向思维”为视频编辑任务提供了一个非常值得借鉴的新范式。

目前,该模型仍需要用户提供初始掩码。作者也提到,未来如果能结合语音或文字指令(例如“帮我把那个跳舞的人删掉”),这种“副作用消失术”将会变得更加易用。复旦大学这次贡献的 VOR 数据集,也将成为视频物体移除领域的重要基石。

图片

入群加好友(v:xiao-ma-baoli),请备注你感兴趣的技术方向

发布于:江苏省