原文链接 Temporal As a Plugin: Unsupervised Video Denoising with Pre-Trained Image Denoisersgithub地址 https://github.com/zfu006/TAPTAP这个模块其实不仅仅可以用于去噪任务任何多层像素级的任务其实都可以用去噪、分割、增强等等在我们实际工程应用中加入对齐模块后的网络无论是小目标还是细节都有增强的效果这种结构比较适合高频振幅低的平台。本文提出了一种新颖的无监督视频去噪框架名为“Temporal As a Plugin”TAP即“时间即插件”它将可调的时间模块集成到预训练的图像去噪器中。此外引入了一种渐进式微调策略利用生成的伪干净视频帧对每个时间模块进行优化逐步提升网络去噪性能。与其他无监督视频去噪方法相比我们的框架在 sRGB 和 raw 视频去噪数据集上均表现出更优越的性能。1 引言本文中提出利用预训练的图像去噪器作为无监督视频去噪的初始空间先验。与依赖配对视频的有监督视频去噪器不同[11,38,47,59]图像去噪器可以使用大量的图像对进行充分训练因为在现实场景中获取静态图像对更为可行[1,7,34,36,48,51,57]。为了补充预训练的空间去噪先验我们提出了一种新颖的无监督视频去噪框架名为“Temporal As a Plugin”TAP。具体而言我们将可训练的时间模块插入到基于编码器-解码器的图像去噪器的跳跃连接中。每个时间模块使网络能够在已学习的空间信息基础上融入时间信息。受[45,53]启发时间模块的排列遵循金字塔结构使我们能够利用预训练网络的多尺度架构进行高效的特征对齐。基于构建的视频去噪器我们提出了一种无监督微调策略该策略仅使用含噪视频从网络底层深层到顶层浅层逐步训练时间模块。该过程首先构建伪含噪-干净视频对包括使用预训练图像去噪器对含噪帧进行初始去噪然后基于已知的噪声模型模拟噪声。接着我们通过生成的伪配对数据微调时间模块同时保持空间层冻结从学习底层深层特征的时间对齐开始到优化顶层的细节结构。这种渐进策略有效防止了网络过拟合到初始伪标签中的伪影和过度平滑。我们在sRGB和raw视频基准上验证了方法的有效性。大量结果表明与其他无监督方法相比我们提出的框架实现了最先进的视频去噪性能。总之主要贡献如下提出了TAP一种无监督视频去噪框架它利用预训练的图像去噪器进行视频去噪而无需使用配对视频进行监督。引入了一种无监督微调策略利用时间信息来补充网络的空间先验逐步提升其去噪性能。方法在raw和sRGB视频去噪基准上均超越了当前无监督去噪器证明了其卓越的有效性。2 相关工作2.1 深度图像去噪近年来人们提出了众多图像去噪器以有效地从含噪观测中重建干净图像[5,8,9,23,26,46,54,56]。DnCNN[56]是一种广泛使用的去噪器它采用堆叠的卷积、批量归一化[33]和修正线性单元[14]ReLU的普通块以及全局残差连接[13]来实现高效去噪。结合了注意力机制与动态核的基于编码器-解码器的架构也被提出以利用图像中的局部和非局部信息[5,9,26]。同时一些网络采用了基于Transformer的架构[23,44,46,54]不仅在图像去噪上而且在通用图像恢复任务中也取得了优异性能。此外像NAFNet[8]这样的工作则致力于寻找简单而有效的图像恢复基本模块。2.2 深度视频去噪有监督视频去噪。 与仅需要利用空间信息的图像去噪不同视频去噪还受益于有效的时间对齐。一些有监督视频去噪器被设计用于从多帧中有效学习时间信息[3,4,12,21,22,24,30,32,42,43,45,52,53]。FastDVDNet[42]通过直接将连续的序列图像作为输入来学习时间信息。EDVR[45]和RViDeNet[53]通过金字塔对齐模块在特征级别实现时间对齐该模块采用可变形卷积分层地将相邻特征与参考特征对齐。除了可变形卷积其他方法如光流[3,4,21]、核预测网络[32]和时空偏移[20]也被用于实现时间对齐。无监督视频去噪。 有监督视频去噪器的性能受限于含噪-干净视频对的稀缺性。为了绕过对大量配对视频的需求一些研究引入了无监督视频去噪方法仅使用含噪视频进行训练。其中UDVD[38]提出了一种利用盲点网络[16,17]的无监督视频去噪器。RDRF[47]通过结合更密集的感受野设计和循环去噪策略改进了UDVD的架构。同时MF2F[11]提出了一种基于Noise2Noise[19]的无监督训练方法通过构建含噪对进行无监督去噪。VER2R[59]改进了Recorrupted-to-Recorrupted方案[35]用于无监督视频训练。Restored-from-Restore[18]RFR没有专门在含噪视频上训练无监督视频去噪器而是提出使用生成的伪干净视频将预训练的视频去噪器微调到目标视频。然而由于缺少用于预训练的配对视频对预训练视频去噪器的要求阻碍了其实用性。3 方法论在本节中我们描述了提出的无监督视频去噪框架TAP。我们首先介绍从预训练图像去噪器提升而来的视频去噪器架构第3.1节然后介绍用于利用含噪帧间时间信息的无监督渐进微调策略第3.2节。3.1 提升图像去噪器用于视频去噪将预训练的图像去噪器扩展为视频去噪器的挑战在于在保留预训练图像去噪器已学习的空间信息的同时使其能够利用多个含噪帧之间的时间信息。本文中我们选择广泛使用的基于编码器-解码器的图像去噪器[9,23,46,54]作为基线。然后我们提出将时间模块集成到图像去噪器的编码器和解码器之间的每个跳跃连接中强制网络在不同特征级别有效学习时间对齐。视频去噪器的整体架构和时间模块的细节将在以下小节中介绍。整体流程。 图2展示了我们提出的视频去噪器的架构它是从一个4级编码器-解码器图像去噪器扩展而来的。图像去噪器中编码器-解码器的每一级都包含几个残差块[13]用于提取每帧含噪帧的空间信息。为了利用含噪帧间的时间信息在时间模块[45,53]被集成在编码器每一级之间的跳跃连接处。除底层第4级外从每帧含噪帧提取的特征经过编码器的残差块。在第4级只有中心帧的特征被送入残差块。各级跳跃连接处的时间模块学习将相邻帧的深层的特征与中心帧的特征对齐。对齐后特征被融合并添加到由解码器恢复的同一级中心帧的重建特征上。所以除去下图黄色的时域模块temporal module其实就是个经典的nafnet网络如果用到其他图像任务上可以是其他的骨干网络。时间模块。 我们分别在从级别1到级别3的跳跃连接中插入了三个时间模块。在每个级别时间模块以深层特征作为输入即每帧的深层特征的拼接并输出融合特征。这里m表示含噪帧的时间索引从-T//2到T//2。H W C是第l级的的高度、宽度和通道数。更具体地说每个时间模块首先通过应用可变形卷积DCN[10]将相邻帧的深层特征与中心帧的深层特征对齐。给定第l级相邻帧和中心帧的深层特征时间模块采用几个卷积层来学习偏移量其中是为深层特征学习到的偏移量C是多个 3X3卷积层的堆叠Concat 示沿通道维度的拼接操作。之后通过 3x3 卷积将学习到的偏移量与从较低级别的时间模块传递来的偏移量进行细化这里我们将表示为细化后的偏移量表示从级别l经 2倍双线性上采样得到的传递偏移量。然后我们应用DCN对齐相邻特征并使用从较低级别传递来的特征对其进行细化。利用一个额外的卷积来融合这些对齐后的特征其中表示从级别 (l1)传递来的对齐特征表示融合后的特征D表示DCN。注意底层级别3的时间模块在对齐时不需要传递的偏移量和特征。至此时间模块的输出推导如下其中 B是可调参数与时间模块联合训练。我们将B初始化为0表示网络在开始时忽略时间信息。因此视频去噪器退化为预训练的图像去噪器。这种设计最大限度地利用了原始图像去噪器中已学习的空间信息同时使网络能够学习时间信息。3.2 无监督渐进微调给定一个在大量含噪-干净图像对上训练的图像去噪器人们可以直接以逐帧方式将其应用于对含噪视频去噪[49,56]。这种方法在很大程度上忽略了视频数据的帧间时间相关性导致结果不理想[49]。为了补充空间先验利用含噪视频数据中的时间信息对于实现高效的视频去噪至关重要[41,49]。为此我们进一步提出了一种无监督微调策略以仅在收集的含噪视频上逐步训练插入的时间模块。所提出的策略包括三个步骤从级别3到级别1逐步微调模块。令 R0和 R1 分别表示图像去噪器和视频去噪器。表示预训练图像去噪器的参数表示从编码器-解码器阶段的级别3到级别1的三个未训练时间模块的参数。例如W1 对应于级别3的时间模块参数。对于每个插入的时间模块我们构建含噪和伪干净视频对来微调可训练模块参数。微调策略的说明如图3所示。具体来说给定一个含噪视频数据集 Y预训练的图像去噪器首先逐帧处理含噪视频其中表示含噪帧Yt对应的去噪结果。然后我们构建伪含噪-干净视频对其中是去噪后的视频是通过向去噪视频添加来已知噪声模型的噪声而重新含噪的视频。我们在伪含噪-干净视频对上微调级别3的时间模块4 实验4.1 实验设置数据集。 我们在两个去噪任务上验证了所提方法的有效性合成高斯视频去噪和真实raw视频去噪。我们使用DAVIS[37]和Set8[42]进行合成高斯视频去噪使用CRVD[53]进行真实raw视频去噪。DAVIS包含90个视频用于训练和验证30个视频用于测试Set8包含来自Derf测试媒体集的4个视频和用GoPro拍摄的4个视频仅用于评估。CRVD提供室内和室外raw视频。室内集包括11个场景的配对含噪-干净视频6个场景用于训练5个场景用于测试每个场景包含7个视频帧。室外集仅包含在复杂场景和真实运动下捕获的含噪视频主要用于视觉比较。实现细节。 我们分别针对合成高斯图像去噪数据集和真实raw图像去噪数据集训练图像去噪器。对于所有实验我们使用基于编码器-解码器的模型即NAFNet[8]作为基线图像去噪器。遵循之前的工作[54,55]我们使用BSD500[31]、DIV2K[2]、Flickr2K[25]和WED[28]的组合来训练高斯图像去噪器。含噪图像是通过向干净图像添加 $\sigma\in[10,55]$ 的加性白高斯噪声AWGN来合成的。为了训练raw图像去噪器我们从SID[7]、SIDD[1]和CRVD训练集中选择干净图像。使用CRVD中提供的相机噪声模型参数在这些干净图像上合成泊松-高斯噪声。注意CRVD是一个视频数据集我们将视频拆分为单独的图像进行训练。为了确保实验的公平性CRVD训练集不用于微调插入的时间模块。对于我们的视频去噪器输入时间帧数T对于高斯去噪设置为5对于真实raw视频去噪设置为3。训练序列的块大小随机裁剪为 $160\times 160$批大小为4。训练期间raw视频被打包成RGBG序列。我们使用Adam优化器[15]和L1损失对网络进行微调。在每个微调步骤中网络训练200K次迭代学习率初始设置为1e-3并通过余弦退火[27]逐渐降低到1e-5。该方法使用PyTorch实现并在一块NVIDIA RTX A5000上运行。更详细的架构可在补充材料中找到。4.2 与最先进方法的比较我们将提出的TAP与最先进的无监督视频去噪方法进行比较即MF2F[11]、RFR[18]、UDVD[38]、RDRF[47]和ER2R[59]。无监督方法不依赖真实标签可以直接在测试集上训练和评估或者在训练集上训练后在测试集上评估。对于合成高斯去噪MF2F、RFR和ER2R直接在Set8和DAVIS测试集上训练和评估而UDVD和RDRF使用DAVIS训练集训练并在测试集上评估。为了区分这两种设置我们将直接在测试集上训练的方法标记为‘T’例如ER2R-T。我们为这两种设置分别训练了TAP和TAP-T。对于真实raw视频去噪由于CRVD规模有限所有无监督方法都在CRVD室内测试集和CRVD室外测试集上训练。竞争方法的实验结果要么直接引用自原论文要么通过运行官方代码复现。如果代码不可用我们省略了相应的结果。为了全面比较还包括了传统和有监督的视频去噪方法如VBM4D[29]、FastDVDNet[42]、PaCNet[43]、RViDeNet[53]和FloRNN[21]。此外我们还报告了预训练图像去噪器在视频去噪上的性能即NAFNet[8]。合成高斯视频去噪实验。 表1展示了在DAVIS和Set8数据集上的定量视频去噪结果。显然我们的方法大幅优于其他无监督方法。值得注意的是与RDRF相比TAP-T在Set8数据集上将PSNR从32.92 dB提高到33.95 dB并且在PSNR上也优于有监督方法FloRNN[21]。这一改进部分归因于Set8数据集中相对平滑的运动这有助于网络通过直接在测试集上微调来有效学习时间信息。同时TAP在无监督去噪器中PSNR排名第二。与我们的预训练图像去噪器相比TAP-T在DAVIS和Set8数据集上分别获得了1.24 dB和1.52 dB的提升表明我们的网络有效地从含噪帧中学习了时间信息。TAP和TAP-T的结果都证明了我们提出的框架的有效性。图4展示了在DAVIS和Set8数据集上的视频去噪示例。无监督方法UDVD和RFR无法恢复精细细节导致可见伪影。相比之下我们的方法TAP和TAP-T有效地恢复了细节在去噪图像中线条和纹理的清晰度上很明显并取得了与有监督方法FloRNN相当的结果。更多视觉示例在补充材料中提供。真实raw视频去噪实验。 我们在CRVD室内测试集和室外测试集上评估了我们的方法。表2显示了在CRVD室内测试集上的定量结果我们的方法仍然优于其他无监督对应方法并在PSNR上显示出与FloRNN相似的结果。然而与合成高斯去噪数据集相比在CRVD室内集上的改进不太显著这可能是由于室内数据集规模有限和人为模拟的运动所致。我们进一步在具有真实运动和复杂场景的室外集上展示了我们的方法。图5展示了去噪结果的视觉质量。FloRNN倾向于产生过度平滑的结果表明由于训练视频对有限且是模拟的它难以处理未见过的场景。无监督去噪器UDVD无法有效抑制噪声。在这些方法中我们的方法有效地消除了噪声同时保留了精细细节。4.3 渐进微调的可视化与分析通过结合时间信息网络应该在几个微调步骤中逐步恢复细节。为了证明我们提出的渐进微调策略的有效性我们分别在DAVIS、Set8和CRVD数据集上进行实验并评估网络在每个步骤的去噪性能。图6展示了定量结果说明了微调过程中去噪性能的持续提升。图7突出了每个步骤的质量提升预训练去噪器步骤0产生过度平滑和伪影。随着训练的进行网络逐渐恢复了详细的纹理证明了该方法在逐步改善视觉质量方面的有效性。4.4 消融研究微调所有参数还是微调时间模块。 为了避免对伪干净视频过拟合我们建议在微调期间冻结预训练图像去噪器的参数。通过将此策略与在每个步骤遵循我们的渐进微调策略但微调所有参数的设置进行比较评估了这一主张。表3案例1展示了微调所有参数与仅微调时间模块的定量比较。结果显示当更新所有参数时去噪性能下降这可能是由于过拟合。因此我们选择在微调期间冻结预训练层。联合微调时间模块还是渐进微调。 我们探索了一种替代的微调策略即同时训练所有模块。为了验证其相对于我们提出策略的有效性我们冻结了预训练层的参数并联合微调所有时间模块。为了公平比较重复微调过程三次类似于我们的方法。定量结果如表3案例2所示在该配置下第一步去噪性能有所提升。然而在随后的微调步骤中其性能下降。这种退化归因于网络对过度平滑结果的过拟合以及联合训练所有时间模块导致的不稳定性使得学习到的偏移量幅度很大。此外与渐进微调策略相比在每个步骤训练所有时间模块会导致较高的计算成本。更多步骤的微调。 我们进一步探索了与原始策略相比重复整个微调过程的有效性。在完成步骤3的微调后我们使用伪对重复该过程。根据表3案例3微调两次比一次略有改善。因此我们在本研究中不重复整个微调过程。时间相干性。 遵循之前的工作[20,39]我们创建了一个静态的12帧玩具数据集噪声水平 $\sigma30$。我们计算了相邻去噪帧的平均绝对误差并可视化了其中两个去噪帧之间的残差图像之一以评估时间相干性。表4和图8显示我们的去噪器比无监督竞争者UDVD具有更好的时间相干性。此外与我们的图像去噪基线NAFNet相比TAP改善了时间相干性。