深度图像先验是一种在机器学习和深度学习中使用的技术,它利用随机初始化的神经网络作为手工设计的先验,用于解决图像处理中的逆问题。与需要大型数据集进行训练的传统深度学习方法不同,深度图像先验利用卷积网络架构的内在归纳偏置来捕获低层图像统计信息。通过将网络拟合到单个损坏图像,它可以在无需任何预训练权重或外部数据的情况下执行去噪、超分辨率和修复等任务。
该方法于2017年由Dmitry Ulyanov、Andrea Vedaldi和Victor Lempitsky提出,并于2018年在IEEE计算机视觉与模式识别会议(CVPR)上以题为“Deep Image Prior”的论文发表。核心观察是,随机初始化的卷积网络对自然图像信号具有强偏好,而非噪声。这种偏好使网络能够充当正则化器,在优化过程中有效分离信号与噪声。
工作原理
深度图像先验方法涉及用随机权重初始化卷积网络,然后优化这些权重以从损坏输入重建目标图像。网络接收固定的随机噪声张量作为输入,并生成输出图像。损失函数衡量网络输出与损坏观测之间的差异,通常使用均方误差(MSE)或其他逐像素指标。
在优化过程中,网络使用基于梯度的方法进行训练,例如Adam (Optimizer)或Stochastic Gradient Descent Variants。关键见解在于,网络架构施加了有利于自然图像的平滑先验。因此,网络首先学习拟合底层干净信号,而仅在优化后期拟合噪声或损坏。通过提前停止优化,可以获得去噪或恢复后的图像版本。
应用
深度图像先验已成功应用于多种图像恢复任务。在去噪中,该方法无需噪声-干净配对训练数据集即可去除图像中的加性高斯噪声。对于超分辨率,网络将低分辨率图像上采样到更高分辨率,同时保留锐利边缘和纹理。在修复中,它通过从周围区域传播信息来填充图像中缺失或损坏的区域。
除了这些经典任务外,深度图像先验已扩展到其他逆问题,包括去模糊、伪影去除,甚至医学成像重建。其处理单张图像的能力使其在配对训练数据稀缺或不可用的领域中尤为有价值,例如在Bhabha Atomic Research Centre或Samsung Research等专有或敏感数据无法共享的环境中。
优势与局限性
深度图像先验的一个主要优势是其数据效率。由于无需预训练,它可以应用于任何图像,而无需大量示例语料库。这使其适用于一次性恢复任务或与典型训练集分布外图像。此外,该方法是无监督的,因为优化过程中仅使用损坏图像本身。
然而,该方法存在局限性。优化过程计算密集,通常需要数千次迭代和大量GPU资源。网络架构的选择(如层数和通道数)会显著影响性能,且没有适用于所有任务的最优通用配置。此外,该方法可能难以应对严重损坏或损坏未被隐式先验良好建模的情况。
与其他技术的关系
深度图像先验在概念上与其他无监督和自监督学习方法相关。它与利用自然图像结构的Data Augmentation技术有相似之处。它还与更广泛的Generative AI领域相关联,尽管它不生成新图像,而是重建现有图像。该方法启发了后续关于深度生成模型以及理解卷积神经网络架构归纳偏置的研究(尽管卷积神经网络的slug不在提供的列表中,因此未使用链接)。
研究还探索了将深度图像先验与Residual Network (ResNet)结构相结合,以改善收敛性和稳定性。该技术已在Loss Functions和Weight Initialization的背景下进行分析,其中随机初始化在先验有效性中起关键作用。
当前研究与未来方向
自提出以来,深度图像先验已在多个方向上得到扩展。研究人员探索了降低计算成本的方法,例如使用Model Pruning创建更高效的网络。其他人则探索了自适应停止标准,以自动确定最优迭代次数。该方法还与Batch Normalization和Layer Normalization相结合,以改善训练动态。
未来工作可能侧重于将该方法扩展到视频数据,其中时间一致性很重要,或将其与基于Transformer (architecture)的架构集成。截至2020年代初,深度图像先验仍是一个活跃的研究领域,关于其理论基础以及在Google Cloud和Amazon Web Services等云图像处理服务中实际应用的研究仍在持续进行,这些服务可能受益于此类无监督技术。