Deep image priorは、機械学習および深層学習における技法であり、ランダムに初期化されたニューラルネットワークを、画像処理における逆問題を解くための手作りの事前分布として利用するものである。大規模なデータセットを訓練に必要とする従来の深層学習アプローチとは異なり、deep image priorは、畳み込みネットワークのアーキテクチャが持つ本質的な帰納的バイアスを活用して、低レベルの画像統計を捉える。ネットワークを単一の劣化画像に適合させることで、事前学習済みの重みや外部データを一切使用せずに、ノイズ除去、超解像、インペインティングなどのタスクを実行できる。
この手法は、2017年にDmitry Ulyanov、Andrea Vedaldi、Victor Lempitskyによって導入され、2018年のIEEEコンピュータビジョン・パターン認識会議(CVPR)で「Deep Image Prior」と題する論文として発表された。中心となる観察は、ランダムに初期化された畳み込みネットワークが、ノイズよりも自然画像信号に対して強い優先性を持つという点である。この優先性により、ネットワークは正則化子として機能し、最適化プロセス中に信号とノイズを効果的に分離できる。
仕組み
deep image priorアプローチでは、畳み込みネットワークをランダムな重みで初期化し、その重みを最適化して、劣化した入力から目標画像を再構成する。ネットワークは固定されたランダムノイズテンソルを入力として受け取り、出力画像を生成する。損失関数は、ネットワークの出力と劣化した観測値との差を測定し、通常は平均二乗誤差(MSE)やその他の画素単位の指標を使用する。
最適化中、ネットワークはAdam (Optimizer)やStochastic Gradient Descent Variantsなどの勾配ベースの手法を用いて訓練される。重要な洞察は、ネットワークのアーキテクチャが自然画像を優先する平滑性の事前分布を課すという点である。その結果、ネットワークはまず基礎となるクリーンな信号に適合することを学習し、ノイズや劣化への適合は最適化プロセスの後半にのみ行われる。最適化を早期に停止することで、画像のノイズ除去版または復元版を得ることができる。
応用
deep image priorは、いくつかの画像復元タスクに成功裏に適用されている。ノイズ除去では、ノイズ付き・クリーンなペアの訓練データセットを必要とせずに、画像から加法的ガウスノイズを除去する。超解像では、ネットワークが低解像度画像を高解像度にアップサンプリングし、鋭いエッジやテクスチャを保持する。インペインティングでは、周囲の領域からの情報を伝播させることで、画像の欠落または劣化した領域を埋める。
これらの古典的なタスクに加えて、deep image priorは、デブラリング、アーティファクト除去、さらには医用画像再構成など、他の逆問題にも拡張されている。単一の画像で動作する能力は、ペアの訓練データが乏しい、または利用できない領域、例えばBhabha Atomic Research CentreやSamsung Researchのような、独自性または機密性の高いデータを共有できない設定において特に価値がある。
利点と限界
deep image priorの大きな利点は、そのデータ効率性である。事前学習が不要なため、大規模なサンプルコーパスを必要とせずに任意の画像に適用できる。これにより、一回限りの復元タスクや、典型的な訓練セットから外れた分布の画像に有用である。さらに、この手法は教師なしであり、最適化中に劣化画像自体のみを使用する。
しかし、このアプローチには限界がある。最適化プロセスは計算集約的であり、数千回の反復と多大なGPUリソースを必要とすることが多い。層数やチャネル数などのネットワークアーキテクチャの選択は性能に大きく影響し、すべてのタスクに最適に機能する普遍的な構成は存在しない。さらに、この手法は深刻な劣化や、劣化が暗黙の事前分布によって適切にモデル化されていない場合に苦労する可能性がある。
他の技法との関係
deep image priorは、他の教師なしおよび自己教師あり学習手法と概念的に関連している。自然画像の構造を活用するData Augmentation技法と類似点を共有する。また、新しい画像を生成するのではなく既存の画像を再構成するものの、Generative AIのより広い分野とも関連している。この手法は、深層生成モデルやConvolutional neural networkアーキテクチャの帰納的バイアスの理解に関するその後の研究に影響を与えた(ただし、畳み込みニューラルネットワークのスラッグは提供されたリストにないため、リンクは使用されない)。
研究では、収束と安定性を改善するために、deep image priorをResidual Network (ResNet)構造と組み合わせることも探求されている。この技法は、Loss FunctionsとWeight Initializationの文脈で分析されており、ランダム初期化が事前分布の有効性において重要な役割を果たす。
現在の研究と将来の方向性
導入以来、deep image priorはさまざまな方向に拡張されてきた。研究者は、Model Pruningを使用してより効率的なネットワークを作成するなど、計算コストを削減する方法を調査している。また、最適な反復回数を自動的に決定するための適応的停止基準も探求されている。この手法は、訓練ダイナミクスを改善するためにBatch NormalizationやLayer Normalizationと組み合わせることも行われている。
将来の研究は、時間的一貫性が重要となるビデオデータへのスケーリングや、Transformer (architecture)ベースのアーキテクチャとの統合に焦点を当てる可能性がある。2020年代初頭の時点で、deep image priorは依然として活発な研究分野であり、Google CloudやAmazon Web Servicesのようなクラウドベースの画像処理サービスがこのような教師なし技法から恩恵を受ける可能性がある分野での理論的基盤と実用的応用に関する継続的な研究が行われている。