ニューラルスタイル転送(NST)は、デジタル画像や動画を操作して、別の画像の外観や視覚的スタイルを採用するソフトウェアアルゴリズムの一種です。NSTアルゴリズムは、画像変換に深層ニューラルネットワークを使用することを特徴としています。一般的な用途には、写真から人工的なアートワークを作成すること、例えば有名な絵画の外観をユーザー提供の写真に転送することが含まれます。DeepArtやPrismaなどの注目すべきモバイルアプリはNST技術を採用しており、世界中のアーティストやデザイナーは、既存のスタイルに基づいて新しいアートワークを開発するためにこの方法を使用しています。
NSTは画像スタイライゼーションの一例であり、非写実的レンダリングの分野で20年以上にわたって研究されてきた問題です。最初の2つの例ベースのスタイル転送アルゴリズムは、画像アナロジーと画像キルティングであり、どちらもパッチベースのテクスチャ合成に基づいていました。画像アナロジーは、変換を学習するためにトレーニングペアの画像(写真とそれを描いたアートワーク)を必要としましたが、画像キルティングはその処理ステップを必要としませんでしたが、1つのスタイルでのみ実証されました。
歴史
最初のNST手法は、Leon Gatysらによる論文「A Neural Algorithm of Artistic Style」で発表され、2015年にArXivで最初にリリースされ、2016年のCVPR会議で受理されました。元の論文では、ImageNetデータセットでオブジェクト認識用に事前トレーニングされたVGG-19アーキテクチャを使用していました。2017年には、Google AIが、単一の深層畳み込みスタイル転送ネットワークが複数のスタイルを同時に学習できるようにする手法を導入し、ビデオメディアでもリアルタイムのスタイル補間を可能にしました。
数学
NSTのアイデアは、コンテンツ画像\(\vec{p}\)とスタイル画像\(\vec{a}\)の2つの画像を取り、コンテンツ損失\(\mathcal{L}_{\text{content}}(\vec{p}, \vec{x})\)とスタイル損失\(\mathcal{L}_{\text{style}}(\vec{a}, \vec{x})\)の加重組み合わせを最小化する3番目の画像\(\vec{x}\)を生成することです。総損失は線形和です:\(\mathcal{L}_{\text{NST}}(\vec{p}, \vec{a}, \vec{x}) = \alpha \mathcal{L}_{\text{content}}(\vec{p}, \vec{x}) + \beta \mathcal{L}_{\text{style}}(\vec{a}, \vec{x})\)。これらの損失を共同で最小化することにより、NSTはコンテンツ画像のコンテンツとスタイル画像のスタイルをブレンドした画像を生成します。
両方の損失は、画像間の類似性を測定します。コンテンツ類似性は、単一の畳み込みニューラルネットワーク(CNN)が2つの画像に対して生成するニューラルアクティベーション間の二乗差の加重和です。スタイル類似性は、各層内のグラム行列の加重和です。元の論文ではVGG-19 CNNを使用しましたが、この手法は任意のCNNで機能します。
記号
\(\vec{x}\)をCNNへの入力画像とします。\(F^l \in \mathbb{R}^{N_l \times M_l}\)を、層\(l\)における画像に対するフィルタ応答の行列とします。ここで、\(N_l\)は層\(l\)のフィルタ数、\(M_l\)は各フィルタ応答の高さ×幅(ピクセル数)です。
アプリケーションと影響
NSTは消費者向けアプリケーション、特にユーザーが写真に芸術的スタイルをリアルタイムで適用できるモバイルアプリで広く使用されています。DeepArtとPrismaは最も注目すべきものの1つであり、一般の観客にこの技術を普及させました。消費者向けアプリを超えて、NSTはデジタルアーティストやデザイナーが新しいアートワークを作成するために採用されており、Generative AIや画像生成におけるその後の研究に影響を与えました。ニューラル表現でコンテンツとスタイルを分離するこの技術の能力は、スタイルベースのジェネレータやドメイン適応など、Deep learningの他の分野の研究にも情報を提供しています。
関連技術と進化
NSTは、深層学習に先行する画像スタイライゼーション手法のより広いファミリーの一部であり、画像アナロジーや画像キルティングなどのパッチベースのアプローチを含みます。深層ニューラルネットワークの導入は、より柔軟で高品質なスタイル転送を可能にし、重要な進歩を示しました。その後の開発、例えば2017年のGoogle AIによるマルチスタイル学習手法は、効率とリアルタイムパフォーマンスを改善しました。NSTは他のNeural networkベースの画像操作技術にも関連しており、その原理は現代のGenerative AIシステムに統合されていますが、それらは畳み込みネットワークではなくTransformer (architecture)モデルなどの異なるアーキテクチャを使用することがよくあります。
制限と考慮事項
初期のNST手法は計算集約的であり、各出力画像に対して反復最適化を必要としましたが、後のフィードフォワードネットワークを使用するアプローチはこのコストを削減しました。結果の品質は層と損失重みの選択に依存し、この手法は時々アーティファクトを生成したり、細部を保存できないことがあります。多くのArtificial intelligence技術と同様に、NSTは派生的なアートワークを作成する際に著作者性と独創性に関する疑問を提起しますが、これらはNSTに固有のものではありません。