神经风格迁移

译自英文

神经风格迁移(NST)是一种深度学习技术,利用神经网络将一幅图像的视觉风格应用于另一幅图像的内容,从而生成新的艺术作品。该技术由Leon Gatys及其同事于2015年提出。

神经风格迁移(NST)是一类软件算法,用于处理数字图像或视频,使其采用另一幅图像的外观或视觉风格。NST算法的特点在于使用深度神经网络进行图像变换。常见用途包括从照片创作人工艺术品,例如将著名画作的外观转移到用户提供的照片上。DeepArt和Prisma等知名移动应用采用了NST技术,世界各地的艺术家和设计师也使用该方法基于现有风格创作新艺术作品。

NST是图像风格化的一个实例,这一课题在非真实感渲染领域已被研究二十多年。最早的两种基于示例的风格迁移算法是图像类比和图像拼接,两者都基于补丁纹理合成。图像类比需要一对训练图像(一张照片和一幅描绘该照片的艺术作品)来学习变换,而图像拼接则不需要这一处理步骤,但仅在一个风格上进行了演示。

历史

首个NST方法发表于论文《一种艺术风格的神经算法》,作者为Leon Gatys等人,该论文最初于2015年发布在ArXiv上,并于2016年被CVPR会议接收。原始论文使用了在ImageNet数据集上预训练用于物体识别的VGG-19架构。2017年,Google AI引入了一种方法,使单个深度卷积风格迁移网络能够同时学习多种风格,从而实现了即使在视频媒体上的实时风格插值。

数学

NST的思想是取两幅图像:内容图像\(\vec{p}\)和风格图像\(\vec{a}\),并生成第三幅图像\(\vec{x}\),该图像最小化两个损失函数的加权组合:内容损失\(\mathcal{L}_{\text{content}}(\vec{p}, \vec{x})\)和风格损失\(\mathcal{L}_{\text{style}}(\vec{a}, \vec{x})\)。总损失是线性求和:\(\mathcal{L}_{\text{NST}}(\vec{p}, \vec{a}, \vec{x}) = \alpha \mathcal{L}_{\text{content}}(\vec{p}, \vec{x}) + \beta \mathcal{L}_{\text{style}}(\vec{a}, \vec{x})\)。通过联合最小化这些损失,NST生成一幅融合了内容图像内容与风格图像风格的图像。

两个损失都衡量图像之间的相似性。内容相似性是单个卷积神经网络(CNN)对两幅图像神经激活之间差异的加权平方和。风格相似性是每层内Gram矩阵的加权和。原始论文使用了VGG-19 CNN,但该方法适用于任何CNN。

符号

设\(\vec{x}\)为输入到CNN的图像。设\(F^l \in \mathbb{R}^{N_l \times M_l}\)为层\(l\)中滤波器响应对该图像的矩阵,其中\(N_l\)是层\(l\)中滤波器的数量,\(M_l\)是每个滤波器响应的高度乘以宽度(像素数)。

应用与影响

NST在消费应用中得到了广泛使用,特别是允许用户实时将艺术风格应用于照片的移动应用。DeepArt和Prisma是最著名的应用之一,将该技术普及给普通受众。除了消费应用外,NST还被数字艺术家和设计师用于创作新颖艺术作品,并影响了后续在Generative AI和图像生成方面的研究。该技术在神经表示中分离内容与风格的能力,也为Deep learning其他领域的工作提供了参考,例如基于风格的生成器和域适应。

相关技术与演进

NST是更广泛的图像风格化方法家族的一部分,这些方法早于深度学习,包括基于补丁的方法,如图像类比和图像拼接。深度神经网络的引入标志着重大进步,使得更灵活、更高质量的风格迁移成为可能。后来的发展,如2017年Google AI的多风格学习方法,提高了效率和实时性能。NST还与其他基于Neural network的图像处理技术相关,其原理已被整合到现代Generative AI系统中,尽管这些系统通常使用不同的架构,如Transformer (architecture)模型,而非卷积网络。

局限性与考虑

早期NST方法计算密集,需要对每个输出图像进行迭代优化,尽管后来使用前馈网络的方法降低了这一成本。结果质量取决于层和损失权重的选择,该方法有时可能产生伪影或无法保留精细细节。与许多Artificial intelligence技术一样,NST在创作衍生艺术作品时引发了关于作者身份和原创性的问题,尽管这些问题并非NST独有。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:deep-learning·image-processing·computer-vision·artificial-intelligence
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史