Transfert de style neuronal

Traduit de l'anglais

Le transfert de style neuronal (NST) est une technique d'apprentissage profond qui applique le style visuel d'une image au contenu d'une autre image, en utilisant des réseaux de neurones pour générer de nouvelles œuvres d'art. Elle a été introduite en 2015 par Leon Gatys et ses collègues.

Le transfert de style neuronal (NST) est une classe d'algorithmes logiciels qui manipulent des images numériques ou des vidéos pour adopter l'apparence ou le style visuel d'une autre image. Les algorithmes NST se caractérisent par leur utilisation de réseaux de neurones profonds pour la transformation d'images. Les utilisations courantes incluent la création d'œuvres d'art artificielles à partir de photographies, comme le transfert de l'apparence de peintures célèbres vers des photos fournies par l'utilisateur. Des applications mobiles notables comme DeepArt et Prisma utilisent des techniques NST, et des artistes et designers du monde entier utilisent cette méthode pour développer de nouvelles œuvres basées sur des styles existants.

Le NST est un exemple de stylisation d'image, un problème étudié depuis plus de deux décennies dans le domaine du rendu non photoréaliste. Les deux premiers algorithmes de transfert de style basés sur des exemples étaient les analogies d'images et le quilting d'images, tous deux basés sur la synthèse de textures par patchs. Les analogies d'images nécessitaient une paire d'images d'entraînement (une photo et une œuvre d'art la représentant) pour apprendre une transformation, tandis que le quilting d'images ne nécessitait pas cette étape de traitement mais n'était démontré que sur un seul style.

Historique

La première méthode NST a été publiée dans l'article « A Neural Algorithm of Artistic Style » de Leon Gatys et al., initialement diffusé sur ArXiv en 2015 et accepté à la conférence CVPR en 2016. L'article original utilisait une architecture VGG-19 pré-entraînée pour la reconnaissance d'objets sur le jeu de données ImageNet. En 2017, Google AI a introduit une méthode permettant à un seul réseau convolutif de transfert de style d'apprendre plusieurs styles simultanément, permettant une interpolation de style en temps réel, même sur des vidéos.

Mathématiques

L'idée du NST est de prendre deux images : une image de contenu \(\vec{p}\) et une image de style \(\vec{a}\), et de générer une troisième image \(\vec{x}\) qui minimise une combinaison pondérée de deux fonctions de perte : une perte de contenu \(\mathcal{L}_{\text{content}}(\vec{p}, \vec{x})\) et une perte de style \(\mathcal{L}_{\text{style}}(\vec{a}, \vec{x})\). La perte totale est une somme linéaire : \(\mathcal{L}_{\text{NST}}(\vec{p}, \vec{a}, \vec{x}) = \alpha \mathcal{L}_{\text{content}}(\vec{p}, \vec{x}) + \beta \mathcal{L}_{\text{style}}(\vec{a}, \vec{x})\). En minimisant conjointement ces pertes, le NST génère une image mélangeant le contenu de l'image de contenu avec le style de l'image de style.

Les deux pertes mesurent la similarité entre les images. La similarité de contenu est la somme pondérée des différences au carré entre les activations neuronales d'un seul réseau de neurones convolutif (CNN) sur deux images. La similarité de style est la somme pondérée des matrices de Gram dans chaque couche. L'article original utilisait un CNN VGG-19, mais la méthode fonctionne avec n'importe quel CNN.

Symboles

Soit \(\vec{x}\) une image d'entrée dans un CNN. Soit \(F^l \in \mathbb{R}^{N_l \times M_l}\) la matrice des réponses des filtres dans la couche \(l\) à l'image, où \(N_l\) est le nombre de filtres dans la couche \(l\), et \(M_l\) est la hauteur multipliée par la largeur (nombre de pixels) de chaque réponse de filtre.

Applications et impact

Le NST a trouvé une utilisation répandue dans les applications grand public, en particulier les applications mobiles qui permettent aux utilisateurs d'appliquer des styles artistiques à leurs photos en temps réel. DeepArt et Prisma sont parmi les plus notables, popularisant la technique auprès d'un large public. Au-delà des applications grand public, le NST a été adopté par les artistes numériques et les designers pour créer des œuvres novatrices, et il a influencé la recherche ultérieure dans le domaine de l'IA générative et de la génération d'images. La capacité de la technique à séparer le contenu du style dans les représentations neuronales a également informé les travaux dans d'autres domaines du apprentissage profond, comme les générateurs basés sur le style et l'adaptation de domaine.

Techniques connexes et évolution

Le NST fait partie d'une famille plus large de méthodes de stylisation d'images qui précèdent l'apprentissage profond, y compris les approches basées sur des patchs comme les analogies d'images et le quilting d'images. L'introduction des réseaux de neurones profonds a marqué une avancée significative, permettant un transfert de style plus flexible et de meilleure qualité. Des développements ultérieurs, comme la méthode Google AI de 2017 pour l'apprentissage multi-styles, ont amélioré l'efficacité et les performances en temps réel. Le NST est également lié à d'autres techniques de manipulation d'images basées sur les réseaux de neurones, et ses principes ont été intégrés dans les systèmes modernes d'IA générative, bien que ceux-ci utilisent souvent des architectures différentes comme les modèles transformeurs plutôt que des réseaux convolutifs.

Limites et considérations

Les premières méthodes NST étaient intensives en calcul, nécessitant une optimisation itérative pour chaque image de sortie, bien que des approches ultérieures utilisant des réseaux à propagation directe aient réduit ce coût. La qualité des résultats dépend du choix des couches et des poids de perte, et la méthode peut parfois produire des artefacts ou échouer à préserver les détails fins. Comme pour de nombreuses techniques d'intelligence artificielle, le NST soulève des questions sur la paternité et l'originalité lorsqu'il est utilisé pour créer des œuvres dérivées, bien que celles-ci ne soient pas propres au NST.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:deep-learning·image-processing·computer-vision·artificial-intelligence
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique