Traduit de l'anglais

StyleGAN est une architecture de réseau antagoniste génératif introduite par NVIDIA en décembre 2018 pour la génération d'images synthétiques de haute qualité, en particulier des visages humains photoréalistes. Elle étend les GAN antérieurs avec une croissance progressive et un contrôle basé sur le style.

StyleGAN (Style Generative Adversarial Network) est une architecture de modèle génératif introduite par des chercheurs de NVIDIA en décembre 2018. Il s'agit d'une extension du cadre GAN, conçue pour générer des images haute résolution et photoréalistes, notamment des visages humains. L'architecture permet un contrôle précis des caractéristiques de l'image grâce à un mécanisme basé sur le style, et son code source a été rendu public en février 2019.

StyleGAN s'appuie sur l'approche Progressive GAN, qui fait croître le générateur et le discriminateur de basse à haute résolution pendant l'entraînement. L'innovation clé réside dans l'injection de vecteurs de style à plusieurs échelles, permettant au modèle de contrôler indépendamment les détails grossiers et fins. L'implémentation originale reposait sur TensorFlow et le logiciel CUDA de NVIDIA, mais les versions ultérieures ont adopté PyTorch comme bibliothèque officielle.

Historique

Le prédécesseur direct de StyleGAN est le Progressive GAN, publié en 2017. En décembre 2018, des chercheurs de NVIDIA ont publié une prépublication et un logiciel associé pour StyleGAN, capable de produire une infinité de portraits convaincants de visages humains fictifs sur des GPU grand public. En février 2019, l'ingénieur d'Uber Phillip Wang a utilisé le logiciel pour créer le site This Person Does Not Exist, qui affichait un nouveau visage à chaque rechargement de page. Wang a exprimé son étonnement face au fait que, malgré l'évolution humaine pour comprendre les visages, StyleGAN pouvait dissocier les caractéristiques faciales pertinentes et les recomposer de manière cohérente.

En septembre 2019, le site Generated Photos a publié une collection de 100 000 images de stock créées avec StyleGAN, utilisant un ensemble de données privé pris dans un environnement contrôlé avec un éclairage et des angles cohérents. À peu près à la même époque, deux professeurs de l'école d'information de l'Université de Washington ont créé Which Face is Real?, un outil interactif qui défiait les visiteurs de distinguer les faux visages des vrais. Leur objectif était d'éduquer le public sur l'existence de cette technologie afin que les gens puissent s'en méfier, à l'instar de la sensibilisation généralisée à la manipulation par Photoshop.

StyleGAN2 a été publié le 5 février 2020, supprimant les artefacts caractéristiques et améliorant la qualité de l'image. StyleGAN3, décrit comme une version « sans alias », a été introduit le 23 juin 2021, avec un code source publié le 12 octobre 2021. Il a amélioré la cohérence entre les détails fins et grossiers et a été implémenté avec PyTorch.

Architecture

Progressive GAN

Le Progressive GAN est une méthode d'entraînement pour la génération d'images à grande échelle de manière stable. Il décompose le générateur comme \(G = G_1 \circ G_2 \circ \cdots \circ G_N\) et le discriminateur comme \(D = D_N \circ D_{N-1} \circ \cdots \circ D_1\). Initialement, seuls \(G_N\) et \(D_N\) sont utilisés pour générer des images 4x4. Ensuite, \(G_{N-1}\) et \(D_{N-1}\) sont ajoutés, permettant une génération 8x8, et ainsi de suite jusqu'à 1024x1024. Pour éviter les discontinuités, les nouvelles couches sont « fondues » à l'aide d'un facteur alpha qui passe progressivement de 0 à 1, avec des fonctions de sur-échantillonnage et de sous-échantillonnage.

StyleGAN

StyleGAN combine le Progressive GAN avec le transfert de style neuronal. Chaque image générée commence comme un tableau constant 4x4x512 et traverse des blocs de style. Chaque bloc de style applique un vecteur latent de style via une transformation affine (normalisation adaptative d'instance), similaire à la façon dont le transfert de style neuronal utilise des matrices de Gram. Il ajoute ensuite du bruit et normalise en soustrayant la moyenne et en divisant par la variance. Pendant l'entraînement, un vecteur latent de style est généralement utilisé par image, mais parfois deux (régularisation par mélange) pour encourager chaque bloc de style à fonctionner indépendamment.

Applications et impact

StyleGAN a été largement utilisé dans la recherche en IA et dans des applications créatives. Il a permis la génération réaliste de visages pour l'art, le design et les données synthétiques. La capacité de contrôler le style à différents niveaux a inspiré des modèles ultérieurs en IA générative. Cependant, il a également soulevé des préoccupations concernant un usage abusif, comme la création de faux profils ou de contenus trompeurs.

Usage illicite

En décembre 2019, Facebook a supprimé un réseau de comptes avec de fausses identités, notant que certains utilisaient des photos de profil créées avec des techniques d'apprentissage automatique. Cela a mis en évidence le potentiel de StyleGAN pour être utilisé dans la désinformation ou la fraude d'identité, suscitant des discussions sur la détection et les garanties éthiques.

Héritage

L'influence de StyleGAN s'étend au-delà de la génération de visages. Ses principes architecturaux, tels que la croissance progressive et la modulation du style, ont été adoptés dans divers modèles de deep learning. La publication du code source et des versions ultérieures (StyleGAN2 et StyleGAN3) en a fait une référence standard dans la recherche en apprentissage automatique, avec des implémentations disponibles dans des cadres majeurs comme PyTorch et TensorFlow.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:generative-ai·neural-network·computer-vision·nvidia
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique