Traduzido do inglês

StyleGAN é uma arquitetura de rede adversária generativa introduzida pela NVIDIA em dezembro de 2018 para geração de imagens sintéticas de alta qualidade, especialmente rostos humanos fotorrealistas. Ela estende as GANs anteriores com crescimento progressivo e controle baseado em estilo.

StyleGAN (Style Generative Adversarial Network) é uma arquitetura de modelo generativo introducida por pesquisadores da NVIDIA em dezembro de 2018. É uma extensão da estrutura GAN, projetada para gerar imagens fotorrealistas de alta resolução, mais notoriamente rostros humanos. A arquitetura permite controle fino sobre características da imagem através de um mecanismo baseado em estilo, e seu código-fonte foi disponibilizado publicamente em fevereiro de 2019.

StyleGAN se basea na abordagem Progressive GAN, que faz crescer o generator e o discriminador de baixa a alta resolução durante o treinamento. A inovação principal é a injeção de vectores de estilo em múltiples escalas, permitendo que o modelo controle independentemente detalhes grosseiros e finos. A implementação original dependía de TensorFlow e do software CUDA da NVIDIA, mas versões posteriores adotaram PyTorch como biblioteca oficial.

História

O predecessor direto de StyleGAN é o Progressive GAN, publicado em 2017. Em dezembro de 2018, pesquisadores da NVIDIA lançaram um preprint e software acompanhante para StyleGAN, capaz de produzir retratos convincentes ilimitados de rostros humanos falsos em GPUs de consumo. Em fevereiro de 2019, o engenheiro da Uber Phillip Wang usou o software para criar o site This Person Does Not Exist, que exibía um novo rostro em cada recarga de página. Wang expressou admiração de que, apesar de que os humanos evoluíram para entender rostros, StyleGAN pudesse separar características faciais relevantes e recomponê-las de forma coerente.

Em setembro de 2019, o site Generated Photos publicou uma coleção de 100.000 imagens de stock criadas com StyleGAN, usando um conjunto de dados privado filmado em um ambiente controlado com iluminación e ângulos consistentes. Aproximadamente ao mesmo tempo, dois professores da Escola de Informação da Universidade de Washington criaron Which Face is Real?, uma herramienta interativa que desafiaba aos visitantes a distinguir rostros falsos de reais. Seu objetivo era educar ao público sobre a existência da tecnologia para que as pessoas pudessem estar alerta, similar à consciência generalizada sobre a manipulação em Photoshop.

StyleGAN2 foi publicado em 5 de fevereiro de 2020, eliminando artefatos característicos e melhorando a qualidade da imagem. StyleGAN3, descrito como uma versão "libre de alias", foi introducido em 23 de junho de 2021, com código-fonte lançado em 12 de outubro de 2021. Melhorou a consistência entre detalhes finos e grosseiros e foi implementado usando PyTorch.

Arquitectura

Progressive GAN

Progressive GAN é um método de treinamento para generação de imagens em grande escala de forma estáble. Descompone o generator como \(G = G_1 \circ G_2 \circ \cdots \circ G_N\) e o discriminador como \(D = D_N \circ D_{N-1} \circ \cdots \circ D_1\). Inicialmente, só se usan \(G_N\) e \(D_N\) para generar imágenes de 4x4. Después se añaden \(G_{N-1}\) e \(D_{N-1}\), permitendo generación de 8x8, e así sucesivamente hasta 1024x1024. Para evitar discontinuidades, novas capas se "mezclan" usando um factor alfa que transiciona suavemente de 0 a 1, com funções de up- e down-sampling.

StyleGAN

StyleGAN combina Progressive GAN com transferência de estilo neural. Cada imagem generada começa como um array constante de 4x4x512 e passa por blocos de estilo. Cada bloco de estilo aplica um vector de estilo latente via transformação afín (normalização adaptativa de instância), similar a como a transferência de estilo neural usa matrices de Gramian. Después añade ruido e normaliza subtraendo a média e dividendo pela variância. Durante o treinamento, tipicamente se usa um vector de estilo latente por imagem, mas ocasionalmente dois (regularização de mezcla) para incentivar que cada bloco de estilo opere independentemente.

Aplicações e Impacto

StyleGAN tem sido amplamente usado em pesquisa de IA e aplicações creativas. Permitiu generação de rostros realistas para arte, design e dados sintéticos. A capacidade de controlar estilo em diferentes níveis inspirou modelos subsequentes em IA generativa. No entanto, também levantou preocupações sobre uso indebido, como criação de perfiles falsos ou conteúdo enganoso.

Uso Ilícito

Em dezembro de 2019, Facebook retirou uma rede de contas com identidades falsas, notando que algumas usaban fotos de perfil creadas com técnicas de aprendizado automático. Isso destacou o potencial de StyleGAN para ser usado em desinformación ou fraude de identidade, provocando discussões sobre detección e salvaguardas éticas.

Legado

A influência de StyleGAN se extiende além da generación de rostros. Seus princípios arquitectónicos, como crescimento progressivo e modulación de estilo, têm sido adotados em vários modelos de aprendizado profundo. A liberación do código-fonte e versões subsequentes (StyleGAN2 e StyleGAN3) fizeron dele um benchmark padrão na pesquisa de aprendizado automático, com implementações disponibles em frameworks principais como PyTorch e TensorFlow.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:generative-ai·neural-network·computer-vision·nvidia
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico