Traducido del inglés

VQGAN (Red Generativa Adversaria de Cuantificación Vectorial) es un modelo generativo que combina la cuantificación vectorial con el entrenamiento adversarial para la síntesis de imágenes de alta resolución, introducido en 2021 por investigadores de la Universidad de Heidelberg y el IWR.

VQGAN (Red Generativa Adversaria Cuantizada por Vectores) es una clase de arquitecturas de red neuronal generativas diseñadas para la síntesis de imágenes de alta resolución. Combina el aprendizaje de representaciones latentes discretas de la cuantización vectorial (VQ) con las mejoras perceptuales de una red generativa adversaria (GAN). Introducida en un artículo de 2021 por Patrick Esser, Robin Rombach y Björn Ommer en la Universidad de Heidelberg y el IWR, VQGAN se convirtió en un componente fundamental para modelos posteriores de texto a imagen, incluidos los modelos de difusión latente utilizados en Stable Diffusion.

La idea central de VQGAN es aprender un código discreto y comprimido de características visuales a partir de imágenes de entrenamiento. Una red codificadora mapea una imagen de entrada a una secuencia de índices dentro de este código, y una red decodificadora reconstruye la imagen a partir de dichos índices. Un discriminador de GAN se entrena junto con el codificador y el decodificador para garantizar que las imágenes reconstruidas sean perceptualmente indistinguibles de las reales, mientras que una pérdida perceptual basada en una red preentrenada (como VGG) mejora aún más la fidelidad. Este enfoque permite a VQGAN generar imágenes con resoluciones de 1024x1024 píxeles o más, algo que resultaba difícil para modelos anteriores como VQ-VAE.

Arquitectura y entrenamiento

La arquitectura de VQGAN consta de tres componentes principales: un codificador, un decodificador y un código de vectores aprendibles. El codificador reduce la resolución de la imagen de entrada hasta convertirla en una cuadrícula espacial de códigos latentes, cada uno cuantizado al vector más cercano del código. El decodificador aumenta la resolución de estos códigos para devolverlos al espacio de la imagen. El entrenamiento minimiza una combinación de pérdida de reconstrucción (L2), pérdida perceptual y una pérdida de compromiso que incentiva que las salidas del codificador permanezcan cerca de las entradas del código. El discriminador de GAN, típicamente un PatchGAN, se entrena de forma adversarial para distinguir entre imágenes reales y reconstruidas, empujando al decodificador a producir detalles más nítidos.

Una innovación clave fue el uso de un transformador, como un Transformer, para modelar la secuencia de códigos. Al tratar los códigos discretos como tokens, el transformador puede aprender dependencias globales y generar imágenes novedosas de forma autorregresiva, lo que permite una estructura coherente a gran escala. Este enfoque híbrido, con un codificador-decodificador convolucional y una prioridad basada en transformador, permitió a VQGAN capturar tanto la textura local como el contexto global.

Aplicaciones en difusión latente

La aplicación más influyente de VQGAN surgió con su integración en los modelos de difusión latente. En el artículo de 2022 "Síntesis de imágenes de alta resolución con modelos de difusión latente", Rombach y sus colegas utilizaron un autoencoder estilo VQGAN para comprimir imágenes en un espacio latente de menor dimensión. El modelo de difusión operaba entonces sobre estos latentes en lugar de sobre los píxeles brutos, lo que reducía drásticamente el coste computacional sin sacrificar la calidad de la imagen. Esta arquitectura se convirtió en la base de Stable Diffusion, un sistema de texto a imagen ampliamente utilizado. El componente VQGAN en estos modelos se denomina a menudo "VAE" (autoencoder variacional) en el ecosistema de Stable Diffusion, aunque conserva el diseño de cuantización vectorial.

Comparación con otros modelos generativos

A diferencia de las GAN puras como StyleGAN, que generan imágenes directamente a partir de un vector de ruido, VQGAN produce una representación latente discreta que puede manipularse y editarse. Esta propiedad la hace adecuada para tareas como la inpaintación de imágenes, la superresolución y la síntesis semántica. En comparación con VQ-VAE, VQGAN añade pérdidas adversariales y perceptuales, lo que mejora significativamente la nitidez y el realismo de las salidas. Sin embargo, la dependencia de VQGAN de un código y de una prioridad basada en transformador hace que su entrenamiento sea más complejo y computacionalmente intensivo que el de autoencoders más simples.

Legado e impacto

VQGAN influyó en investigaciones posteriores en deep learning y inteligencia artificial, especialmente en el campo del modelado generativo. Su concepto de espacio latente discreto fue adoptado en diversos modelos multimodales y contribuyó al desarrollo de large language models que incorporan tokens visuales. El código y los modelos preentrenados se publicaron de forma abierta, lo que permitió una experimentación generalizada. A partir de 2025, VQGAN sigue siendo un punto de referencia para comprender los compromisos entre las representaciones latentes discretas y continuas en la generación de imágenes, y sus principios continúan informando arquitecturas más recientes en la comunidad de machine learning.

Limitaciones

A pesar de sus fortalezas, VQGAN tiene limitaciones conocidas. El tamaño y la dimensión del código requieren un ajuste cuidadoso; un código demasiado pequeño provoca pérdida de detalle, mientras que uno demasiado grande aumenta el uso de memoria. La prioridad basada en transformador puede ser lenta al muestrear, especialmente en imágenes de alta resolución. Además, el modelo puede presentar artefactos como desenfoque en regiones uniformes o patrones repetitivos, particularmente cuando el código no es lo suficientemente expresivo. Estas cuestiones motivaron enfoques posteriores que se orientaron hacia latentes continuos, como se observa en algunos modelos de difusión.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:generative-ai·computer-vision·deep-learning·image-synthesis
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial