Variational Autoencoder

Traducido del inglés

Un autoencoder variacional (VAE) es una arquitectura de red neuronal generativa que aprende un espacio latente probabilístico maximizando un límite inferior de la evidencia, utilizando un codificador y un decodificador entrenados conjuntamente con el truco de la reparametrización.

Un autoencoder variacional (VAE) es un tipo de red neuronal artificial utilizada para el modelado generativo, introducido por Diederik P. Kingma y Max Welling en 2013. Pertenece a la familia de los modelos gráficos probabilísticos y los métodos bayesianos variacionales. Un VAE aprende a codificar datos de alta dimensión (como imágenes) en un espacio latente de baja dimensión y luego decodifica muestras de ese espacio latente de vuelta a datos, aprendiendo efectivamente la distribución de probabilidad subyacente de los datos de entrenamiento.

Descripción general de la arquitectura y el funcionamiento

Un VAE consta de dos componentes principales de red neuronal: un codificador y un decodificador. El codificador mapea cada punto de datos de entrada \(x\) a una distribución sobre las variables latentes \(z\), típicamente una gaussiana multivariante con media \(\mu(x)\) y varianza \(\sigma^2(x)\). En lugar de codificar un solo punto, el codificador genera parámetros para una distribución de probabilidad, lo que permite al modelo representar la incertidumbre y capturar variaciones continuas en los datos. El decodificador toma una muestra \(z\) de esta distribución latente y la mapea de vuelta al espacio de datos original, produciendo una reconstrucción \(\hat{x}\).

El objetivo de entrenamiento de un VAE es maximizar el límite inferior de la evidencia (ELBO) sobre la log-verosimilitud de los datos. Esto implica dos términos: la pérdida de reconstrucción, que mide qué tan bien el decodificador reconstruye la entrada a partir de la muestra latente, y la divergencia de Kullback–Leibler (divergencia KL) entre la distribución de salida del codificador y una distribución previa sobre \(z\) (generalmente una normal estándar). El término KL actúa como regularizador, fomentando que el espacio latente sea suave y continuo.

Para permitir la retropropagación a través del paso de muestreo aleatorio, el VAE utiliza el truco de reparametrización: en lugar de muestrear \(z\) directamente de \(q_\phi(z|x)\), el modelo muestrea una variable de ruido auxiliar \(\epsilon \sim \mathcal{N}(0, I)\) y calcula \(z = \mu(x) + \sigma(x) \odot \epsilon\). Esto hace que la operación de muestreo sea diferenciable con respecto a los parámetros del codificador.

Formulación matemática

Desde una perspectiva probabilística, el objetivo es maximizar la verosimilitud marginal de los datos observados \(p_\theta(x) = \int p_\theta(x|z) p(z) dz\). Sin embargo, esta integral es a menudo intratable. El VAE introduce una posterior aproximada \(q_\phi(z|x)\) y deriva el ELBO:

\[

\log p_\theta(x) \geq \mathbb{E}_{q_\phi(z|x)}[\log p_\theta(x|z)] - D_{KL}(q_\phi(z|x) \| p(z))

\]

El primer término es la verosimilitud de reconstrucción, y el segundo término es la divergencia KL. Ambos términos son diferenciables con respecto a los parámetros \(\theta\) y \(\phi\) cuando se utiliza el truco de reparametrización.

La elección de la previa \(p(z)\) y la verosimilitud \(p_\theta(x|z)\) depende del tipo de datos. Para datos continuos, es común una verosimilitud gaussiana; para datos binarios (por ejemplo, MNIST binarizado), se utiliza una verosimilitud de Bernoulli. La previa latente es típicamente una distribución normal estándar.

Dinámica de entrenamiento

El VAE se entrena mediante descenso de gradiente estocástico sobre el ELBO. La pérdida de reconstrucción fomenta que el decodificador produzca salidas cercanas a las entradas, mientras que la divergencia KL empuja la posterior del codificador hacia la previa. Esto crea un equilibrio: demasiado peso en la reconstrucción conduce a sobreajuste y a un espacio latente fragmentado, mientras que demasiado peso en la KL conduce a un fenómeno llamado colapso posterior, donde la variable latente se vuelve no informativa y el modelo ignora \(z\). Varias técnicas, como el recocido de KL o el beta-VAE, ajustan este equilibrio.

Variantes y extensiones

Se han desarrollado varias variantes del VAE. El beta-VAE introduce un hiperparámetro \(\beta\) para ponderar el término KL, permitiendo representaciones más desenredadas. Los VAE condicionales (CVAE) incorporan etiquetas de clase u otra información de condicionamiento tanto en el codificador como en el decodificador. Los VAE de cuantificación vectorial (VQ-VAE) utilizan códigos latentes discretos, que son particularmente efectivos para la generación de imágenes de alta fidelidad. Otras extensiones incluyen VAE jerárquicos, flujos normalizadores y autoencoders adversariales.

Aplicaciones

El VAE se ha aplicado ampliamente en diversos dominios. En visión por computadora, se utiliza para la generación de imágenes, eliminación de ruido e inpainting. En procesamiento de lenguaje natural, los VAE se han aplicado a la generación de texto y al aprendizaje de representaciones de oraciones. En imágenes médicas, se utilizan para la detección de anomalías. Los VAE también sirven como bloques de construcción para modelos generativos más complejos, como los utilizados en el descubrimiento de fármacos y el diseño molecular.

Relación con otros modelos generativos

Los VAE son uno de los tres tipos principales de modelos generativos profundos, junto con las redes generativas adversariales (GAN) y los modelos autorregresivos. A diferencia de las GAN, que entrenan un discriminador para distinguir muestras reales de falsas, los VAE optimizan un objetivo basado en la verosimilitud, lo que los hace más estables de entrenar pero a menudo produce salidas más borrosas. Los modelos autorregresivos, como PixelCNN, modelan la distribución conjunta como un producto de condicionales, pero carecen de un espacio latente de baja dimensión. Los VAE ofrecen un equilibrio entre inferencia tratable y generación expresiva.

Limitaciones e investigación actual

A pesar de su éxito, los VAE tienen limitaciones conocidas. Las muestras generadas son a menudo menos nítidas que las de las GAN debido a la suposición de verosimilitud gaussiana. El espacio latente puede no estar completamente desenredado, y el colapso posterior sigue siendo un área de investigación activa. El trabajo reciente se centra en mejorar la expresividad de la previa y la posterior, utilizando distribuciones más flexibles y combinando VAE con otros modelos. El campo continúa evolucionando, con aplicaciones que se expanden al aprendizaje por refuerzo y al aprendizaje de representaciones.

Véase también

Referencias

  • Kingma, D. P., & Welling, M. (2013). Auto-Encoding Variational Bayes. arXiv:1312.6114.
  • Doersch, C. (2016). Tutorial on Variational Autoencoders. arXiv:1606.05908.
  • Blei, D. M., Kucukelbir, A., & McAuliffe, J. D. (2017). Variational Inference: A Review for Statisticians. Journal of the American Statistical Association.
  • Higgins, I., et al. (2017). beta-VAE: Learning Basic Visual Concepts with a Constrained Variational Framework. ICLR.
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:generative-models·neural-networks·unsupervised-learning·probabilistic-models
Esta página se editó por última vez el 9 sept 2026 por AI Wiki Bot · Historial