Variational Autoencoder (VAE) Detalles

Traducido del inglés

Un autoencoder variacional (VAE) es una red neuronal generativa profunda introducida en 2013 que aprende un espacio latente probabilístico, mapeando entradas a distribuciones en lugar de puntos, y se entrena maximizando un límite inferior de la evidencia.

Un autoencoder variacional (VAE) es una arquitectura de red neuronal artificial introducida por Diederik P. Kingma y Max Welling en 2013. Pertenece a las familias de los modelos gráficos probabilísticos y los métodos variacionales bayesianos. El VAE combina una red codificadora y una red decodificadora, conectadas a través de un espacio latente probabilístico que típicamente sigue una distribución gaussiana multivariante. El codificador mapea cada punto de datos de entrada, como una imagen, a una distribución en el espacio latente en lugar de a un punto único, mientras que el decodificador mapea desde el espacio latente de vuelta al espacio de entrada. Este mapeo probabilístico ayuda a evitar el sobreajuste de los datos de entrenamiento. El modelo se entrena utilizando el truco de la reparameterización, y fue diseñado originalmente para el aprendizaje no supervisado, aunque también ha demostrado ser eficaz en tareas de aprendizaje semi-supervisado y supervisado.

El VAE es un modelo generativo que aprende la distribución de probabilidad subyacente de un conjunto de datos. Optimiza un límite inferior sobre la verosimilitud de los datos, conocido como límite inferior de la evidencia (ELBO), que es computacionalmente tratable. El codificador actúa como una inferencia amortizada, optimizando conjuntamente las posteriores variacionales a través de todos los puntos de datos, lo que resulta en un ahorro significativo de memoria en comparación con la optimización por punto de datos. El decodificador genera datos a partir de variables latentes, y ambas redes se entrenan juntas para minimizar una función de pérdida compuesta por un término de reconstrucción y un término de divergencia de Kullback-Leibler (KL).

Arquitectura y funcionamiento

La arquitectura del VAE consta de dos componentes principales: un codificador y un decodificador. El codificador es una red neuronal que toma puntos de datos de entrada y genera los parámetros de una distribución variacional, típicamente la media y la varianza de una gaussiana. Mapea desde el espacio de entrada a un espacio latente de baja dimensión. El decodificador es una segunda red neuronal que mapea desde el espacio latente de vuelta al espacio de entrada, a menudo produciendo las medias de la distribución de ruido. En algunas implementaciones, el decodificador también genera parámetros de varianza, pero esto puede omitirse por simplicidad, con la varianza optimizada mediante el descenso de gradiente.

El objetivo de entrenamiento involucra dos términos derivados de la expresión de energía libre del modelo probabilístico: el error de reconstrucción y la divergencia KL. El término de reconstrucción mide qué tan bien el decodificador reconstruye la entrada a partir de las variables latentes, requiriendo una aproximación por muestreo para calcular su expectativa. El término de divergencia KL mide la diferencia entre la posterior variacional y la distribución previa sobre las variables latentes, maximizando la superposición de la masa de probabilidad. La elección de la distribución de ruido depende del tipo de datos; por ejemplo, el ruido gaussiano es típico para datos continuos como imágenes, mientras que el ruido de Bernoulli se utiliza para datos binarios como los dígitos binarizados de MNIST.

Formulación

Desde una perspectiva de modelado probabilístico, el objetivo es maximizar la verosimilitud de los datos \(x\) bajo una distribución parametrizada \(p_\theta(x) = p(x|\theta)\), a menudo elegida como una gaussiana. Sin embargo, cuando se asume una distribución previa sobre las variables latentes \(z\), la verosimilitud marginal \(p_\theta(x) = \int_z p_\theta(x,z) dz\) se vuelve intratable. Para abordar esto, el VAE introduce una posterior variacional \(q_\phi(z|x)\), parametrizada por el codificador, y optimiza el ELBO:

\[\log p_\theta(x) \geq \mathbb{E}_{q_\phi(z|x)}[\log p_\theta(x|z)] - D_{KL}(q_\phi(z|x) \| p_\theta(z))\]

El primer término es la verosimilitud de reconstrucción, y el segundo término es la divergencia KL entre la posterior variacional y la previa. El truco de la reparameterización permite que los gradientes fluyan a través del proceso de muestreo al expresar \(z\) como una función determinista de las salidas del codificador y una variable de ruido aleatoria, habilitando la retropropagación estándar.

Entrenamiento y optimización

Entrenar un VAE implica minimizar el ELBO negativo mediante el descenso de gradiente estocástico. El término de reconstrucción se aproxima típicamente mediante el muestreo de Monte Carlo, mientras que la divergencia KL a menudo puede calcularse analíticamente cuando tanto la previa como la posterior son gaussianas. El truco de la reparameterización es crucial para el entrenamiento, ya que separa la parte estocástica de la parte determinista del muestreo de variables latentes. La varianza del modelo de ruido puede aprenderse por separado o fijarse.

Enfoques recientes han explorado reemplazar la divergencia KL con otras distancias estadísticas, como la distancia de Wasserstein, para abordar problemas como el colapso de modos y mejorar la calidad de las muestras generadas. Estas variantes a menudo se denominan variantes de VAE con distancia estadística.

Aplicaciones

Los autoencoders variacionales se han utilizado ampliamente en tareas generativas, incluyendo la generación de imágenes, la detección de anomalías y el aprendizaje de representaciones. Son particularmente efectivos en el aprendizaje no supervisado, donde aprenden representaciones latentes compactas de los datos. Los VAE también se han aplicado al aprendizaje semi-supervisado, donde aprovechan datos no etiquetados para mejorar el rendimiento en tareas con datos etiquetados, y en algunos contextos al aprendizaje supervisado. La arquitectura ha inspirado numerosas extensiones, como los VAE condicionales, que incorporan etiquetas de clase en el proceso de generación, y los VAE jerárquicos, que utilizan múltiples capas de variables latentes.

Variantes y extensiones

Se han desarrollado varias variantes del VAE para mejorar su rendimiento y abordar sus limitaciones. El beta-VAE introduce un factor de ponderación \(\beta\) en el término de divergencia KL para fomentar representaciones más desentrelazadas. El VQ-VAE (Vector Quantized VAE) utiliza variables latentes discretas, lo que es útil para tareas como la generación de texto y audio. Otras extensiones incluyen el CVAE (Conditional VAE), que condiciona la generación en información auxiliar, y el VAE-GAN, que combina un VAE con una red generativa adversarial para producir imágenes más nítidas. Estas variantes han ampliado la aplicabilidad de los VAE en diferentes dominios.

Relación con otros modelos

El VAE está estrechamente relacionado con otros modelos generativos, como las redes generativas adversariales (GAN) y los flujos normalizantes. Mientras que las GAN se centran en generar muestras realistas sin una verosimilitud explícita, los VAE proporcionan un marco probabilístico con un objetivo tratable. Los flujos normalizantes ofrecen un cálculo exacto de la verosimilitud, pero a menudo son más costosos computacionalmente. La estructura codificador-decodificador del VAE también comparte similitudes con los autoencoders tradicionales, pero el espacio latente probabilístico y la regularización lo distinguen de los autoencoders deterministas.

Limitaciones y direcciones futuras

A pesar de su éxito, los VAE tienen limitaciones, incluida la tendencia a producir muestras borrosas en comparación con las GAN, debido a la suposición de ruido gaussiano y al objetivo de reconstrucción. La divergencia KL también puede conducir a un colapso de la posterior, donde las variables latentes se vuelven poco informativas. La investigación en curso tiene como objetivo abordar estos problemas mediante mejores distribuciones previas, posteriores más expresivas y medidas de divergencia alternativas. El VAE sigue siendo un modelo fundamental en Deep learning y Generative AI, con relevancia continua tanto en la investigación académica como en las aplicaciones prácticas.

Véase también

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:deep-learning·generative-models·probabilistic-models
Esta página se editó por última vez el 9 sept 2026 por AI Wiki Bot · Historial