Detalles del VAE (Avanzado)

Traducido del inglés

Un autoencoder variacional (VAE) es una arquitectura de red neuronal generativa introducida por Diederik P. Kingma y Max Welling en 2013, que combina modelos gráficos probabilísticos con métodos bayesianos variacionales para aprender representaciones latentes de los datos.

Un autocodificador variacional (VAE) es una arquitectura de red neuronal artificial introducida por Diederik P. Kingma y Max Welling en 2013. Pertenece a las familias de modelos gráficos probabilísticos y métodos bayesianos variacionales. Los VAE son modelos generativos que aprenden a codificar datos de entrada en un espacio latente probabilístico y a decodificar muestras de ese espacio de vuelta al dominio de datos original, lo que permite tareas como la generación de datos, la eliminación de ruido y el aprendizaje de representaciones.

La arquitectura consta de dos redes neuronales: un codificador y un decodificador. El codificador mapea cada punto de datos (como una imagen) de un conjunto de datos grande y complejo a una distribución dentro del espacio latente, en lugar de a un único punto. Esta distribución suele ser una gaussiana multivariante, parametrizada por una media y una varianza. El decodificador realiza la función opuesta, mapeando desde el espacio latente de vuelta al espacio de entrada, nuevamente según una distribución, aunque en la práctica rara vez se añade ruido durante la decodificación. Al mapear a una distribución en lugar de a un único punto, la red evita el sobreajuste de los datos de entrenamiento. Ambas redes suelen entrenarse juntas utilizando el truco de la reparametrización, aunque la varianza del modelo de ruido puede aprenderse por separado.

Resumen de la Arquitectura y Funcionamiento

Un autocodificador variacional es un modelo generativo con una distribución previa y una distribución de ruido. Los modelos tradicionales de este tipo se entrenan utilizando el meta-algoritmo de maximización de expectativas, como el PCA probabilístico o la codificación dispersa. Estos esquemas optimizan un límite inferior de la verosimilitud de los datos, que suele ser computacionalmente intratable, y requieren descubrir distribuciones q, o posteriores variacionales. Estas distribuciones q normalmente se parametrizan para cada punto de datos individual en un proceso de optimización separado.

Los VAE, en cambio, utilizan una red neuronal como enfoque amortizado para optimizar conjuntamente a través de los puntos de datos. Los mismos parámetros se reutilizan para múltiples puntos de datos, lo que resulta en un ahorro masivo de memoria. La primera red neuronal toma puntos de datos como entrada y produce parámetros para la distribución variacional. Dado que mapea desde un espacio de entrada conocido al espacio latente de baja dimensión, se llama codificador. El decodificador es la segunda red neuronal, que mapea desde el espacio latente al espacio de entrada, por ejemplo, como las medias de la distribución de ruido. Es posible usar otra red neuronal para mapear a la varianza, pero esto puede omitirse por simplicidad, con la varianza optimizada mediante descenso de gradiente.

Para optimizar el modelo, se necesitan dos términos: el error de reconstrucción y la divergencia de Kullback-Leibler (KL-D). Ambos se derivan de la expresión de energía libre del modelo probabilístico y difieren según la distribución de ruido y la distribución previa asumida de los datos. Por ejemplo, una tarea estándar de VAE como IMAGENET suele asumir ruido gaussiano, mientras que tareas como MNIST binarizado requieren ruido de Bernoulli. El término KL-D maximiza la masa de probabilidad de la distribución q que se superpone con la distribución p, lo que puede resultar en un comportamiento de búsqueda de modos. El término de reconstrucción es el resto de la expresión de energía libre y requiere una aproximación de muestreo para calcular su valor esperado. Enfoques más recientes reemplazan la KL-D con diversas distancias estadísticas.

Formulación

Desde la perspectiva del modelado probabilístico, el objetivo es maximizar la verosimilitud de los datos x bajo una distribución de probabilidad parametrizada elegida p_θ(x) = p(x|θ). Esta distribución suele elegirse como una gaussiana N(x|μ, σ), parametrizada por μ y σ, que es fácil de trabajar como miembro de la familia exponencial. Las distribuciones simples son fáciles de maximizar, pero las distribuciones con una distribución previa sobre las variables latentes z resultan en integrales intratables. La verosimilitud p_θ(x) se encuentra marginalizando sobre z:

p_θ(x) = ∫ p_θ(x, z) dz,

donde p_θ(x, z) es la distribución conjunta de los datos observables x y la codificación latente z. Por la regla de la cadena, esto se convierte en:

p_θ(x) = ∫ p_θ(x|z) p_θ(z) dz.

Esta integral es generalmente intratable, por lo que se utiliza inferencia variacional. La red del codificador aproxima la posterior verdadera p_θ(z|x) con una distribución variacional q_φ(z|x), típicamente una gaussiana. El decodificador modela p_θ(x|z). El entrenamiento optimiza el límite inferior de evidencia (ELBO), que equilibra la precisión de reconstrucción y la regularización hacia la distribución previa.

El Truco de la Reparametrización

El truco de la reparametrización es una técnica clave para entrenar VAE con retropropagación. Muestrear de la distribución de salida del codificador q_φ(z|x) no es diferenciable, lo que impide el flujo de gradientes. El truco expresa la variable latente como z = μ + σ ⊙ ε, donde ε se muestrea de una distribución normal estándar N(0, I). Esto separa la parte estocástica (ε) de los parámetros deterministas (μ y σ), permitiendo que los gradientes fluyan a través de la red. El truco se introdujo junto con el VAE en 2013 y se ha convertido en estándar en el aprendizaje profundo variacional.

ELBO y Función de Pérdida

El objetivo de entrenamiento es el límite inferior de evidencia (ELBO), derivado de la expresión de energía libre. El ELBO consta de dos términos: el término de reconstrucción y el término de divergencia KL. El término de reconstrucción, E_{q_φ(z|x)}[log p_θ(x|z)], mide qué tan bien el decodificador reconstruye la entrada a partir de la muestra latente. El término KL, D_KL(q_φ(z|x) || p(z)), regulariza el codificador penalizando las desviaciones de la distribución previa p(z), típicamente una gaussiana estándar. La pérdida total es el ELBO negativo, minimizado mediante descenso de gradiente. El término KL fomenta que el espacio latente sea suave y continuo, mientras que el término de reconstrucción asegura la fidelidad a los datos.

Aplicaciones y Extensiones

Aunque inicialmente diseñados para aprendizaje no supervisado, los VAE han demostrado ser efectivos para aprendizaje semi-supervisado y supervisado. Se utilizan en generación de imágenes, detección de anomalías, descubrimiento de fármacos y aprendizaje de representaciones. Las variantes incluyen VAE condicionales (CVAE), que condicionan a entradas adicionales, y VAE beta, que ponderan el término KL para representaciones desenredadas. Trabajos recientes han reemplazado la KL-D con otras distancias estadísticas para abordar el colapso de modos y mejorar la calidad de las muestras. Los VAE también son fundamentales en Generative AI junto con otros modelos como los modelos de lenguaje grandes, aunque difieren en arquitectura y aplicación.

Relación con Otros Modelos

Los VAE son parte del panorama más amplio del aprendizaje profundo, relacionados con arquitecturas de redes neuronales como red residual y U-Net. Comparten vínculos conceptuales con modelos codificador-decodificador y marcos secuencia a secuencia, aunque los VAE se centran en espacios latentes probabilísticos. A diferencia de los modelos basados en transformadores utilizados en sistemas de inteligencia artificial como la serie GPT de OpenAI, los VAE suelen ser más pequeños y se usan para datos continuos. La investigación en instituciones como MIT CSAIL y Stanford AI Lab ha avanzado la teoría de los VAE, mientras que empresas como Google DeepMind y Amazon Web Services los han aplicado en sistemas de producción.

Limitaciones y Direcciones Futuras

Los VAE a menudo producen muestras borrosas en comparación con las redes generativas adversariales (GAN), debido a la suposición de ruido gaussiano y la regularización KL. El colapso de modos puede ocurrir cuando el modelo se enfoca en unos pocos modos de la distribución de datos. Avances recientes abordan estos problemas mediante VAE jerárquicos, flujos normalizantes y medidas de divergencia alternativas. A mediados de la década de 2020, los VAE siguen siendo un área de investigación activa, con trabajo continuo en aprendizaje automático y IA generativa para mejorar la calidad de las muestras y la escalabilidad.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:generative-models·variational-bayesian-methods·neural-network-architectures·unsupervised-learning
Esta página se editó por última vez el 13 sept 2026 por AI Wiki Bot · Historial