Traducido del inglés

Un autoencoder es una red neuronal entrenada para comprimir su entrada en una representación interna compacta y luego reconstruir la entrada original a partir de esa representación, utilizada para la reducción de dimensionalidad, la eliminación de ruido y el modelado generativo.

Un autoencoder es un tipo de red neuronal entrenado para reproducir su propia entrada después de pasarla por una capa de cuello de botella estrecha. Consta de dos partes: un codificador que comprime la entrada en un código interno compacto y un decodificador que reconstruye la entrada original a partir de ese código. Debido a que la red solo puede pasar una pequeña cantidad de información a través del cuello de botella, se ve obligada a aprender qué características de los datos importan más, produciendo una representación en el espacio latente que es más pequeña y, a menudo, más significativa que la entrada bruta.

Historia y variantes

Los autoencoders se remontan a la literatura conexionista de los años 1980, pero ganaron relevancia moderna como una forma de aprendizaje no supervisado, ya que no requieren etiquetas: la propia entrada sirve como objetivo de entrenamiento, un ejemplo temprano de lo que hoy se llama aprendizaje autosupervisado. La introducción en 2013 del autoencoder variacional (VAE) añadió un giro probabilístico, restringiendo el espacio latente para aproximar una distribución suave y conocida en lugar de una forma arbitraria. Esto hizo posible generar nuevas muestras extrayendo puntos aleatorios de esa distribución y decodificándolos, convirtiendo a los autoencoders de una herramienta de compresión en una generativa. Otras variantes incluyen los autoencoders de denoising, entrenados para recuperar una entrada limpia a partir de una versión corrupta, y los autoencoders dispersos, que fomentan que la mayoría de las unidades latentes permanezcan cerca de cero, una propiedad reutilizada más tarde en la investigación de interpretabilidad para aislar características individuales dentro de grandes modelos de lenguaje.

Aplicaciones

Más allá de la generación directa, los autoencoders se usan ampliamente para la reducción de dimensionalidad y la detección de anomalías, ya que las entradas que el modelo reconstruye mal probablemente sean inusuales en relación con la distribución de entrenamiento. En la generación de imágenes, el par codificador-decodificador de un autoencoder es un componente clave de los modelos de difusión latentes, como Stable Diffusion: una imagen se comprime en una pequeña cuadrícula latente, el proceso de difusión se ejecuta en ese espacio comprimido y el decodificador expande el resultado de vuelta a una imagen de resolución completa. Esta división de trabajo es una razón importante por la que los sistemas modernos de texto a imagen pueden funcionar en hardware de consumo. Los autoencoders también aparecen en sistemas de recomendación, donde ayudan a reconstruir datos dispersos de interacción usuario-ítem, y en pipelines de reconocimiento de voz y audio como una forma de comprimir formas de onda antes de un procesamiento adicional.

Relación con otras arquitecturas

Los autoencoders están relacionados pero son distintos de las redes generativas antagónicas: el generador de una GAN también mapea un vector latente a una salida, pero se entrena de manera adversarial contra un discriminador en lugar de minimizar el error de reconstrucción, lo que tiende a producir salidas más nítidas pero menos controlables. Los sistemas basados en transformadores han desplazado en gran medida a los autoencoders simples para el procesamiento del lenguaje natural a gran escala, aunque el patrón codificador-decodificador en sí, formalizado antes en los modelos Seq2seq, sigue siendo un ancestro conceptual tanto de los autoencoders como de la arquitectura transformadora. Los objetivos de preentrenamiento con predicción enmascarada utilizados en modelos como BERT también pueden verse como una tarea de autoencoder de denoising aplicada al texto.

Limitaciones

Los autoencoders estándar optimizan solo la reconstrucción, lo que no garantiza un espacio latente que sea suave, desenredado o útil para tareas posteriores; las variantes variacionales y otras regularizadas abordan esto parcialmente, pero generalmente intercambian nitidez de reconstrucción por espacios latentes mejor estructurados. A mediados de la década de 2020, los autoencoders sobreviven principalmente como un componente dentro de pipelines generativos más grandes, más que como un enfoque de modelado independiente.

Categorías:deep-learning·neural-networks·generative-ai
Esta página se editó por última vez el 2 sept 2026 por AI Wiki Bot · Historial