Conexión residual

Traducido del inglés

Una conexión residual es un patrón de red neuronal que suma la entrada de una capa a su salida, permitiendo un entrenamiento estable de redes muy profundas. Fue popularizada por la arquitectura ResNet en 2015 y ahora es un componente estándar en modelos como los [[transformer|transformers]].

Una conexión residual es un motivo arquitectónico fundamental en el aprendizaje profundo donde la entrada de una capa se añade directamente a su salida, permitiendo que la red aprenda funciones residuales en lugar de la transformación completa. Formalmente, para una entrada \(x\) y una subred \(f\), la conexión residual calcula \(f(x) + x\). Esta simple adición estabiliza el entrenamiento y permite la construcción de redes neuronales con cientos o incluso miles de capas, que de otro modo sufrirían degradación y gradientes que se desvanecen. El concepto fue popularizado por la arquitectura de red residual (ResNet) en 2015, que ganó el desafío de reconocimiento visual a gran escala de ImageNet (ILSVRC) ese año, y desde entonces se ha convertido en un componente omnipresente en los sistemas modernos de aprendizaje profundo, incluidos los modelos transformador y los modelos de lenguaje grandes.

El término "conexión residual" se refiere específicamente al mapeo \(x \mapsto f(x) + x\), donde \(f\) es un módulo de red neuronal arbitrario. Aunque el motivo se había utilizado en trabajos anteriores, como en las redes de memoria a largo plazo (LSTM), la publicación de ResNet lo hizo ampliamente adoptado para redes de avance. Hoy en día, las conexiones residuales aparecen en arquitecturas aparentemente no relacionadas con ResNet, incluidos los modelos IA generativa, sistemas de redes neuronales para reconocimiento de imágenes y aplicaciones de aprendizaje automático en diversos dominios.

Matemáticas de las conexiones residuales

En una red neuronal multicapa, considere una subred con capas apiladas (por ejemplo, 2 o 3 capas) que mapea una entrada \(x\) a una salida \(H(x; \alpha)\), donde \(\alpha\) representa los parámetros. Sin conexiones residuales, la subred debe aprender directamente la salida óptima deseada \(H^\). Con una conexión residual, la subred aprende el residual \(H^ - x\), y la salida final es \(F(x; \alpha) = H(x; \alpha) + x\). Esta reparametrización facilita que la red aprenda mapeos de identidad, ya que la subred solo necesita ajustar la desviación de la entrada.

La operación se implementa mediante una "conexión de salto" que realiza un mapeo de identidad, conectando la entrada de la subred directamente a su salida. Esta conexión de salto es lo que se denomina conexión residual. La función \(F\) se representa típicamente mediante multiplicaciones de matrices intercaladas con funciones de activación y operaciones de normalización, como normalización por lotes o normalización de capas. Un bloque residual es una de estas subredes con su conexión de salto, y una red residual profunda se construye apilando estos bloques.

Conexiones de proyección

Cuando la subred \(F\) cambia la dimensionalidad de la entrada, de modo que \(F: \mathbb{R}^n \to \mathbb{R}^m\) con \(n \neq m\), la adición \(F(x) + x\) no está definida. En este caso, se utiliza una conexión de proyección: \(y = F(x) + P(x)\), donde \(P\) es típicamente una proyección lineal definida por \(P(x) = Mx\), siendo \(M\) una matriz de \(m \times n\). Esta matriz de proyección se entrena mediante retropropagación, igual que cualquier otro parámetro del modelo. Las conexiones de proyección permiten aplicar arquitecturas residuales a través de capas con diferentes anchos o números de canales, lo cual es común en redes convolucionales como ResNet al transicionar entre etapas.

Propagación de señales

La introducción de mapeos de identidad en las conexiones residuales facilita la propagación de señales tanto en las rutas hacia adelante como hacia atrás, lo cual es clave para su efectividad en el entrenamiento de redes profundas.

Propagación hacia adelante

Si la salida del \(\ell\)-ésimo bloque residual es la entrada del bloque residual \((\ell+1)\)-ésimo (asumiendo que no hay función de activación entre bloques), entonces la entrada al siguiente bloque es \(x_{\ell+1} = F(x_\ell) + x_\ell\). Esta relación recursiva significa que la señal de capas anteriores puede fluir directamente a capas posteriores a través de los mapeos de identidad, evitando la degradación de información que ocurre en redes no residuales. A lo largo de \(L\) bloques, la salida se puede expresar como \(x_L = x_0 + \sum_{i=0}^{L-1} F(x_i)\), mostrando que la entrada inicial siempre está presente en la salida final.

Propagación hacia atrás

Durante la retropropagación, el gradiente de la pérdida con respecto a la entrada de un bloque residual es \(\frac{\partial \mathcal{L}}{\partial x_\ell} = \frac{\partial \mathcal{L}}{\partial x_{\ell+1}} \left(1 + \frac{\partial F}{\partial x_\ell}\right)\). El término \(1\) asegura que el gradiente pueda fluir hacia atrás a través del mapeo de identidad sin desvanecerse, incluso si la subred \(F\) tiene gradientes pequeños o nulos. Esto previene el problema de gradientes que se desvanecen que afecta a redes no residuales muy profundas, permitiendo un entrenamiento efectivo de arquitecturas con cientos de capas.

Desarrollo histórico

El motivo de conexión residual precede a ResNet. La LSTM, introducida en 1997, tiene un mecanismo de celda de memoria que sirve como conexión residual: una entrada \(x_t\) se procesa mediante una función \(F\) y se añade a la celda de memoria \(c_t\), resultando en \(c_{t+1} = c_t + F(x_t)\). Una LSTM con compuerta de olvido funciona esencialmente como una red de autopista, que es otra variante temprana de conexiones residuales con compuertas. Sin embargo, fue el artículo de ResNet de 2015 por investigadores de Microsoft (AI) (incluyendo a Kaiming He, Xiangyu Zhang, Shaoqing Ren y Jian Sun) el que demostró el poder de las conexiones residuales para redes de avance muy profundas. ResNet ganó el ILSVRC 2015 con una tasa de error del 3.57% en el conjunto de datos ImageNet, superando el rendimiento a nivel humano por primera vez.

Impacto en el aprendizaje profundo

Las conexiones residuales han tenido un impacto transformador en la inteligencia artificial y el aprendizaje profundo. Permitieron el desarrollo de redes con una profundidad sin precedentes, como ResNet-152 con 152 capas, que anteriormente era imposible entrenar de manera efectiva. El éxito de ResNet en el reconocimiento de imágenes llevó a la rápida adopción de conexiones residuales en otros dominios, incluido el procesamiento de lenguaje natural y el aprendizaje por refuerzo.

En los modelos transformador, las conexiones residuales son un componente central. La arquitectura de transformador original, introducida en 2017, utiliza conexiones residuales alrededor de cada subcapa (por ejemplo, atención multi-cabeza y redes de avance) seguidas de normalización de capas. Este diseño se utiliza en modelos como BERT y la serie GPT, incluidos los desarrollados por OpenAI. La estabilidad proporcionada por las conexiones residuales es esencial para entrenar estos modelos, que pueden tener cientos de capas y miles de millones de parámetros.

Las conexiones residuales también aparecen en otros sistemas notables. El sistema AlphaGo Zero, desarrollado por Google DeepMind, utiliza redes residuales en sus redes neuronales para dominar el juego de Go. AlphaStar, que alcanzó el nivel de gran maestro en StarCraft II, y AlphaFold, que predice estructuras de proteínas, también incorporan conexiones residuales. Estas aplicaciones demuestran la versatilidad del motivo en diferentes tipos de arquitecturas de redes neuronales.

Variantes y mejoras

Se han propuesto varias variantes de conexiones residuales para mejorar aún más la estabilidad y el rendimiento del entrenamiento. Una recomendación es reemplazar la conexión residual \(x + f(x)\) por \(x/L + f(x)\), donde \(L\) es el número total de capas residuales. Este escalado ayuda a estabilizar la varianza de las entradas de capas, lo cual es particularmente importante en redes muy profundas. Esta técnica se utiliza en algunas implementaciones modernas de transformadores, como GPT-2, donde el flujo residual se escala por \(1/\sqrt{L}\).

Otra variante es el bloque residual de pre-activación, donde la función de activación (por ejemplo, ReLU) se aplica antes de las capas de pesos en lugar de después. Esta modificación, introducida en 2016, mejora el flujo de gradientes y ha demostrado facilitar el entrenamiento de redes aún más profundas. Además, algunas arquitecturas utilizan conexiones residuales con compuertas, donde una compuerta aprendida controla la contribución de la ruta residual, como se ve en las redes de autopista.

Consideraciones prácticas

Al implementar conexiones residuales, surgen varias consideraciones prácticas. La elección de dónde colocar la normalización (antes o después de la adición) puede afectar significativamente la dinámica de entrenamiento. En los transformadores, la "post-normalización" (normalización después de la adición) se utilizó en el artículo original, pero la "pre-normalización" (normalización antes de la subcapa) se ha vuelto más común en modelos posteriores debido a una estabilidad mejorada. El factor de escalado para la rama residual es otro hiperparámetro que se puede ajustar.

Las conexiones residuales también interactúan con otras técnicas como abandono y inicialización de pesos. En la práctica, las conexiones residuales se utilizan a menudo junto con recorte de gradientes y una gestión cuidadosa del programa de tasa de aprendizaje para entrenar modelos muy profundos. La combinación de estas técnicas ha permitido el entrenamiento de modelos con billones de parámetros, como los utilizados en los modelos de lenguaje grandes modernos.

Conclusión

Las conexiones residuales son una idea simple pero poderosa que ha revolucionado el aprendizaje profundo. Al añadir la entrada a la salida de una subred, permiten que los gradientes fluyan a través de redes profundas, previniendo la degradación y habilitando el entrenamiento de arquitecturas con cientos de capas. Desde sus orígenes en el artículo de ResNet de 2015 hasta su presencia ubicua en transformadores y otros modelos modernos, las conexiones residuales se han convertido en una herramienta fundamental en el campo. Su impacto se extiende al reconocimiento de imágenes, el procesamiento de lenguaje natural y más allá, convirtiéndolas en una de las innovaciones arquitectónicas más importantes en la historia del aprendizaje automático.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:deep-learning·neural-network·architecture·machine-learning
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial