Traducido del inglés

ResNet es una arquitectura de aprendizaje profundo introducida por Microsoft en 2015 que utiliza conexiones residuales para entrenar redes neuronales muy profundas, ganando el desafío ImageNet Large Scale Visual Recognition Challenge ese año.

ResNet, abreviatura de red neuronal residual, es una arquitectura de aprendizaje profundo en la que las capas aprenden funciones residuales con referencia a sus entradas. Desarrollada en 2015 para el reconocimiento de imágenes, ganó el desafío de reconocimiento visual a gran escala de ImageNet (ILSVRC) de ese año. La característica definitoria de la arquitectura es la conexión residual, un motivo que suma la entrada de una subred a su salida, lo que permite el entrenamiento de redes con cientos de capas. Este diseño se ha convertido en un bloque fundamental en los modelos modernos de aprendizaje profundo, incluidas las arquitecturas transformer y sistemas como AlphaGo Zero y AlphaFold.

La conexión residual estabiliza el entrenamiento y la convergencia en redes neuronales profundas, abordando el problema del gradiente evanescente que antes limitaba la profundidad de la red. Su influencia se extiende mucho más allá del reconocimiento de imágenes, apareciendo en redes neuronales en diversos dominios, desde modelos de lenguaje grandes hasta sistemas de aprendizaje por refuerzo.

Matemáticas

La idea central de ResNet es reformular el objetivo de aprendizaje. En una red multicapa, considere una subred con capas apiladas que calcula una función \(H(x;\alpha)\), donde \(x\) es la entrada y \(\alpha\) son los parámetros. En lugar de aprender \(H\) directamente, el aprendizaje residual hace que la subred aprenda \(F(x;\alpha) = H(x;\alpha) + x\). La salida óptima \(H^\) se logra entonces aprendiendo el residual \(H^ - x\), que a menudo es más fácil de optimizar.

La suma de \(x\) se implementa mediante una conexión de salto que realiza un mapeo de identidad, conectando la entrada de la subred directamente a su salida. Esta conexión de salto es la "conexión residual". Una subred con esta conexión se llama bloque residual, y una red residual profunda se construye apilando tales bloques.

Conexión Residual

En un bloque residual, la función \(F\) típicamente consiste en multiplicaciones de matrices intercaladas con funciones de activación y operaciones de normalización como la normalización por lotes o la normalización de capas. La conexión residual \(x + F(x)\) permite que los gradientes fluyan directamente a través de la red durante la retropropagación, mitigando el problema de degradación donde las redes más profundas se vuelven más difíciles de entrenar.

El concepto de conexiones residuales tiene precedentes. Las redes de memoria a largo plazo (LSTM), por ejemplo, tienen una celda de memoria que actúa como una conexión residual: \(c_{t+1} = c_t + F(x_t)\), donde \(c_t\) es el estado de la celda y \(F\) procesa la entrada \(x_t\). Una LSTM con una puerta de olvido funciona esencialmente como una red de autopistas, una arquitectura relacionada que también utiliza conexiones de salto con compuertas.

Para estabilizar la varianza de las entradas de las capas en redes muy profundas, se recomienda escalar la conexión residual por el número total de capas \(L\), reemplazando \(x + f(x)\) con \(x/L + f(x)\). Esta normalización ayuda a mantener magnitudes de señal consistentes a través de cientos de capas.

Conexión de Proyección

Cuando la función \(F\) cambia la dimensionalidad de la entrada, como \(F: \mathbb{R}^n \to \mathbb{R}^m\) con \(n \neq m\), la suma \(F(x) + x\) no está definida. En este caso, se utiliza una conexión de proyección: \(y = F(x) + P(x)\), donde \(P\) es típicamente una proyección lineal \(P(x) = Mx\) con una matriz \(M\) de \(m \times n\). Esta matriz se entrena mediante retropropagación junto con otros parámetros del modelo, permitiendo que la red adapte la conexión de salto a la nueva dimensionalidad.

Propagación de Señal

La introducción de mapeos de identidad facilita la propagación de señales tanto en las rutas hacia adelante como hacia atrás. En el paso hacia adelante, si la salida del \(\ell\)-ésimo bloque residual es la entrada del bloque \((\ell+1)\)-ésimo (asumiendo que no hay activación entre bloques), entonces \(x_{\ell+1} = F(x_\ell) + x_\ell\). Esta recurrencia permite que la información fluya directamente a través de la red, preservando la señal de entrada incluso si \(F\) produce valores pequeños.

En el paso hacia atrás, el gradiente de la pérdida con respecto a la entrada de un bloque incluye un término que es el gradiente con respecto a la salida, pasado a través del mapeo de identidad. Esto asegura que los gradientes no se desvanezcan mientras se propagan a través de muchas capas, un factor clave para permitir el entrenamiento de redes con cientos de capas.

Historia e Impacto

El motivo de la conexión residual se había utilizado en trabajos anteriores, pero la publicación de ResNet en 2015 lo hizo ampliamente popular para redes de avance directo. La arquitectura fue desarrollada por investigadores de Microsoft, incluidos Kaiming He, Xiangyu Zhang, Shaoqing Ren y Jian Sun. Su artículo, "Deep Residual Learning for Image Recognition", demostró que las redes residuales podían entrenarse con profundidades de 152 capas o más, logrando resultados de vanguardia en el punto de referencia de ImageNet.

El éxito de ResNet en ILSVRC 2015 marcó un punto de inflexión en aprendizaje automático. Mostró que las redes muy profundas no solo eran factibles sino también superiores en rendimiento, lo que llevó a un aumento en la investigación sobre arquitecturas profundas. La conexión residual se convirtió en un componente estándar en modelos posteriores, incluidos los Transformers utilizados en el procesamiento del lenguaje natural, como los modelos BERT y GPT, y en sistemas como AlphaGo Zero, AlphaStar y AlphaFold.

Variantes y Extensiones

Se han desarrollado varias variantes de ResNet para mejorar el rendimiento o la eficiencia. ResNet de preactivación mueve las funciones de activación antes de las capas de peso, lo que mejora la regularización y permite redes aún más profundas. Wide ResNet aumenta el número de canales en cada bloque, intercambiando profundidad por ancho para lograr una mayor precisión con menos capas. ResNeXt introduce una dimensión de cardinalidad, utilizando ramas paralelas dentro de cada bloque para aumentar el poder representacional sin aumentar la profundidad.

Otras extensiones incluyen DenseNet, que conecta cada capa con todas las demás de manera de avance directo, y ResNet con profundidad estocástica, que elimina aleatoriamente capas durante el entrenamiento para regularizar la red. Estas variantes han empujado aún más los límites de lo que es posible con el aprendizaje residual profundo.

Aplicaciones

ResNet se ha aplicado a una amplia gama de tareas más allá del reconocimiento de imágenes, incluida la detección de objetos, la segmentación semántica y el análisis de video. También se utiliza en imágenes médicas, conducción autónoma y sistemas de reconocimiento facial. La versatilidad y robustez de la arquitectura la han convertido en una opción predeterminada para muchas aplicaciones de visión por computadora.

Además, el principio de conexión residual se ha adoptado en otros dominios, como procesamiento del lenguaje natural y aprendizaje por refuerzo. Por ejemplo, los modelos Transformer dependen de conexiones residuales para entrenar redes profundas para la comprensión y generación de lenguaje, como se ve en la serie GPT de OpenAI y los modelos de Anthropic. La influencia de ResNet es, por lo tanto, omnipresente en el campo de la inteligencia artificial.

Véase También

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:deep-learning·neural-network·computer-vision·residual-network
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial