Aprendizaje Residual Profundo (ResNet)

Traducido del inglés

El Aprendizaje Residual Profundo (ResNet) es una arquitectura de aprendizaje profundo introducida en 2015 que utiliza conexiones residuales para permitir el entrenamiento de redes neuronales muy profundas, ganando el desafío ImageNet de ese año.

El aprendizaje residual profundo, comúnmente conocido como ResNet, es una arquitectura de aprendizaje profundo introducida en 2015 para el reconocimiento de imágenes. Ganó el desafío de reconocimiento visual a gran escala de ImageNet (ILSVRC) de ese año, demostrando que redes con cientos de capas podían entrenarse de manera efectiva. La innovación clave es la conexión residual, que permite que las capas aprendan funciones residuales con referencia a sus entradas, estabilizando el entrenamiento y la convergencia en redes neuronales muy profundas.

El motivo de la conexión residual, definido como \(x \mapsto f(x) + x\) donde \(f\) es un módulo de red neuronal arbitrario, había sido utilizado en trabajos anteriores, pero la publicación de ResNet lo hizo ampliamente popular para redes de avance directo. Este motivo ahora aparece en muchas arquitecturas aparentemente no relacionadas con ResNet, incluyendo modelos transformadores como BERT y GPT, así como sistemas como AlphaGo Zero, AlphaStar y AlphaFold.

Matemáticas de las conexiones residuales

En una red neuronal multicapa, considere una subred con capas apiladas (por ejemplo, 2 o 3). Sea \(H(x; \alpha)\) la subred, donde \(x\) es la entrada y \(\alpha\) es el conjunto de parámetros. Si \(H^\) es la salida óptima deseada, el aprendizaje residual añade \(x\) directamente a la salida, por lo que la salida óptima aprendida se convierte en \(H^ - x\), interpretada como un "residual" con respecto a \(x\). Esto se implementa mediante una conexión de salto que realiza un mapeo de identidad desde la entrada de la subred hasta su salida.

La función \(F(x; \alpha) = H(x; \alpha) + x\) se representa a menudo mediante multiplicación de matrices intercalada con funciones de activación y operaciones de normalización como normalización por lotes o normalización de capas. Un bloque residual es una de tales subredes, y una red residual profunda se construye apilando estos bloques.

Las redes de memoria a largo plazo (LSTM) tienen un mecanismo de memoria que sirve como conexión residual. En una LSTM sin compuerta de olvido, una entrada \(x_t\) se procesa mediante una función \(F\) y se añade a una celda de memoria \(c_t\), resultando en \(c_{t+1} = c_t + F(x_t)\). Una LSTM con compuerta de olvido funciona esencialmente como una red de autopistas.

Para estabilizar la varianza de las entradas de las capas, se recomienda reemplazar las conexiones residuales \(x + f(x)\) por \(x/L + f(x)\), donde \(L\) es el número total de capas residuales.

Conexiones de proyección

Cuando la función \(F\) mapea desde \(\mathbb{R}^n\) a \(\mathbb{R}^m\) con \(n \neq m\), la expresión \(F(x) + x\) no está definida. En este caso, se utiliza una conexión de proyección: \(y = F(x) + P(x)\), donde \(P\) es típicamente una proyección lineal definida por \(P(x) = Mx\), con \(M\) una matriz de \(m \times n\). La matriz \(M\) se entrena mediante retropropagación, como cualquier otro parámetro del modelo.

Propagación de señales

La introducción de mapeos de identidad facilita la propagación de señales tanto en las rutas hacia adelante como hacia atrás. En la dirección hacia adelante, si la salida del \(\ell\)-ésimo bloque residual es la entrada del bloque \((\ell+1)\)-ésimo (asumiendo que no hay activación entre bloques), entonces la entrada al siguiente bloque es \(x_{\ell+1} = F(x_\ell) + x_\ell\). Esta estructura aditiva permite que los gradientes fluyan directamente a través de la red durante la retropropagación, mitigando el problema del gradiente que se desvanece que afectaba a arquitecturas profundas anteriores.

Impacto y legado

El éxito de ResNet en ILSVRC 2015 marcó un punto de inflexión en visión por computadora y inteligencia artificial. Permitió el entrenamiento de redes con cientos de capas, lo que antes era inviable debido a la degradación en la precisión del entrenamiento. La conexión residual se ha convertido desde entonces en un componente estándar en muchos modelos de aprendizaje profundo, incluidos los utilizados en procesamiento de lenguaje natural y IA generativa.

La influencia de la arquitectura se extiende más allá del reconocimiento de imágenes. Las conexiones residuales son integrales en los grandes modelos de lenguaje modernos y otros modelos basados en secuencias, donde ayudan a mantener un entrenamiento estable a lo largo de muchas capas. El principio de aprender residuales en lugar de transformaciones completas también ha inspirado variaciones como U-Net y otros diseños de codificador-decodificador.

ResNet sigue siendo una referencia fundamental en el aprendizaje profundo, y sus principios de diseño se enseñan en cursos y se aplican en investigaciones en todos los dominios de aprendizaje automático. La simplicidad y efectividad de la conexión residual la han convertido en una de las contribuciones más duraderas al campo.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:deep-learning·neural-network·computer-vision·residual-network
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial