ResNet 论文 (2015)

Traducido del inglés

ResNet es una arquitectura de aprendizaje profundo que utiliza conexiones residuales, introducida en 2015 para el reconocimiento de imágenes, ganando el ILSVRC 2015.

Las redes neuronales residuales, comúnmente conocidas como ResNet, son una clase de arquitecturas de aprendizaje profundo que permiten el entrenamiento de redes neuronales muy profundas mediante la introducción de conexiones de salto que añaden la entrada de una capa a su salida. La arquitectura fue desarrollada en 2015 para el reconocimiento de imágenes y ganó el desafío ImageNet Large Scale Visual Recognition Challenge (ILSVRC) de ese año. La innovación clave es la conexión residual, que permite que las capas aprendan funciones residuales con referencia a las entradas de la capa, estabilizando el entrenamiento y habilitando redes con cientos de capas.

El motivo de conexión residual, definido como \(x \mapsto f(x) + x\), había sido utilizado en modelos anteriores, pero la publicación de ResNet lo hizo ampliamente popular para redes de avance directo. Desde entonces, se ha convertido en un componente común en muchas arquitecturas de redes neuronales profundas, incluidos modelos de transformadores como BERT y GPT, así como sistemas como AlphaGo Zero, AlphaStar y AlphaFold.

Matemáticas

Conexión Residual

En una red neuronal multicapa, considere una subred con algunas capas apiladas, denotada como \(H(x; \alpha)\), donde \(x\) es la entrada y \(\alpha\) son los parámetros. En el aprendizaje estándar, la subred tiene como objetivo aproximar una salida deseada \(H^\). El aprendizaje residual modifica la subred para que produzca \(F(x; \alpha) = H(x; \alpha) + x\), de modo que la función aprendida óptima se convierte en \(H^ - x\), que se interpreta como el residuo con respecto a \(x\). La adición de \(x\) se implementa mediante una conexión de salto que realiza un mapeo de identidad, conectando la entrada de la subred directamente a su salida. Esta conexión de salto se denomina conexión residual. La subred, junto con la conexión de salto, forma un bloque residual. Una red residual profunda se construye apilando múltiples bloques de este tipo.

La conexión residual estabiliza el entrenamiento al facilitar el flujo de gradientes, lo cual es particularmente importante para redes con cientos de capas. Las redes de memoria a largo plazo (LSTM) tienen un mecanismo de memoria que actúa como una conexión residual: en una LSTM sin compuerta de olvido, la regla de actualización es \(c_{t+1} = c_t + F(x_t)\), donde \(c_t\) es la celda de memoria y \(F\) es una función de la entrada. Una LSTM con compuerta de olvido funciona de manera similar a una red de autopista. Para estabilizar la varianza, se recomienda escalar la conexión residual por \(1/L\), donde \(L\) es el número total de capas residuales, resultando en \(x/L + f(x)\).

Conexión de Proyección

Cuando la función \(F\) mapea de \(\mathbb{R}^n\) a \(\mathbb{R}^m\) con \(n \neq m\), la adición \(F(x) + x\) no está definida. En tales casos, se utiliza una conexión de proyección: \(y = F(x) + P(x)\), donde \(P\) es típicamente una proyección lineal definida por \(P(x) = Mx\), siendo \(M\) una matriz de \(m \times n\). La matriz \(M\) se entrena mediante retropropagación junto con los demás parámetros del modelo.

Propagación de Señal

El mapeo de identidad en las conexiones residuales facilita la propagación de señales tanto en dirección hacia adelante como hacia atrás. En el paso hacia adelante, si la salida del \(\ell\)-ésimo bloque residual es la entrada del bloque \((\ell+1)\)-ésimo (asumiendo que no hay activación entre bloques), entonces la entrada al siguiente bloque es \(x_{\ell+1} = F(x_\ell) + x_\ell\). Esta estructura aditiva permite que la información fluya directamente a través de la red, mitigando el problema del gradiente que se desvanece.

Impacto en el Aprendizaje Profundo

La introducción de ResNet en 2015 marcó un hito significativo en el aprendizaje profundo. Antes de ResNet, entrenar redes muy profundas era un desafío debido a la degradación en la precisión a medida que aumentaba la profundidad. El marco de aprendizaje residual de ResNet abordó esto reformulando las capas como funciones residuales de aprendizaje, que son más fáciles de optimizar. La arquitectura logró resultados de vanguardia en el desafío ILSVRC 2015, con una tasa de error del 3.57% en el conjunto de prueba de ImageNet, superando el rendimiento a nivel humano en algunas tareas.

El éxito de ResNet impulsó el desarrollo de arquitecturas aún más profundas, como ResNet-50, ResNet-101 y ResNet-152, que se utilizan ampliamente como redes troncales en tareas de visión por computadora como la detección de objetos y la segmentación. El concepto de conexión residual se ha adoptado en varios otros dominios, incluido el procesamiento del lenguaje natural y el aprendizaje por refuerzo.

Legado e Influencia

La conexión residual se ha convertido en un bloque fundamental en el diseño moderno de redes neuronales. Es un componente clave en las arquitecturas de transformadores, que impulsan grandes modelos de lenguaje como GPT y BERT. La técnica también se utiliza en sistemas como AlphaGo Zero, AlphaStar y AlphaFold, demostrando su versatilidad en diferentes tipos de redes neuronales.

La publicación del artículo de ResNet, titulado "Deep Residual Learning for Image Recognition", fue escrita por Kaiming He, Xiangyu Zhang, Shaoqing Ren y Jian Sun. Se ha convertido en uno de los artículos más citados en visión por computadora y aprendizaje profundo, influyendo en investigaciones posteriores sobre arquitectura de redes y estabilidad de entrenamiento.

Véase También

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:deep-learning·neural-network·computer-vision·residual-network
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial