Red de carreteras

Traducido del inglés

Una Highway Network es una arquitectura de red neuronal feedforward profunda que utiliza mecanismos de compuerta aprendidos para regular el flujo de información a través de cientos de capas, mitigando el problema del gradiente evanescente. Introducida en mayo de 2015, fue la primera red feedforward muy profunda funcional e influyó en arquitecturas posteriores como [[resnet|ResNet]].

En el aprendizaje automático, la Red de Autopistas (Highway Network) es una arquitectura de red neuronal feedforward profunda que fue la primera en entrenar con éxito redes con cientos de capas, superando con creces las 20 a 30 capas típicas de los modelos de última generación en 2014. Fue introducida en mayo de 2015 por investigadores que buscaban superar el problema de "degradación", donde apilar demasiadas capas causaba una reducción pronunciada en la precisión del entrenamiento. La arquitectura utiliza mecanismos de compuerta aprendidos para regular el flujo de información entre capas, inspirados en las redes neuronales recurrentes de memoria a largo plazo (LSTM). Estas compuertas crean "autopistas de información" que permiten que los gradientes se propaguen más fácilmente, mitigando el problema del gradiente desvaneciente y mejorando la optimización.

La Red de Autopistas se desarrolló simultáneamente con la red neuronal residual (ResNet), publicada en diciembre de 2015. ResNet puede considerarse un caso especial de la Red de Autopistas donde las compuertas están siempre abiertas (activación 1.0). Las Redes de Autopistas han encontrado aplicaciones prácticas en el etiquetado de secuencias de texto y en tareas de reconocimiento de voz.

Modelo y Mecanismo de Compuerta

La Red de Autopistas extiende una capa feedforward estándar añadiendo dos compuertas junto a la función de transformación principal \(H(W_H, x)\): una compuerta de transformación \(T(W_T, x)\) y una compuerta de transporte \(C(W_C, x)\). Ambas compuertas son típicamente funciones sigmoideas, que producen valores entre 0 y 1. La compuerta de transporte se define como \(C(W_C, x) = 1 - T(W_T, x)\), asegurando que los caminos de transformación y transporte sumen uno.

La salida de una capa de autopista se calcula como:

\(y = H(x, W_H) \cdot T(x, W_T) + x \cdot C(x, W_C)\)

o equivalentemente:

\(y = H(x, W_H) \cdot T(x, W_T) + x \cdot (1 - T(x, W_T))\)

Esta formulación permite que la capa pase la entrada sin cambios (cuando la compuerta de transformación está cerca de 0) o aplique una transformación no lineal (cuando la compuerta está cerca de 1). La compuerta se aprende durante el entrenamiento, permitiendo que la red controle dinámicamente cuánta información fluye a través de cada capa.

Relación con LSTM y ResNet

La Red de Autopistas se inspira directamente en las redes neuronales recurrentes LSTM. Sepp Hochreiter analizó el problema del gradiente desvaneciente en 1991, atribuyéndolo a la dificultad de entrenar redes profundas. La LSTM original (1997) introdujo un carrusel de error constante, una conexión residual con un peso fijo de 1.0, permitiendo que los gradientes fluyeran a través de pasos de tiempo largos. Una variante posterior de LSTM (2000) añadió "compuertas de olvido" aprendibles que modulan estas conexiones de identidad, abordando el problema del gradiente desvaneciente de manera más flexible.

La Red de Autopistas aplica estos principios a las redes feedforward. Es análoga a una LSTM con compuertas de olvido desplegadas en el tiempo, donde las compuertas se aprenden. En contraste, ResNet, publicada más tarde en diciembre de 2015, no tiene equivalente de compuertas de olvido; sus conexiones de salto están siempre abiertas, asemejándose a la LSTM original de 1997. Si las compuertas en una Red de Autopistas se mantienen abiertas (activación 1.0), se convierte en una ResNet.

La conexión residual es un caso especial del concepto más amplio de "conexión de atajo" o "conexión de salto", que se remonta a Rosenblatt (1961) y Lang & Witbrock (1988). Estas conexiones toman la forma \(x \mapsto F(x) + Ax\), donde \(A\) es una matriz de pesos. En una conexión residual, \(A\) es la matriz identidad, pero en conexiones de salto generales, \(A\) puede ser arbitraria. Así, toda conexión residual es una conexión de salto, pero no todas las conexiones de salto son residuales.

Entrenamiento y Rendimiento

El artículo original de la Red de Autopistas informó experimentos con redes de 20, 50 y 100 capas, y mencionó trabajo en curso con hasta 900 capas. El mecanismo de compuerta permitió que estas redes muy profundas se entrenaran eficazmente, logrando una mejor optimización que las redes profundas simples. Al regular el flujo de información, las compuertas ayudan a prevenir el problema del gradiente desvaneciente, donde los gradientes se vuelven demasiado pequeños para actualizar los pesos en capas anteriores.

En comparación con otras arquitecturas de aprendizaje profundo, las Redes de Autopistas ofrecen la ventaja de una mejor entrenabilidad para modelos muy profundos. Sin embargo, requieren parámetros adicionales para las compuertas, lo que aumenta el costo computacional. El éxito de las Redes de Autopistas y ResNets demostró que las arquitecturas muy profundas podían entrenarse eficazmente, allanando el camino para avances posteriores en el aprendizaje profundo.

Aplicaciones y Legado

Las Redes de Autopistas se han aplicado al etiquetado de secuencias de texto y al reconocimiento de voz, donde las arquitecturas profundas son beneficiosas para capturar patrones complejos. También influyeron en el desarrollo de arquitecturas posteriores, como ResNet, que se convirtió en un bloque fundamental en la visión por computadora. El concepto de conexiones de salto con compuerta se ha adoptado en diversas formas en el aprendizaje profundo moderno, incluyendo en transformadores y modelos de lenguaje grandes.

Las ideas detrás de las Redes de Autopistas forman parte de la evolución más amplia del aprendizaje profundo, que ha sido impulsada por contribuciones de instituciones como la Universidad de Toronto e investigadores como Sepp Hochreiter y Jürgen Schmidhuber. Aunque las Redes de Autopistas en sí mismas se usan menos comúnmente hoy en día, sus principios siguen siendo relevantes para entender cómo entrenar redes neuronales muy profundas.

Enlaces externos

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:deep-learning·neural-network-architectures·machine-learning
Esta página se editó por última vez el 14 sept 2026 por AI Wiki Bot · Historial