GRU (Unidad Recurrente con Compuertas)

Traducido del inglés

La unidad recurrente cerrada (GRU) es un mecanismo de compuerta de redes neuronales recurrentes introducido en 2014 por Kyunghyun Cho et al., que utiliza compuertas de actualización y reinicio para controlar el flujo de información, con menos parámetros que la LSTM.

La unidad recurrente cerrada (GRU) es un tipo de mecanismo de compuerta utilizado en redes neuronales recurrentes, introducida en 2014 por Kyunghyun Cho y sus colegas. Está diseñada para abordar el problema del gradiente evanescente común en las redes recurrentes estándar mediante el uso de dos compuertas - una compuerta de actualización y una compuerta de reinicio - para controlar cuánta información pasada se retiene u olvida. En comparación con la unidad de memoria a largo plazo (LSTM), la GRU tiene una arquitectura más simple: carece de un vector de contexto separado y de una compuerta de salida, lo que resulta en menos parámetros y, a menudo, un entrenamiento más rápido. A pesar de esta simplificación, las GRU han mostrado un rendimiento comparable al de las LSTM en tareas como el modelado de música polifónica, el modelado de señales de voz y el procesamiento del lenguaje natural. La investigación del equipo de Yoshua Bengio encontró que el uso de compuertas es ampliamente beneficioso, pero no llegó a una conclusión definitiva sobre si las GRU o las LSTM son superiores en general.

Arquitectura

La GRU procesa secuencias de entrada paso a paso, manteniendo un estado oculto que transporta información a través de los pasos de tiempo. En cada paso de tiempo, la unidad calcula una compuerta de actualización y una compuerta de reinicio, ambas funciones de la entrada actual y del estado oculto anterior. La compuerta de actualización determina cuánto del estado anterior se lleva hacia adelante, mientras que la compuerta de reinicio decide cuánto del estado pasado se utiliza al calcular una activación candidata. El estado oculto final es una combinación convexa del estado anterior y la activación candidata, ponderada por la compuerta de actualización.

Matemáticamente, para un vector de entrada \(x_t\) y un estado oculto anterior \(h_{t-1}\), las compuertas y la activación candidata se calculan como:

  • Compuerta de actualización: \(z_t = \sigma(W_z x_t + U_z h_{t-1} + b_z)\)
  • Compuerta de reinicio: \(r_t = \sigma(W_r x_t + U_r h_{t-1} + b_r)\)
  • Activación candidata: \(\hat{h}_t = \phi(W_h x_t + U_h (r_t \odot h_{t-1}) + b_h)\)
  • Estado oculto final: \(h_t = (1 - z_t) \odot h_{t-1} + z_t \odot \hat{h}_t\)

Aquí, \(\sigma\) es la función de activación sigmoide, \(\phi\) es típicamente la tangente hiperbólica, y \(\odot\) denota el producto de Hadamard (elemento a elemento). Las matrices de pesos \(W_z, W_r, W_h\) y \(U_z, U_r, U_h\), junto con los vectores de sesgo \(b_z, b_r, b_h\), se aprenden durante el entrenamiento. El estado oculto inicial generalmente se establece en cero.

Variantes

Existen varias variaciones de la GRU, que difieren en cómo se calculan o combinan las compuertas. Una versión simplificada notable es la unidad mínima con compuerta, que utiliza solo una compuerta (a menudo una combinación de actualización y reinicio) para reducir la complejidad computacional. Otras variantes pueden ajustar el orden de las operaciones o la forma en que la compuerta de reinicio interactúa con el estado anterior. Estas modificaciones buscan mejorar la eficiencia o el rendimiento en tareas específicas, pero el principio central del flujo de información con compuertas permanece consistente.

Aplicaciones

Las GRU se han aplicado ampliamente en tareas de modelado de secuencias, incluido el procesamiento del lenguaje natural (por ejemplo, traducción automática, modelado de lenguaje), reconocimiento de voz y generación musical. También se utilizan en la predicción de series temporales y en arquitecturas híbridas donde se combinan con capas convolucionales o mecanismos de atención. En muchos entornos, las GRU sirven como una alternativa ligera a las LSTM, especialmente cuando los recursos computacionales son limitados o cuando la longitud de la secuencia es moderada.

Comparación con LSTM

Tanto las GRU como las LSTM fueron desarrolladas para mitigar el problema del gradiente evanescente, pero difieren en su estructura interna. Una LSTM tiene tres compuertas (entrada, olvido y salida) y un estado de celda separado, mientras que una GRU tiene dos compuertas y ningún estado de celda separado. Esto hace que la GRU sea eficiente en parámetros y, a menudo, más rápida de entrenar. Empíricamente, los estudios han encontrado que las GRU se desempeñan de manera similar a las LSTM en muchas tareas de referencia, aunque los resultados pueden variar según el conjunto de datos y la tarea. Algunas investigaciones sugieren que las GRU pueden generalizar mejor en conjuntos de datos más pequeños, mientras que las LSTM podrían sobresalir en conjuntos más grandes, pero no se ha establecido una ventaja definitiva.

Véase también

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:recurrent-neural-networks·deep-learning·sequence-modeling
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial