Secuencia a Secuencia (Seq2Seq)

Traducido del inglés

La arquitectura secuencia a secuencia (seq2seq) es una familia de enfoques de aprendizaje automático que mapean una secuencia de entrada a una secuencia de salida mediante una arquitectura de red neuronal codificador-decodificador, siendo fundamental para tareas como la traducción y la generación de resúmenes.

Secuencia a secuencia (a menudo abreviado como seq2seq) es una familia de enfoques de aprendizaje automático utilizados para el procesamiento del lenguaje natural y otras tareas de transducción de secuencias. El marco transforma una secuencia en otra, como convertir una oración del inglés al francés, generar un título a partir de una imagen o producir un resumen a partir de un texto más largo. Desarrollado originalmente por Lê Viết Quốc, un científico informático vietnamita y pionero del aprendizaje automático en Google Brain, seq2seq se ha convertido en un pilar de muchos sistemas modernos de inteligencia artificial, incluidos los grandes modelos de lenguaje y los agentes conversacionales.

La idea central de seq2seq es utilizar dos redes neuronales: un codificador que procesa la secuencia de entrada y comprime su información en un vector de longitud fija (o un conjunto de vectores de contexto), y un decodificador que genera la secuencia de salida paso a paso a partir de esa representación. Esta arquitectura se propuso por primera vez en 2014 y desde entonces ha evolucionado, con la introducción de los mecanismos de atención y el modelo transformer, para abordar limitaciones como el problema del cuello de botella y la falta de paralelización.

Raíces históricas

Las raíces conceptuales de seq2seq se encuentran en la teoría de la información y el modelo de canal ruidoso de la traducción automática. Ya en 1947, Warren Weaver, pionero de la traducción automática, señaló: "Uno se pregunta naturalmente si el problema de la traducción podría concebirse como un problema de criptografía. Cuando miro un artículo en ruso, digo: 'Esto está realmente escrito en inglés, pero ha sido codificado con símbolos extraños. Ahora procederé a decodificarlo'". Este punto de vista enmarcó la traducción como un proceso de codificar-transmitir-decodificar, que inspiró directamente la estructura codificador-decodificador.

A principios de la década de 2010, los investigadores comenzaron a desarrollar modelos codificador-decodificador basados en redes neuronales para la transducción de secuencias. Los dos artículos más comúnmente citados como originarios de seq2seq se publicaron ambos en 2014. Uno fue de Ilya Sutskever, Oriol Vinyals y Quoc V. Le, que trabajaban en Google Brain, y el otro de Kyunghyun Cho, Bart van Merriënboer, Dzmitry Bahdanau y Yoshua Bengio, de la Universidad de Montreal y la Universidad Jacobs. Estos artículos propusieron el uso de redes neuronales recurrentes (RNN), específicamente redes de memoria a largo plazo (LSTM), tanto para el codificador como para el decodificador.

El problema del cuello de botella y la atención

Los modelos seq2seq originales utilizaban un vector de codificación de longitud fija, lo que creaba un problema de "cuello de botella": para secuencias de entrada largas, la información tendía a perderse porque era difícil comprimir todos los detalles necesarios en un solo vector. Para abordar esto, Bahdanau et al. introdujeron el mecanismo de atención en 2014. Su modelo, llamado RNNsearch, permitía al decodificador "buscar" en la oración fuente durante la decodificación, emulando efectivamente el proceso de mirar hacia atrás en las partes relevantes de la entrada. La atención calcula una suma ponderada de los estados ocultos del codificador, produciendo un vector de contexto para cada paso de decodificación, lo que resolvió el cuello de botella al dar al decodificador acceso directo a todas las posiciones de entrada.

La revolución del transformer

Una limitación significativa de los modelos seq2seq basados en RNN era su dificultad para la paralelización, ya que el procesamiento recurrente es inherentemente secuencial. La publicación en 2017 de la arquitectura transformer por Vaswani et al. (con contribuyentes clave como Jakob Uszkoreit y Lukasz Kaiser) resolvió este problema al reemplazar el codificador recurrente con bloques transformer de autoatención (llamados "bloques codificadores") y el decodificador recurrente con bloques transformer de atención cruzada con enmascaramiento causal ("bloques decodificadores"). Esto permitió un entrenamiento mucho más rápido en hardware paralelo y condujo al desarrollo de modelos a gran escala como los grandes modelos de lenguaje y los sistemas de IA generativa.

Arquitectura

La arquitectura seq2seq consta de dos componentes principales: el codificador y el decodificador.

Codificador

El codificador procesa la secuencia de entrada, típicamente una secuencia de tokens o palabras, y captura su información esencial. En un codificador basado en RNN, esta información se almacena en el estado oculto de la red. Con la atención, el codificador también produce un conjunto de estados ocultos para cada posición de entrada, que se utilizan para calcular los vectores de contexto. El codificador puede ser bidireccional, lo que significa que lee la entrada en ambas direcciones para capturar mejor el contexto.

Decodificador

El decodificador toma los vectores de contexto y los estados ocultos del codificador y genera la secuencia de salida de forma autorregresiva, produciendo un elemento a la vez. En cada paso, considera los elementos generados previamente, el vector de contexto y la información de entrada para predecir el siguiente elemento. En modelos con atención, el vector de contexto y el estado oculto del decodificador se concatenan para formar un vector oculto de atención, que se utiliza como entrada para el siguiente paso. El decodificador a menudo está enmascarado causalmente para evitar que mire hacia adelante en los tokens futuros durante el entrenamiento.

Entrenamiento vs. predicción

Hay una diferencia sutil entre el entrenamiento y la predicción en los modelos seq2seq. Durante el entrenamiento, tanto la secuencia de entrada como la de salida son conocidas, lo que permite el uso de una técnica llamada "teacher forcing". En el teacher forcing, la entrada del decodificador en cada paso es el token de salida de referencia de los datos de entrenamiento, independientemente de lo que el modelo haya predicho. Esto acelera la convergencia y estabiliza el entrenamiento.

Durante la predicción (inferencia), la salida de referencia no está disponible, por lo que el decodificador debe usar sus propios tokens generados previamente como entrada para el siguiente paso. Esto puede llevar a una acumulación de errores, ya que un error temprano en la secuencia puede propagarse. Para mitigar esto, se utilizan a menudo técnicas como la búsqueda de haz para explorar múltiples secuencias candidatas y seleccionar la más probable.

Aplicaciones

Los modelos seq2seq se han aplicado a una amplia gama de tareas. En la traducción automática, permitieron la renovación de Google Translate en Google Neural Machine Translation en 2016. Otras aplicaciones incluyen el subtitulado de imágenes, donde el codificador procesa una imagen (a través de una red neuronal convolucional) y el decodificador genera una descripción textual; modelos conversacionales, como los chatbots; reconocimiento de voz, que mapea secuencias de audio a texto; y resumen de texto, que comprime documentos largos en resúmenes concisos. La arquitectura también subyace a muchos modelos modernos basados en transformer utilizados en sistemas de inteligencia artificial.

Disputa de prioridad

Existe una notable disputa de prioridad en torno a la invención de seq2seq. Tomáš Mikolov, conocido por desarrollar word2vec y RNNLM, afirma haber concebido la idea de usar un modelo de lenguaje neuronal en pares de oraciones y generar traducción después de ver la primera oración, lo que él equipara con la traducción automática seq2seq. Declaró que mencionó esta idea a Ilya Sutskever y Quoc Le mientras estaba en Google Brain, pero no lo reconocieron en su artículo de 2014. El artículo de Sutskever et al. es ampliamente acreditado como un originador clave, pero las contribuciones de Mikolov siguen siendo un tema de debate en la comunidad investigadora.

Legado e impacto

Seq2seq ha tenido un impacto profundo en el campo del aprendizaje automático. Introdujo el paradigma codificador-decodificador que ahora es estándar en las tareas de transducción de secuencias. El mecanismo de atención, desarrollado inicialmente para seq2seq, se convirtió en un componente fundamental de la arquitectura transformer, que impulsa los grandes modelos de lenguaje modernos como los desarrollados por OpenAI, Anthropic y Google DeepMind. Los principios de seq2seq también se aplican en hardware especializado y servicios en la nube, como AWS Trainium y Azure, que están optimizados para el entrenamiento e inferencia de tales modelos. A principios de la década de 2020, seq2seq sigue siendo un concepto central en los planes de estudio e investigación de aprendizaje profundo, aunque muchos sistemas de producción han migrado a arquitecturas basadas en transformer que se construyen sobre sus fundamentos.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:machine-learning·natural-language-processing·deep-learning·sequence-modeling
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial