Arquitectura del Transformador

Traducido del inglés

El transformer es una arquitectura de aprendizaje profundo basada en la autoatención de múltiples cabezas, introducida en 2017, que procesa tokens en paralelo y sustenta los modelos de lenguaje grandes modernos.

El transformador es una familia de arquitecturas de red neuronal artificial utilizadas en aprendizaje profundo, basadas en el mecanismo de atención de múltiples cabezas. Los datos de entrada, como texto, imágenes o audio, se convierten en una secuencia de representaciones numéricas llamadas tokens, cada uno mapeado a un vector mediante una tabla de incrustación de palabras. En cada capa, cada token se contextualiza dentro de la ventana de contexto utilizando atención de múltiples cabezas en paralelo, amplificando los tokens importantes y disminuyendo los menos relevantes. Debido a que la autoatención por sí sola es invariante a la permutación, los transformadores inyectan información posicional mediante codificaciones posicionales o incrustaciones aprendidas, de modo que el orden de los tokens afecta la salida.

Los transformadores no tienen unidades recurrentes, lo que requiere menos tiempo de entrenamiento que las arquitecturas recurrentes anteriores como LSTM. Los diseños modernos se agrupan en variantes solo codificador, solo decodificador y codificador-decodificador, optimizadas para el aprendizaje de representaciones, la generación autorregresiva o tareas condicionales de secuencia a secuencia. El transformador original fue propuesto en el artículo de 2017 "Attention Is All You Need" por investigadores de Google. Desde entonces, se ha convertido en la base de los modelos de lenguaje grandes (LLM) y ha encontrado aplicaciones en el procesamiento del lenguaje natural, la visión por computadora, el aprendizaje por refuerzo, el audio, el aprendizaje multimodal, la robótica y el ajedrez.

Historia

Predecesores

Durante muchos años, el modelado de secuencias utilizó redes neuronales recurrentes (RNN) simples, como la red de Elman (1990). En teoría, la información de un token podía propagarse arbitrariamente lejos, pero el problema del gradiente desvaneciente dejaba secuencias largas sin información precisa extraíble. Un avance clave fue LSTM, descrito en un informe técnico de 1995 y publicado formalmente en 1997, que introdujo mecanismos de compuerta para mitigar los gradientes desvanecientes. LSTM utilizaba unidades de compuerta multiplicativas, conceptualmente distintas de la atención aditiva. Se convirtió en el estándar para el modelado de secuencias largas hasta 2017, pero las RNN procesan tokens secuencialmente, impidiendo la paralelización. El controlador de pesos rápidos de escala lineal (1992) aprendía a calcular matrices de pesos basadas en la entrada, equivalente a un transformador lineal no normalizado.

Atención con seq2seq

La transducción de secuencias codificador-decodificador se desarrolló a principios de la década de 2010, con dos artículos concurrentes de 2014. Un modelo de 380M de parámetros utilizó dos LSTM para la traducción automática: un LSTM codificador convertía una secuencia de tokens en un vector, y un LSTM decodificador lo convertía en salida. Otro modelo de 130M de parámetros utilizó unidades recurrentes con compuerta (GRU), que luego se demostró que eran comparables a las LSTM. Estos primeros modelos seq2seq carecían de atención, dependiendo de un vector de estado de tamaño fijo después de la última palabra, lo que preservaba mal la información de entrada larga. Invertir la oración de entrada mejoró la traducción, destacando el cuello de botella. El modelo de búsqueda RNN introdujo la atención en seq2seq, permitiendo un mejor manejo de dependencias largas. En 2016, Google Translate fue renovado a Google Neural Machine Translation, utilizando un modelo seq2seq LSTM bidireccional de 8 capas, superando a los métodos estadísticos.

Paralelizando la atención

Los modelos seq2seq con atención aún sufrían la dificultad de paralelización de las redes recurrentes, limitando la aceleración por GPU. En 2016, la atención descomponible aplicó autoatención a redes de avance, logrando un estado del arte en implicación textual con menos parámetros. El autor Jakob Uszkoreit sospechó que la atención sin recurrencia podría ser suficiente para la traducción, lo que llevó al título "Attention Is All You Need".

Arquitectura

La arquitectura del transformador consiste en un codificador y un decodificador, cada uno compuesto por capas con autoatención de múltiples cabezas y redes de avance por posición. El codificador procesa la secuencia de entrada en paralelo, mientras que el decodificador genera salida autorregresivamente, utilizando autoatención enmascarada para prevenir la fuga de tokens futuros. La atención de múltiples cabezas ejecuta múltiples mecanismos de atención en paralelo, permitiendo que el modelo se enfoque en diferentes subespacios de representación. Las codificaciones posicionales se añaden a las incrustaciones de tokens para capturar el orden. La normalización de capas y las conexiones residuales estabilizan el entrenamiento. El decodificador también utiliza atención cruzada para atender a las salidas del codificador.

Variantes

Solo codificador

Los modelos solo codificador, como BERT, están optimizados para el aprendizaje de representaciones, produciendo incrustaciones de tokens contextualizadas útiles para tareas de clasificación y comprensión. Utilizan atención bidireccional, viendo tanto el contexto izquierdo como el derecho.

Solo decodificador

Los modelos solo decodificador, como GPT, están diseñados para la generación autorregresiva, prediciendo el siguiente token dado los anteriores. Utilizan autoatención enmascarada y son la base de la mayoría de los LLM modernos, entrenados en grandes corpus de texto.

Codificador-decodificador

Los modelos codificador-decodificador, como el transformador original, manejan tareas condicionales de secuencia a secuencia como traducción y resumen. El codificador procesa la fuente, y el decodificador genera el objetivo.

Aplicaciones

Los transformadores se utilizan en sistemas de IA generativa, incluidos LLM como GPT y BERT, que han sido adoptados por empresas como OpenAI, Anthropic y Google DeepMind. Impulsan el procesamiento del lenguaje natural, la visión por computadora (transformadores de visión), el aprendizaje por refuerzo, el procesamiento de audio, el aprendizaje multimodal, la robótica e incluso programas de ajedrez. Su escalabilidad ha impulsado avances en hardware, con chips especializados como AWS Trainium y los procesadores de inferencia de Groq.

Impacto

Los transformadores han revolucionado la inteligencia artificial, permitiendo sistemas preentrenados que pueden ajustarse para diversas tareas. Han reducido el tiempo de entrenamiento en comparación con las RNN y han permitido tamaños de modelo sin precedentes, lo que ha llevado a avances en la comprensión y generación del lenguaje. La flexibilidad de la arquitectura la ha convertido en la opción predeterminada para muchas aplicaciones de IA, influyendo tanto en la investigación como en la industria.

Limitaciones y Futuro

A pesar de su éxito, los transformadores requieren cálculo cuadrático en la longitud del contexto, lo que hace que las secuencias largas sean costosas. Los investigadores están explorando mecanismos de atención lineal y arquitecturas alternativas para abordar esto. A partir de 2025, los transformadores siguen siendo dominantes, pero las innovaciones en curso pueden llevar a diseños más eficientes.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:deep-learning·neural-network·natural-language-processing
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial