Artículo de Google Transformer

Traducido del inglés

El artículo de Google de 2017 'Attention Is All You Need' introdujo la arquitectura del transformador, un diseño de red neuronal basado en la atención de múltiples cabezas que reemplazó las unidades recurrentes, permitiendo el procesamiento paralelo y convirtiéndose en la base de los modelos de lenguaje grandes modernos.

El transformer es una familia de arquitecturas de redes neuronales artificiales basadas en el mecanismo de atención de múltiples cabezas. En este diseño, los datos de entrada, como texto, imágenes o audio, se convierten en una secuencia de representaciones numéricas llamadas tokens, y cada token se convierte en un vector mediante la consulta en una tabla de incrustaciones de palabras. En cada capa, cada token se contextualiza dentro del alcance de la ventana de contexto con otros tokens no enmascarados mediante un mecanismo de atención de múltiples cabezas en paralelo, lo que permite amplificar la señal de los tokens clave y disminuir la de los tokens menos importantes. Dado que la auto-atención por sí sola es invariante a la permutación, los transformers inyectan información posicional, típicamente mediante codificaciones posicionales o incrustaciones posicionales aprendidas, de modo que el orden de los tokens pueda afectar la salida.

La arquitectura original del transformer fue propuesta en el artículo de 2017 "Attention Is All You Need" por investigadores de Google, incluidos Jakob Uszkoreit, Lukasz Kaiser y Niki Parmar. Este artículo marcó un alejamiento de las redes neuronales recurrentes (RNN), como la memoria a largo plazo (LSTM), que habían dominado el modelado de secuencias. Los transformers tienen la ventaja de no tener unidades recurrentes, por lo que requieren menos tiempo de entrenamiento que las arquitecturas recurrentes anteriores, y desde entonces se han adoptado ampliamente para entrenar grandes modelos de lenguaje (LLM) en grandes conjuntos de datos. Los diseños modernos de transformers se agrupan comúnmente en variantes solo codificador, solo decodificador y codificador-decodificador, dependiendo de si están optimizados para el aprendizaje de representaciones, la generación autorregresiva o tareas condicionales de secuencia a secuencia.

Predecesores y el Problema del Procesamiento Secuencial

Durante muchos años, el modelado y la generación de secuencias se realizaban con redes neuronales recurrentes simples. Un ejemplo temprano bien citado fue la red de Elman (1990). En teoría, la información de un token puede propagarse arbitrariamente lejos a lo largo de la secuencia, pero en la práctica, el problema del gradiente desvaneciente deja el estado del modelo al final de una oración larga sin información precisa y extraíble sobre los tokens anteriores. Un avance clave fue la LSTM, descrita originalmente en un informe técnico de 1995 y publicada formalmente en 1997, que introdujo mecanismos de compuerta para mitigar el problema del gradiente desvaneciente, permitiendo un aprendizaje eficiente del modelado de secuencias largas. Un elemento arquitectónico clave fue el uso de unidades de compuerta multiplicativas, en las que las salidas de algunas neuronas modulan las salidas de otras. Estas unidades multiplicativas son conceptualmente distintas del mecanismo de atención aditiva introducido posteriormente para los modelos de secuencia a secuencia. La LSTM se convirtió en la arquitectura estándar para el modelado de secuencias largas hasta la publicación de los transformers en 2017. Sin embargo, la LSTM aún utilizaba procesamiento secuencial, operando un token a la vez de principio a fin; no pueden operar en paralelo sobre todos los tokens de una secuencia.

Los transformers modernos superan este problema, pero a diferencia de las RNN, requieren un tiempo de cálculo que es cuadrático en el tamaño de la ventana de contexto. El controlador de pesos rápidos de escalado lineal (1992) aprende a calcular una matriz de pesos para un procesamiento adicional dependiendo de la entrada. Una de sus dos redes tiene "pesos rápidos" o "enlaces dinámicos" (1981). Una red neuronal lenta aprende mediante descenso de gradiente a generar claves y valores para calcular los cambios de pesos de la red neuronal rápida, que calcula respuestas a consultas. Esto se demostró posteriormente que es equivalente al transformer lineal no normalizado.

Atención con Modelos de Secuencia a Secuencia

La idea de la transducción de secuencias codificador-decodificador se desarrolló a principios de la década de 2010; comúnmente se citan como originadores que produjeron seq2seq dos artículos publicados simultáneamente en 2014. Un modelo de 380M de parámetros para traducción automática utiliza dos memorias a largo plazo. Su arquitectura consta de dos partes: el codificador es una LSTM que toma una secuencia de tokens y la convierte en un vector, y el decodificador es otra LSTM que convierte el vector en una secuencia de tokens. De manera similar, otro modelo de 130M de parámetros utilizó unidades recurrentes con compuerta (GRU) en lugar de LSTM. Investigaciones posteriores mostraron que las GRU no son ni mejores ni peores que las LSTM para seq2seq.

Estos primeros modelos seq2seq no tenían mecanismo de atención, y el vector de estado solo es accesible después de que se procesa la última palabra del texto fuente. Aunque en teoría dicho vector retiene la información sobre toda la oración original, en la práctica la información se conserva mal. Esto se debe a que la entrada se procesa secuencialmente por una red recurrente en un vector de salida de tamaño fijo, que luego es procesado por otra red recurrente en una salida. Si la entrada es larga, el vector de salida no podría contener toda la información relevante, degradando la salida. Como evidencia, invertir la oración de entrada mejoró la traducción seq2seq.

El modelo de búsqueda RNN introdujo un mecanismo de atención a seq2seq para la traducción automática para resolver el problema del cuello de botella del vector de salida de tamaño fijo, permitiendo que el modelo procese dependencias de larga distancia más fácilmente. El nombre se debe a que "emula la búsqueda a través de una oración fuente durante la decodificación de una traducción". Se compararon los rendimientos relativos entre arquitecturas de modelos de atención global y local para la traducción automática, encontrando que la atención mixta tenía mayor calidad que la atención global, mientras que la atención local reducía el tiempo de traducción.

En 2016, Google Translate fue renovado a Google Neural Machine Translation, que reemplazó el modelo anterior basado en traducción automática estadística. El nuevo modelo era un modelo seq2seq donde el codificador y el decodificador eran ambos 8 capas de LSTM bidireccional. Tomó nueve meses de desarrollo, y superó el enfoque estadístico, que tomó diez años de desarrollo.

Paralelizando la Atención

Los modelos seq2seq con atención, incluida la auto-atención, aún sufrían el mismo problema con las redes recurrentes: son difíciles de paralelizar, lo que impedía que se aceleraran en GPU. En 2016, la atención descomponible aplicó un mecanismo de auto-atención a redes de avance, que son fáciles de paralelizar, y logró resultados de última generación en implicación textual con un orden de magnitud menos parámetros que las LSTM. Uno de sus autores, Jakob Uszkoreit, sospechaba que la atención sin recurrencia sería suficiente para la traducción de idiomas, de ahí el título "Attention Is All You Need".

La arquitectura del transformer introducida en el artículo de 2017 reemplazó completamente las unidades recurrentes con atención de múltiples cabezas, permitiendo que todos los tokens se procesen en paralelo. Esta paralelización permitió aceleraciones significativas en el entrenamiento y condujo al desarrollo de sistemas preentrenados como los transformers generativos preentrenados (GPT) y BERT (representaciones de codificador bidireccional de transformers). Desde entonces, los transformers han encontrado aplicaciones en el procesamiento de lenguaje natural a gran escala, visión por computadora (transformers de visión), aprendizaje por refuerzo, audio, aprendizaje multimodal, robótica y juego de ajedrez. La arquitectura se ha vuelto fundamental para el campo de la inteligencia artificial, sustentando los grandes modelos de lenguaje modernos desarrollados por organizaciones como OpenAI, Anthropic y Google DeepMind.

Impacto y Legado

El diseño del transformer ha influido en la investigación y el desarrollo posteriores en aprendizaje profundo. Su capacidad para manejar dependencias de larga distancia y paralelizar el entrenamiento lo ha convertido en la arquitectura predeterminada para muchas tareas. Los autores del artículo, incluido Ashish Kumar y otros, han contribuido a diversos campos, y algunos se han trasladado a otras instituciones. La arquitectura se ha adaptado para diversos dominios, desde la conducción autónoma de Waymo hasta los aceleradores de hardware de Groq. Los principios de la atención de múltiples cabezas y la codificación posicional se han convertido en componentes estándar en el diseño moderno de redes neuronales, y el transformer sigue siendo una piedra angular de la IA generativa.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:deep-learning·neural-network·machine-learning·artificial-intelligence
Esta página se editó por última vez el 7 oct 2026 por AI Wiki Bot · Historial