"Attention Is All You Need" es un artículo de investigación de 2017 sobre aprendizaje automático, escrito por ocho científicos e ingenieros que trabajaban en Google. El artículo introdujo una nueva arquitectura de aprendizaje profundo conocida como el transformer, basada en el mecanismo de atención propuesto en 2014 por Bahdanau et al. El enfoque del transformer que describe se ha convertido en la arquitectura principal de una amplia variedad de sistemas de inteligencia artificial, incluidos los grandes modelos de lenguaje. En ese momento, el enfoque de la investigación era mejorar las técnicas Seq2seq para la traducción automática, pero los autores fueron más allá en el artículo, previendo el potencial de la técnica para otras tareas como la respuesta a preguntas y lo que ahora se conoce como IA generativa multimodal.
Algunos ejemplos tempranos en los que el equipo probó su arquitectura Transformer incluyeron la traducción de inglés a alemán, la generación de artículos de Wikipedia sobre "The Transformer" y el análisis sintáctico. Estos convencieron al equipo de que el Transformer es un modelo de lenguaje de propósito general, y no solo bueno para la traducción. Hasta 2026, el artículo ha sido citado más de 250,000 veces, situándose entre los diez artículos más citados del siglo XXI. Después de que Google publicara el artículo, cada uno de los ocho autores dejó la empresa para unirse a otras compañías o fundar startups.
Antecedentes
Los autores del artículo son Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan Gomez, Lukasz Kaiser e Illia Polosukhin. Los ocho autores fueron "contribuyentes iguales" al artículo; el orden listado fue aleatorizado (según el propio artículo). Después del artículo, cada uno de los autores dejó Google para unirse a otras compañías o fundar startups.
El título del artículo es una referencia a la canción "All You Need Is Love" de los Beatles. El nombre "Transformer" se eligió porque a Jakob Uszkoreit, uno de los autores del artículo, le gustaba el sonido de esa palabra. Un documento de diseño temprano se tituló "Transformers: Iterative Self-Attention and Processing for Various Tasks", e incluía una ilustración de seis personajes de la franquicia Transformers. El equipo se llamó Team Transformer.
Métodos discutidos e introducidos
El artículo es más conocido por introducir la arquitectura Transformer, que subyace a la mayoría de los grandes modelos de lenguaje (LLM) modernos. Una razón clave por la que la arquitectura es preferida por la mayoría de los LLM modernos es la paralelizabilidad de la arquitectura sobre sus predecesores. Esto asegura que las operaciones necesarias para el entrenamiento puedan acelerarse en una GPU, permitiendo tanto tiempos de entrenamiento más rápidos como el entrenamiento de modelos de mayor tamaño.
El artículo introdujo los siguientes mecanismos como parte del desarrollo de la arquitectura transformer.
Atención de producto punto escalado y autoatención
El uso del mecanismo de atención de producto punto escalado y autoatención en lugar de una red neuronal recurrente (RNN) o memoria a largo plazo a corto plazo (que dependen de la recurrencia) permite un mejor rendimiento como se describe en el siguiente párrafo. El artículo describió la atención de producto punto escalado de la siguiente manera:
Attention(Query, Key, Value) := softmax(Query × Key^T / sqrt(d_k)) × Value
donde Query, Key, Value son respectivamente las matrices de consulta, clave y valor, y d_k es la dimensión de los valores. Dado que el modelo depende de matrices de Query, Key y Value que provienen de la misma fuente (es decir, la secuencia de entrada o ventana de contexto), esto elimina la necesidad de RNN, asegurando completamente la paralelizabilidad de la arquitectura. Esto difiere de la forma original del mecanismo de Atención introducido en 2014. Además, el artículo discute el uso de un factor de escalado adicional que se encontró más efectivo con respecto a la dimensión de los vectores clave (representada como d_k e inicialmente establecida en 64 dentro del artículo) de la manera mostrada arriba. En el contexto específico de la traducción, en el que se centró el artículo, las matrices de Query y Key suelen representarse en incrustaciones correspondientes al idioma fuente, mientras que la matriz de Value corresponde al idioma objetivo.
Atención de múltiples cabezas
En el mecanismo de autoatención, las consultas (Q), claves (K) y valores (V) se generan dinámicamente para cada secuencia de entrada (típicamente limitada por el tamaño de la ventana de contexto), permitiendo que el modelo se enfoque en diferentes partes de la secuencia de entrada en diferentes pasos. La atención de múltiples cabezas mejora este proceso al introducir múltiples cabezas de atención paralelas. Cada cabeza de atención aprende diferentes proyecciones lineales de las matrices Q, K y V. Esto permite que el modelo capture diferentes aspectos de las relaciones entre palabras en la secuencia simultáneamente, en lugar de centrarse en un solo aspecto. Al hacerlo, el modelo puede atender a información de diferentes subespacios de representación en diferentes posiciones, lo que mejora su capacidad para manejar patrones lingüísticos complejos.
Codificación posicional
El artículo introdujo codificación posicional para inyectar información sobre la posición de los tokens en la secuencia, ya que la arquitectura no procesa inherentemente los tokens en orden. Los autores propusieron usar funciones seno y coseno de diferentes frecuencias para codificar posiciones, permitiendo que el modelo aprenda posiciones relativas. Este mecanismo se ha convertido en estándar en los modelos basados en transformer, aunque variantes posteriores han explorado incrustaciones aprendidas u otros enfoques.
Otras innovaciones
El artículo también discutió el uso de normalización de capas y conexiones residuales para estabilizar el entrenamiento, así como abandono para regularización. Estos componentes, combinados con los mecanismos de atención, formaron la base del bloque transformer. Los autores entrenaron sus modelos en tareas de traducción automática, logrando resultados de última generación con tiempos de entrenamiento más rápidos en comparación con los modelos recurrentes.
Impacto y legado
Tras su publicación, la arquitectura Transformer se convirtió rápidamente en el enfoque dominante en el procesamiento del lenguaje natural. Sustenta sistemas importantes desarrollados por organizaciones como OpenAI, Google DeepMind y Anthropic, incluidos grandes modelos de lenguaje como GPT y BERT. La arquitectura también se ha aplicado más allá del texto, influyendo en campos como la visión por computadora y el procesamiento de audio. La influencia del artículo se refleja en su número de citas, que supera las 250,000 hasta 2026, convirtiéndolo en uno de los trabajos más citados en ciencias de la computación.
La salida de los ocho autores de Google poco después de la publicación llevó a la fundación de varias startups de IA, incluidas Cohere e Inceptive, y contribuyó a la comercialización más amplia de las tecnologías basadas en transformer. El título del artículo, que hace referencia a la canción de los Beatles, y las convenciones de nombres lúdicas del equipo se han convertido en parte del folclore de la IA.