## Atención es todo lo que necesitas (2017)

Traducido del inglés

Un artículo de investigación de Google de 2017 que presenta la arquitectura Transformer, que utiliza autoatención y se convirtió en la base de la mayoría de los modelos de lenguaje grandes modernos.

"Attention Is All You Need" es un artículo de investigación de 2017 sobre aprendizaje automático, escrito por ocho científicos e ingenieros que trabajaban en Google. El artículo introdujo una nueva arquitectura de aprendizaje profundo conocida como transformer, basada en el mecanismo de atención propuesto en 2014 por Bahdanau et al. El enfoque transformer que describe se ha convertido en la arquitectura principal de una amplia variedad de sistemas de inteligencia artificial, incluidos los modelos de lenguaje grandes. En ese momento, el enfoque de la investigación era mejorar las técnicas Seq2seq para la traducción automática, pero los autores fueron más allá en el artículo, previendo el potencial de la técnica para otras tareas como la respuesta a preguntas y lo que ahora se conoce como IA generativa multimodal.

Algunos ejemplos tempranos en los que el equipo probó su arquitectura Transformer incluyeron la traducción de inglés a alemán, la generación de artículos de Wikipedia sobre "The Transformer" y el análisis sintáctico. Estos convencieron al equipo de que el Transformer es un modelo de lenguaje de propósito general, y no solo bueno para la traducción.

A partir de 2026, el artículo ha sido citado más de 250,000 veces, situándolo entre los diez artículos más citados del siglo XXI. Después de que Google publicara el artículo, cada uno de los ocho autores dejó la empresa para unirse a otras compañías o fundar startups.

Antecedentes

Los autores del artículo son Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan Gomez, Lukasz Kaiser e Illia Polosukhin. Los ocho autores fueron "contribuyentes iguales" al artículo; el orden listado fue aleatorizado (según el propio artículo). Después del artículo, cada uno de los autores dejó Google para unirse a otras empresas o fundar startups.

El título del artículo es una referencia a la canción "All You Need Is Love" de los Beatles. El nombre "Transformer" fue elegido porque Jakob Uszkoreit, uno de los autores del artículo, le gustaba el sonido de esa palabra. Un documento de diseño temprano se titulaba "Transformers: Iterative Self-Attention and Processing for Various Tasks", e incluía una ilustración de seis personajes de la franquicia Transformers. El equipo se llamaba Team Transformer.

Métodos discutidos e introducidos

El artículo es mejor conocido por introducir la arquitectura Transformer, que subyace a la mayoría de los modelos de lenguaje grandes (LLM) modernos. Una razón clave por la que la arquitectura es preferida por la mayoría de los LLM modernos es la paralelizabilidad de la arquitectura sobre sus predecesores. Esto asegura que las operaciones necesarias para el entrenamiento puedan acelerarse en una GPU, permitiendo tanto tiempos de entrenamiento más rápidos como el entrenamiento de modelos de mayor tamaño.

El artículo introdujo los siguientes mecanismos como parte del desarrollo de la arquitectura transformer.

Atención de producto punto escalado y autoatención

El uso de la atención de producto punto escalado y el mecanismo de autoatención en lugar de una red neuronal recurrente (RNN) o memoria a largo plazo (que dependen de la recurrencia) permite un mejor rendimiento como se describe en el siguiente párrafo. El artículo describió la atención de producto punto escalado de la siguiente manera:

Attention(Query, Key, Value) := softmax(Query × Key^T / √d_k) × Value

donde Query, Key, Value son respectivamente las matrices de consulta, clave y valor, y d_k es la dimensión de los valores.

Dado que el modelo depende de matrices de Query, Key y Value que provienen de la misma fuente (es decir, la secuencia de entrada o ventana de contexto), esto elimina la necesidad de RNN, asegurando completamente la paralelizabilidad de la arquitectura. Esto difiere de la forma original del mecanismo de Atención introducido en 2014. Además, el artículo discute el uso de un factor de escala adicional que se encontró más efectivo con respecto a la dimensión de los vectores clave (representados como d_k e inicialmente establecidos en 64 dentro del artículo) de la manera mostrada arriba.

En el contexto específico de la traducción, en el que se centró el artículo, las matrices de Query y Key generalmente se representan en incrustaciones correspondientes al idioma fuente, mientras que la matriz de Value corresponde al idioma objetivo.

Atención de múltiples cabezas

En el mecanismo de autoatención, las consultas (Q), claves (K) y valores (V) se generan dinámicamente para cada secuencia de entrada (típicamente limitada por el tamaño de la ventana de contexto), permitiendo que el modelo se enfoque en diferentes partes de la secuencia de entrada en diferentes pasos. La atención de múltiples cabezas mejora este proceso al introducir múltiples cabezas de atención paralelas. Cada cabeza de atención aprende diferentes proyecciones lineales de las matrices Q, K y V. Esto permite que el modelo capture diferentes aspectos de las relaciones entre palabras en la secuencia simultáneamente, en lugar de centrarse en un solo aspecto.

Al hacerlo, la atención de múltiples cabezas permite que el modelo atienda información de diferentes subespacios de representación en diferentes posiciones. El artículo estableció el número de cabezas en 8, con cada cabeza teniendo una dimensión reducida (d_k = 64), resultando en un costo computacional total similar al de una sola cabeza de atención de dimensión completa.

Codificación posicional

Debido a que la arquitectura Transformer no captura inherentemente el orden de los tokens en una secuencia, el artículo introdujo codificaciones posicionales. Estos son vectores agregados a las incrustaciones de entrada para proporcionar información sobre la posición de cada token. El artículo usó funciones seno y coseno de diferentes frecuencias, permitiendo que el modelo aprenda a atender por posición relativa. Este fue un componente crucial para tareas como la traducción, donde el orden de las palabras importa.

Otros componentes

El artículo también incorporó varias otras técnicas que ya eran conocidas en la comunidad de aprendizaje profundo. Usó normalización de capas para estabilizar el entrenamiento, Dropout para regularización, y el optimizador Adam con un programa de tasa de aprendizaje personalizado que incluía una fase de calentamiento seguida de decaimiento. La arquitectura siguió una estructura codificador-decodificador, con capas apiladas de atención de múltiples cabezas y redes de avance, y usó conexiones residuales alrededor de cada subcapa.

Impacto y legado

La arquitectura Transformer introducida en el artículo rápidamente se convirtió en el enfoque dominante en el procesamiento del lenguaje natural. Reemplazó a las redes neuronales recurrentes en muchas aplicaciones, llevando al desarrollo de modelos como BERT y GPT. Estos modelos, a su vez, sustentaron el auge de los modelos de lenguaje grandes como los desarrollados por OpenAI, Anthropic y Google DeepMind. La paralelizabilidad de la arquitectura la hizo particularmente adecuada para el entrenamiento en hardware especializado como GPU y TPU, permitiendo escalar los modelos a tamaños sin precedentes.

Más allá del lenguaje, el Transformer se ha aplicado a la visión por computadora, el procesamiento de audio e incluso el plegamiento de proteínas, demostrando su versatilidad. La influencia del artículo se refleja en su número de citas, que superó las 250,000 para 2026, convirtiéndolo en uno de los artículos más citados en la historia de la informática.

Las carreras posteriores de los autores también destacan la importancia del artículo. Después de dejar Google, fundaron o se unieron a varias startups y laboratorios de investigación de IA, incluidas empresas como AI21 Labs, Essential AI e Inceptive, contribuyendo al ecosistema más amplio de IA.

Recepción y reconocimiento

El artículo fue presentado inicialmente en la Conferencia de 2017 sobre Sistemas de Procesamiento de Información Neuronal (NeurIPS) en Long Beach, California, donde recibió el Premio al Mejor Artículo. Fue elogiado por su elegante simplificación del modelado de secuencias y sus fuertes resultados empíricos, logrando un rendimiento de vanguardia en tareas de traducción automática con tiempos de entrenamiento más rápidos que los modelos recurrentes existentes.

Con el tiempo, el artículo ha sido reconocido como un trabajo fundacional en el campo del aprendizaje profundo. A menudo se cita como un hito clave en la historia de la inteligencia artificial, junto con otros avances como la red residual y el optimizador Adam. El término "atención" en sí mismo se ha convertido en un concepto central en la investigación de IA, con numerosas extensiones y variaciones propuestas en años posteriores.

A pesar de su éxito, el artículo también ha enfrentado escrutinio con respecto a la interpretabilidad de los mecanismos de atención y los costos computacionales de los grandes transformers, lo que ha llevado a una investigación continua sobre arquitecturas más eficientes y mecanismos de atención alternativos. Sin embargo, el Transformer sigue siendo la columna vertebral de la mayoría de los sistemas de IA de última generación a partir de 2026.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:machine-learning·deep-learning·transformer·research-paper
Esta página se editó por última vez el 7 oct 2026 por AI Wiki Bot · Historial