Artículo del Transformer (2017)

Traducido del inglés

El artículo de 2017 'Attention Is All You Need', de ocho investigadores de Google, introdujo la arquitectura del transformador, que se basa en la autoatención y se ha convertido en la base de la mayoría de los modelos de lenguaje grandes modernos.

"Attention Is All You Need" es un artículo de investigación de 2017 sobre aprendizaje automático escrito por ocho científicos e ingenieros que trabajaban en Google. El artículo introdujo una nueva arquitectura de aprendizaje profundo conocida como transformador, basada en el mecanismo de atención propuesto en 2014 por Bahdanau et al. El enfoque del transformador se ha convertido en la arquitectura principal para una amplia variedad de sistemas de inteligencia artificial, incluidos los modelos de lenguaje de gran tamaño. En ese momento, la investigación se centraba en mejorar las técnicas de secuencia a secuencia para la traducción automática, pero los autores previeron el potencial de la técnica para otras tareas, como la respuesta a preguntas y lo que ahora se conoce como IA generativa multimodal.

Los primeros experimentos con la arquitectura del transformador incluyeron la traducción de inglés a alemán, la generación de artículos de Wikipedia sobre "El transformador" y el análisis sintáctico. Estas pruebas convencieron al equipo de que el transformador es un modelo de lenguaje de propósito general, no solo para traducción. En 2026, el artículo ha sido citado más de 250.000 veces, situándose entre los diez artículos más citados del siglo XXI. Tras su publicación, cada uno de los ocho autores dejó Google para unirse a otras empresas o fundar startups.

Antecedentes

Los autores son Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan Gomez, Lukasz Kaiser e Illia Polosukhin. Los ocho fueron contribuyentes por igual; el orden en que aparecen fue aleatorizado. El título hace referencia a la canción de los Beatles "All You Need Is Love". El nombre "Transformer" se eligió porque a Jakob Uszkoreit le gustaba el sonido de la palabra. Un documento de diseño inicial se titulaba "Transformers: Iterative Self-Attention and Processing for Various Tasks" e incluía una ilustración de seis personajes de la franquicia Transformers. El equipo se llamaba Team Transformer.

Métodos introducidos

El artículo es conocido principalmente por introducir la arquitectura del transformador, que subyace en la mayoría de los LLM modernos. Una razón clave para su preferencia es la paralelización de la arquitectura en comparación con sus predecesoras, lo que permite el entrenamiento en GPU y tiempos de entrenamiento más rápidos y modelos más grandes. El artículo introdujo varios mecanismos.

Atención de producto escalado y autoatención

El artículo describió la atención de producto escalado como: Attention(Query, Key, Value) = softmax(Query × Key^T / sqrt(d_k)) × Value, donde Query, Key y Value son matrices y d_k es la dimensión de las claves (inicialmente establecida en 64). El uso de la autoatención en lugar de redes neuronales recurrentes (RNN) o memoria a largo plazo (LSTM) elimina la recurrencia, garantizando la paralelización. En la traducción, las matrices Query y Key suelen corresponder a las incrustaciones del idioma de origen, mientras que Value corresponde al idioma de destino.

Atención de múltiples cabezas

En la autoatención, las consultas, claves y valores se generan dinámicamente para cada secuencia de entrada, lo que permite al modelo centrarse en diferentes partes. La atención de múltiples cabezas introduce múltiples cabezas de atención en paralelo, cada una aprendiendo diferentes proyecciones lineales de Q, K y V. Esto permite al modelo capturar diferentes aspectos de las relaciones entre palabras simultáneamente.

Codificación posicional

Dado que el transformador no tiene recurrencia, el artículo introdujo la codificación posicional para inyectar información sobre la posición de los tokens en la secuencia. Estas codificaciones se añaden a las incrustaciones de entrada, lo que permite al modelo utilizar la información de orden.

Impacto y legado

La arquitectura del transformador se ha convertido en la base de la mayoría de los modelos de lenguaje de gran tamaño modernos, incluidos los desarrollados por OpenAI, Anthropic y Google DeepMind. Su paralelización y escalabilidad han impulsado avances en la IA generativa y otros campos. La influencia del artículo se refleja en su número de citas, lo que lo convierte en uno de los artículos más citados del siglo XXI.

Consecuencias

Tras la publicación del artículo, los ocho autores abandonaron Google. Algunos fundaron startups, como Aidan Gomez (Cohere) y Noam Shazeer (Character.AI, que luego regresó a Google). Otros se unieron a empresas como NVIDIA o Intel. Su partida contribuyó a la difusión de la investigación basada en transformadores en toda la industria.

Véase también

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:machine-learning·deep-learning·transformer·research-paper
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial