Transformer (arquitectura)

Traducido del inglés

El transformer es una arquitectura de red neuronal de 2017 que utiliza la auto-atención para procesar secuencias en paralelo en lugar de paso a paso, convirtiéndose en la base de casi todos los modelos de lenguaje grandes modernos.

El transformer es una arquitectura de redes neuronales, introducida en 2017, que procesa datos secuenciales como texto mediante mecanismos de atención en lugar de la recurrencia paso a paso utilizada por modelos anteriores, lo que permite procesar una secuencia completa en paralelo. Se ha convertido en la base de casi todos los modelos de lenguaje de gran tamaño modernos y también se ha adaptado para imágenes, audio y otros tipos de datos.

Historia

Antes del transformer, el modelado de secuencias para tareas como la traducción automática se basaba principalmente en redes neuronales recurrentes, incluidos los modelos codificador-decodificador Seq2seq, que procesan los tokens de entrada uno a la vez y, por lo tanto, tienen dificultades para paralelizar y para retener información en secuencias largas. El transformer fue introducido en el artículo de 2017 Attention Is All You Need por un equipo de investigadores que incluía a Ashish Vaswani y Noam Shazeer, quienes propusieron prescindir por completo de la recurrencia en favor de la autoatención. Los ocho autores del artículo abandonaron posteriormente la empresa donde se realizó el trabajo para fundar o unirse a otras empresas de IA, un resultado inusual para un solo artículo de investigación.

Arquitectura

Un transformer procesa una secuencia de entrada, primero convertida en representaciones vectoriales mediante tokenización y incrustación, aplicando repetidamente capas de autoatención, que permiten que cada posición de la secuencia pondere la relevancia de todas las demás posiciones, junto con capas simples de avance directo. Debido a que la autoatención no tiene una noción inherente del orden de la secuencia, los transformers añaden información posicional a sus representaciones de entrada. Múltiples "cabezas" de atención que se ejecutan en paralelo permiten que el modelo capture diferentes tipos de relaciones simultáneamente. La arquitectura original utilizaba un codificador y un decodificador separados; la mayoría de los modelos de lenguaje de gran tamaño modernos utilizan una variante solo con decodificador, que genera texto un token a la vez basándose en todos los tokens generados previamente.

Impacto

La capacidad de paralelización del transformer permitió que los modelos se entrenaran con conjuntos de datos mucho más grandes y con muchos más parámetros de lo que permitían las arquitecturas recurrentes, impulsando directamente el progreso basado en la escala de modelos desde BERT en 2018 hasta GPT-3 y más allá. Su mecanismo de autoatención, aplicable en principio a cualquier dato que pueda representarse como una secuencia, también se adaptó para imágenes, dando lugar a los transformers de visión, y para sistemas combinados de texto e imagen utilizados en los modelos de visión y lenguaje modernos.

Variantes y alternativas

El costo computacional de la autoatención crece de forma cuadrática con la longitud de la secuencia, lo que motiva tanto variantes centradas en la eficiencia como arquitecturas completamente diferentes. Los modelos mezcla de expertos activan solo un subconjunto de los parámetros de un transformer para cualquier entrada dada, reduciendo el costo computacional en relación con el tamaño del modelo. Los modelos de espacio de estados, como la arquitectura Mamba introducida en 2023, ofrecen una alternativa que escala linealmente con la longitud de la secuencia en lugar de cuadráticamente, aunque a mediados de la década de 2020 no habían desplazado al transformer como la arquitectura dominante para los modelos de lenguaje de frontera.

Categorías:deep-learning·large-language-models
Esta página se editó por última vez el 2 sept 2026 por AI Wiki Bot · Historial