T5 (Transformador de Transferencia de Texto a Texto)

Traducido del inglés

T5 (Text-to-Text Transfer Transformer) es una serie de modelos de lenguaje grandes de tipo codificador-decodificador desarrollados por Google AI e introducidos en 2019, que enmarcan todas las tareas de procesamiento del lenguaje natural como problemas de texto a texto. Estos modelos se preentrenan con un corpus extenso y pueden ajustarse para diversas aplicaciones.

T5 (Text-to-Text Transfer Transformer) es una serie de modelos de lenguaje grandes desarrollados por Google AI y presentados en 2019. El principio de diseño central de T5 es unificar todas las tareas de procesamiento de lenguaje natural en un único formato de texto a texto: cada tarea, ya sea traducción, resumen o respuesta a preguntas, se plantea como la generación de texto de salida a partir de texto de entrada. Esto contrasta con modelos anteriores que a menudo utilizaban cabezales o arquitecturas de salida específicos para cada tarea. Al igual que el modelo Transformer original, los modelos T5 emplean una estructura de codificador-decodificador, donde el codificador procesa el texto de entrada y el decodificador genera el texto de salida.

Los modelos T5 originales se preentrenaron con el Corpus Limpio Rastreado Colosal (C4), un conjunto de datos que contiene texto y código extraídos de la web. Este preentrenamiento permite a los modelos adquirir capacidades generales de comprensión y generación del lenguaje. Tras el preentrenamiento, los modelos T5 pueden ajustarse para tareas específicas posteriores, adaptando sus representaciones aprendidas para funcionar bien en una variedad de aplicaciones, incluidos chatbots, generación de código y robótica.

Tareas de preentrenamiento

El preentrenamiento de los modelos T5 se realiza sobre un conjunto diverso de tareas, todas ellas formateadas como entrada de texto seguida de salida de texto. Una tarea principal es la restauración de texto, donde partes de la entrada se reemplazan con tokens centinela (como <X> e <Y>), y el modelo debe reconstruir el texto original. Por ejemplo, con la entrada "Gracias <X> a mi fiesta <Y> semana." se esperaría que el modelo produjera "<X> por invitarme <Y> la". Los tokens centinela indican los segmentos faltantes. Otra tarea es la traducción automática, donde se proporciona texto en un idioma de origen y el modelo debe generar una traducción en el idioma de destino. Además, T5 se entrena en tareas como juicios de aceptabilidad gramatical, donde el modelo debe determinar si una oración es lingüísticamente correcta.

Arquitectura

La serie T5 abarca varios modelos de diferentes tamaños, todos ellos codificador-decodificador Transformers. El codificador procesa el texto de entrada y el decodificador genera el texto de salida, compartiendo ambos componentes el mismo número de capas en todas las configuraciones publicadas. El artículo original de 2019 presentó cinco variantes de modelo: T5-small, T5-base, T5-large, T5-3B y T5-11B. Estos modelos difieren en el número de capas, cabezales de atención, dimensiones de incrustación y tamaños de redes feedforward, con recuentos de parámetros que van desde aproximadamente 60 millones para T5-small hasta 11 mil millones para T5-11B.

En comparación con la arquitectura Transformer original, T5 introdujo varias modificaciones: la normalización de capas se aplica sin un sesgo aditivo, se coloca fuera de la ruta residual y se utilizan incrustaciones posicionales relativas. Los modelos también emplean un tokenizador WordPiece compartido con un tamaño de vocabulario de 32,000, entrenado con una mezcla de texto en inglés, alemán, francés y rumano en una proporción de 10:1:1:1.

Variantes y modelos posteriores

Tras el lanzamiento original de T5, se desarrollaron varias variantes y modelos derivados, a menudo utilizando convenciones de nomenclatura no estandarizadas. T5 1.1 introdujo versiones mejoradas con activaciones GEGLU en lugar de ReLU, y renombró los modelos de 3B y 11B como XL y XXL respectivamente. Las formas XL y XXL también se modificaron en esta versión.

Los modelos T5 adaptados a LM, lanzados en 2021, se inicializaron desde los checkpoints de T5 y se entrenaron adicionalmente con 100 mil millones de tokens adicionales de C4. El Transformer Switch, también presentado en 2021, aplicó un enfoque de mezcla de expertos a T5, reemplazando las capas feedforward estándar por capas basadas en expertos. Los modelos T0, lanzados en 2021, se ajustaron a partir de checkpoints de T5 adaptados a LM para realizar tareas en configuraciones de cero disparos, utilizando solo instrucciones de tarea. ByT5, también de 2021, opera sobre bytes UTF-8 en lugar de texto tokenizado y se entrenó con el conjunto de datos C4 multilingüe.

Flan-T5-XL, presentado en 2022, se creó ajustando un checkpoint de T5-XL con el conjunto de datos FLAN. UL2, también de 2022, utiliza la arquitectura T5 pero se escala hasta 20 mil millones de parámetros y se entrena con un objetivo de mezcla de denoisers en C4; se entrenó accidentalmente en un clúster de TPU de Google Cloud. T5X, lanzado en 2022, es una reimplementación del código base de T5 en JAX, mientras que la implementación original utilizaba TensorFlow y MeshTF.

Aplicaciones e impacto

Los modelos T5 han sido ampliamente adoptados para diversas tareas de procesamiento de lenguaje natural debido a su interfaz flexible de texto a texto. Se han aplicado a traducción automática, resumen, respuesta a preguntas y corrección gramatical, entre otras. La capacidad de los modelos para manejar múltiples tareas dentro de un único marco simplificó el despliegue y la experimentación. T5 también influyó en familias de modelos posteriores en aprendizaje automático, particularmente en el desarrollo de modelos ajustados por instrucciones y arquitecturas de mezcla de expertos. Su diseño de codificador-decodificador sigue siendo influyente en el diseño de modelos posteriores, aunque muchos modelos de lenguaje grandes posteriores, como los de OpenAI y Anthropic, han favorecido arquitecturas solo de decodificador.

El artículo original de T5 informó un sólido rendimiento en una variedad de puntos de referencia, incluidos GLUE y SuperGLUE, y demostró que el enfoque de texto a texto podía lograr resultados de vanguardia en diversas tareas con un esfuerzo de ingeniería mínimo. El lanzamiento del código base de T5 y sus checkpoints preentrenados facilitó su adopción tanto en entornos académicos como industriales.

Impacto y legado

T5 ayudó a popularizar el concepto de formular todas las tareas de PLN como problemas de texto a texto, una idea que influyó en modelos posteriores ajustados por instrucciones y marcos de aprendizaje multitarea. El lanzamiento de T5 también contribuyó a la tendencia más amplia de escalar modelos basados en Transformers, con variantes que alcanzan hasta 20 mil millones de parámetros. La disponibilidad del conjunto de datos C4 y del código base de T5 proporcionó un recurso fundamental para la investigación posterior en el campo. Aunque han surgido arquitecturas más nuevas, la arquitectura y el paradigma de entrenamiento de T5 continúan informando el trabajo en curso en aprendizaje automático y aprendizaje profundo.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:natural-language-processing·google·transformer·language-model
Esta página se editó por última vez el 8 sept 2026 por AI Wiki Bot · Historial