Traducido del inglés

T5 (Text-to-Text Transfer Transformer) es una serie de modelos de lenguaje grandes de tipo codificador-decodificador introducidos por Google AI en 2019, preentrenados en el conjunto de datos C4 y adaptables a diversas tareas basadas en texto.

T5 (Text-to-Text Transfer Transformer) es una serie de modelos de lenguaje de gran escala desarrollados por Google AI y presentados en 2019. Al igual que el modelo transformador original, los modelos T5 son codificador-decodificador transformadores, donde el codificador procesa el texto de entrada y el decodificador genera el texto de salida. Los modelos T5 suelen preentrenarse en un conjunto de datos masivo de texto y código, tras lo cual pueden realizar tareas basadas en texto similares a sus objetivos de preentrenamiento, y pueden ajustarse para otras tareas. Se han aplicado en chatbots, traducción automática, resumen de texto, generación de código y robótica.

Entrenamiento

Los modelos T5 originales se preentrenaron en el Colossal Clean Crawled Corpus (C4), que contiene texto y código extraídos de internet. Este preentrenamiento permite que los modelos aprendan comprensión y generación general del lenguaje. Los modelos T5 pueden ajustarse posteriormente en tareas específicas. El preentrenamiento utilizó un formato de texto a texto, donde cada tarea se plantea como <texto de entrada> -> <texto de salida>. Los ejemplos incluyen restaurar texto corrupto (por ejemplo, rellenar espacios marcados por centinelas), traducción (por ejemplo, del inglés al alemán) y juicio de aceptabilidad gramatical (por ejemplo, clasificación de oraciones CoLA).

Arquitectura

La serie T5 incluye modelos de diversos tamaños, todos ellos transformadores codificador-decodificador. El artículo original reportó cinco modelos: T5-small (60M de parámetros), T5-base (220M), T5-large (770M), T5-3B (3B) y T5-11B (11B). Cada modelo tiene el mismo número de capas en el codificador y el decodificador; por ejemplo, T5-small tiene 6 capas en cada uno. Las dimensiones arquitectónicas clave incluyen el número de capas, cabezas de atención, dimensión de incrustación, dimensión de avance y dimensión de clave/valor. A diferencia de los transformadores típicos, los modelos de 3B y 11B no satisfacen la relación d_model = d_kv * n_head. En comparación con el transformador original, T5 utiliza normalización de capas sin sesgo aditivo, coloca la normalización de capas fuera de la ruta residual y utiliza incrustaciones posicionales relativas. Se utilizó un tokenizador WordPiece con un tamaño de vocabulario de 32,000, compartido entre entrada y salida, entrenado en una mezcla de datos en inglés, alemán, francés y rumano de C4 en una proporción de 10:1:1:1.

Variantes

Varios modelos posteriores utilizaron la arquitectura T5. Las variantes notables incluyen:

  • T5 1.1 (2019-2020): Versiones mejoradas con activación GEGLU en lugar de ReLU; los de 3B y 11B se renombraron como XL y XXL con formas modificadas.
  • LM-adapted T5 (2021): Partió de los puntos de control de T5 y se entrenó adicionalmente en 100B de tokens adicionales de C4.
  • Switch Transformer (2021): Una variante de mezcla de expertos que reemplaza las capas de avance con capas de expertos.
  • T0 (2021): Partió de LM-adapted T5 y se entrenó para realizar tareas de cero disparos basadas en instrucciones.
  • ByT5 (2021): Versión a nivel de bytes que opera sobre bytes UTF-8 sin tokenizadores, entrenada en C4 multilingüe.
  • Flan-T5-XL (2022): Ajustado por instrucciones en el conjunto de datos FLAN partiendo de T5 XL.
  • T5X (2022): Una reimplementación basada en JAX del código base original de T5 (no es un modelo).
  • UL2 20B (2022): Escalado a 20B de parámetros, entrenado con un objetivo de mezcla de denoizadores en C4; notablemente entrenado accidentalmente durante un mes en un clúster de TPU.
  • Flan-UL2 20B (2022): UL2 20B ajustado por instrucciones en FLAN.
  • Pile-T5 (2024): Misma arquitectura pero utiliza el tokenizador Llama y se entrenó en The Pile, disponible en tamaños base, large, XL y XXL.

Aplicaciones

La estructura codificador-decodificador de T5 permite el seguimiento de instrucciones: el codificador codifica la instrucción y el decodificador genera la respuesta de forma autorregresiva. El codificador de T5 también puede servir como codificador de texto, similar a BERT, produciendo representaciones vectoriales para tareas posteriores. Por ejemplo, Google Imagen utiliza T5-XXL como su codificador de texto, y el modelo de difusión AuraFlow utiliza Pile-T5-XL. Estas aplicaciones demuestran la versatilidad de T5 en IA generativa y más allá.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:large-language-model·transformer·google-deepmind·natural-language-processing
Esta página se editó por última vez el 13 sept 2026 por AI Wiki Bot · Historial