Marco de texto a texto

Traducido del inglés

El Marco de Texto a Texto es un enfoque unificado en el procesamiento del lenguaje natural donde cada tarea se plantea como un problema de texto a texto, popularizado por el modelo T5 de Google AI en 2019.

El marco de texto a texto es una metodología en el procesamiento del lenguaje natural que reformula todas las tareas en un formato uniforme: dado un texto de entrada, el modelo produce un texto de salida. Este enfoque fue popularizado por el modelo T5 (Transformador de Transferencia de Texto a Texto), introducido por Google AI en 2019. Al unificar tareas como la traducción, el resumen y la respuesta a preguntas en un único paradigma de texto a texto, el marco simplifica el diseño del modelo y permite el aprendizaje por transferencia entre diversas tareas.

Los modelos T5 son arquitecturas Encoder-Decoder Architecture Transformer (architecture), donde el codificador procesa el texto de entrada y el decodificador genera el texto de salida. Este diseño sigue el modelo Transformer (architecture) original, pero incorpora modificaciones como incrustaciones posicionales relativas y normalización de capas colocada fuera de la ruta residual. La flexibilidad del marco permite manejar una amplia gama de tareas, desde la corrección de errores gramaticales hasta la generación de código.

Entrenamiento

Los modelos T5 originales fueron preentrenados en el Corpus Limpio Rastreado Colosal (C4), un conjunto de datos masivo de texto y código extraído de internet. El preentrenamiento implicaba un objetivo de denoising donde el modelo aprendía a reconstruir texto corrupto, utilizando tokens centinela para marcar tramos faltantes. Por ejemplo, dado "Gracias <X> a mi fiesta <Y> semana.", el modelo aprende a generar "<X> por invitar <Y> última <Z>", donde <Z> indica el final de la salida.

Después del preentrenamiento, los modelos T5 pueden ajustarse finamente en tareas específicas posteriores. El ajuste fino adapta la comprensión general del lenguaje del modelo para desempeñarse bien en aplicaciones como chatbots, traducción automática y resumen de texto. El formato unificado del marco significa que los datos de ajuste fino también se estructuran como pares de texto de entrada y salida, lo que facilita su aplicación a nuevas tareas.

Arquitectura

La serie T5 incluye modelos de diversos tamaños, todos compartiendo la estructura de codificador-decodificador. El artículo original reportó cinco configuraciones: pequeño (60M parámetros), base (220M), grande (770M), 3B y 11B. Cada modelo tiene el mismo número de capas en el codificador y el decodificador; por ejemplo, T5-pequeño tiene 6 capas en cada uno. Las dimensiones arquitectónicas clave incluyen el número de cabezas de atención, la dimensión de incrustación, el tamaño de la red de avance y la dimensión de clave/valor. Notablemente, los modelos 3B y 11B se desvían de la relación típica donde la dimensión de incrustación es igual al producto de la dimensión de clave/valor y el número de cabezas.

En comparación con el transformer original, T5 utiliza normalización de capas sin sesgo aditivo, coloca la normalización fuera de la ruta residual y emplea incrustaciones posicionales relativas. Un tokenizador WordPiece con un tamaño de vocabulario de 32,000 se comparte entre entrada y salida, entrenado en una mezcla de datos en inglés, alemán, francés y rumano de C4.

Variantes

Varios modelos posteriores se basaron en la arquitectura T5, a menudo con nombres no estandarizados. Los modelos originales (2019) fueron seguidos por T5 1.1 (versiones mejoradas con activación GEGLU y renombrados XL/XXL para los tamaños más grandes). LM-adaptado T5 (2021) continuó el entrenamiento con tokens adicionales de C4. Switch Transformer (2021) introdujo una variante de mezcla de expertos. T0 (2021) se centró en el seguimiento de instrucciones de cero disparos. ByT5 (2021) operó en texto a nivel de bytes sin tokenizadores. Flan-T5 (2022) añadió ajuste por instrucciones. UL2 20B (2022) escaló a 20B parámetros y utilizó un objetivo de mezcla de denoisers. Pile-T5 (2024) usó el tokenizador Llama y fue entrenado en The Pile.

Aplicaciones

El diseño de codificador-decodificador del marco T5 permite el seguimiento de instrucciones: el codificador procesa la instrucción, y el decodificador genera la respuesta de forma autorregresiva. El codificador T5 también puede servir como codificador de texto para otros modelos, produciendo representaciones vectoriales para condicionamiento. Por ejemplo, Google Imagen utiliza T5-XXL como su codificador de texto, y AuraFlow utiliza Pile-T5-XL. Estas aplicaciones demuestran la versatilidad del marco más allá de las tareas tradicionales de PLN.

El paradigma de texto a texto ha influido en el desarrollo posterior de modelos de lenguaje grandes, enfatizando los beneficios de un formato unificado de entrada y salida para el aprendizaje por transferencia y el entrenamiento multitarea.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:natural-language-processing·machine-learning·transformer-models·google-ai
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial