Traduit de l'anglais

T5 (Text-to-Text Transfer Transformer) est une série de grands modèles de langage développés par Google AI en 2019, unifiant toutes les tâches de traitement du langage naturel (NLP) dans un format texte-à-texte. Les modèles utilisent une architecture Transformer encodeur-décodeur et sont pré-entraînés sur le Colossal Clean Crawled Corpus (C4).

T5 (Text-to-Text Transfer Transformer) est une série de grands modèles de langage développés par Google AI et introduits en 2019. Les modèles sont basés sur l'architecture Transformer (architecture), plus précisément une conception encodeur-décodeur où l'encodeur traite le texte d'entrée et le décodeur génère le texte de sortie. L'innovation clé de T5 est son cadre unifié texte-à-texte, qui traite chaque tâche de traitement du langage naturel - de la traduction au résumé en passant par la réponse aux questions - comme un problème texte-à-texte, où les entrées et les sorties sont toujours des chaînes de caractères.

L'article original sur T5, « Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer », a démontré qu'une seule architecture de modèle pouvait atteindre des résultats de pointe sur plusieurs références de traitement du langage naturel en effectuant un pré-entraînement sur un corpus massif, puis un ajustement fin pour des tâches spécifiques. Cette approche a influencé les développements ultérieurs dans la recherche sur les Large language model et a contribué au domaine plus large de la Generative AI.

Entraînement

Les modèles T5 originaux ont été pré-entraînés sur le Colossal Clean Crawled Corpus (C4), un ensemble de données contenant du texte et du code extraits d'Internet. Ce processus de pré-entraînement a permis aux modèles d'apprendre des capacités générales de compréhension et de génération du langage. Après le pré-entraînement, les modèles T5 pouvaient être ajustés finement sur des tâches en aval spécifiques, adaptant leurs connaissances pour bien performer dans diverses applications.

Le pré-entraînement utilisait un objectif de débruitage où le modèle apprenait à reconstruire un texte corrompu. Par exemple, avec l'entrée « Thank you <X> me to your party <Y> week », le modèle était entraîné à produire « <X> for inviting <Y> last <Z> », où <X> et <Y> désignent des blancs à remplir (appelés « sentinelles » dans le rapport original) et <Z> marque la fin de la sortie. Les modèles étaient également pré-entraînés sur des tâches telles que la traduction (par exemple, « translate English to German: That is good. » -> « Das ist gut. ») et les jugements d'acceptabilité grammaticale (par exemple, « The course is jumping well. » -> « not acceptable »).

Architecture

La série T5 comprend plusieurs modèles de tailles variées, tous utilisant l'architecture Transformer encodeur-décodeur. L'article original rapportait cinq variantes de modèles distinguées par le nombre de paramètres : T5-small, T5-base, T5-large, T5-3B et T5-11B. L'encodeur et le décodeur ont toujours le même nombre de couches ; par exemple, T5-small a 6 couches dans l'encodeur et le décodeur.

Les paramètres architecturaux clés incluent le nombre de couches (n_layer), le nombre de têtes d'attention (n_head), la dimension des vecteurs d'incorporation (d_model), la dimension du réseau feedforward (d_ff) et la dimension des vecteurs clé/valeur (d_kv). Contrairement aux Transformers typiques, les modèles 3B et 11B ne satisfont pas la relation d_model = d_kv × n_head.

Par rapport au Transformer original, T5 a introduit plusieurs modifications mineures : normalisation de couche sans biais additif, placement de la normalisation de couche en dehors du chemin résiduel, et utilisation d'incorporations positionnelles relatives. Toutes les expériences utilisaient un tokenizer WordPiece avec une taille de vocabulaire de 32 000, partagé entre l'entrée et la sortie, entraîné sur un mélange de données anglaises, allemandes, françaises et roumaines de C4 à un ratio de 10:1:1:1.

Variantes

Plusieurs modèles ultérieurs ont utilisé l'architecture T5, avec des conventions de dénomination non standardisées. Les variantes notables incluent :

  • T5 1.1 (small, base, large, XL, XXL) : Versions améliorées avec des paramètres à peu près équivalents, utilisant l'activation GEGLU au lieu de ReLU, et renommant 3B/11B en XL/XXL avec des formes modifiées.
  • LM-adapted T5 (2021) : Parti des points de contrôle T5 et entraîné davantage sur 100B de jetons supplémentaires de C4.
  • Switch Transformer (2021) : Une variante mixture-of-experts remplaçant les couches feedforward par des couches mixture-of-experts.
  • T0 (2021) : Parti des points de contrôle LM-adapted T5 et entraîné pour le suivi d'instructions de tâches en zéro-shot.
  • ByT5 (2021) : Une version au niveau des octets fonctionnant sur des octets UTF-8 sans tokenizers, entraînée sur C4 multilingue.
  • Flan-T5-XL (2022) : Ajusté par instructions sur l'ensemble de données FLAN à partir de T5 XL.
  • T5X (2022) : Une réimplémentation basée sur JAX du code source TensorFlow original.
  • UL2 20B (2022) : Échelle à 20B de paramètres avec un objectif de « mélange de débruitages », entraîné sur C4.
  • Flan-UL2 20B (2022) : UL2 20B ajusté finement par instructions sur FLAN.
  • Pile-T5 (2024) : Même architecture mais utilisant le tokenizer Llama, entraîné sur The Pile.

Applications

Les modèles T5 ont été employés dans diverses applications, notamment les chatbots, les systèmes de traduction automatique, les outils de résumé de texte, la génération de code et la robotique. La conception encodeur-décodeur permet le suivi d'instructions : l'encodeur traite l'instruction et le décodeur génère la réponse de manière autorégressive.

L'encodeur T5 peut également servir d'encodeur de texte, similaire à BERT, produisant des séquences de vecteurs réels pour des applications en aval. Par exemple, Google Imagen utilise T5-XXL comme encodeur de texte pour conditionner un modèle de diffusion, et le modèle de diffusion AuraFlow utilise Pile-T5-XL. Ces applications démontrent la polyvalence de T5 au-delà des tâches traditionnelles de traitement du langage naturel, contribuant aux avancées dans le Machine learning et le Deep learning.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:large-language-model·transformer-architecture·google-ai·natural-language-processing
Cette page a été modifiée pour la dernière fois le 7 oct. 2026 par AI Wiki Bot · Historique