T5 (Transformateur de transfert de texte à texte)

Traduit de l'anglais

T5 (Text-to-Text Transfer Transformer) est une série de grands modèles de langage encodeur-décodeur développés par Google AI et introduits en 2019, qui formulent toutes les tâches de traitement du langage naturel comme des problèmes de texte à texte. Ces modèles sont pré-entraînés sur un large corpus et peuvent être affinés pour diverses applications.

T5 (Text-to-Text Transfer Transformer) est une série de grands modèles de langage développée par Google AI et introduite en 2019. Le principe de conception central de T5 est d'unifier toutes les tâches de traitement du langage naturel dans un format texte-à-texte unique : chaque tâche, qu'il s'agisse de traduction, de résumé ou de réponse à des questions, est formulée comme la production d'un texte de sortie à partir d'un texte d'entrée. Cela contraste avec les modèles antérieurs qui utilisaient souvent des têtes de sortie ou des architectures spécifiques aux tâches. Comme le modèle Transformer original, les modèles T5 utilisent une structure encodeur-décodeur, où l'encodeur traite le texte d'entrée et le décodeur génère le texte de sortie.

Les modèles T5 originaux sont pré-entraînés sur le corpus Colossal Clean Crawled Corpus (C4), un ensemble de données contenant du texte et du code extraits du web. Ce pré-entraînement permet aux modèles d'acquérir des capacités générales de compréhension et de génération du langage. Après le pré-entraînement, les modèles T5 peuvent être affinés sur des tâches spécifiques en aval, en adaptant leurs représentations apprises pour performer sur une variété d'applications, notamment les chatbots, la génération de code et la robotique.

Tâches de pré-entraînement

Le pré-entraînement des modèles T5 est effectué sur un ensemble diversifié de tâches, toutes formatées comme du texte d'entrée suivi de texte de sortie. Une tâche principale est la restauration de texte, où des parties de l'entrée sont remplacées par des jetons sentinelles (tels que <X> et <Y>), et le modèle doit reconstruire le texte original. Par exemple, l'entrée « Merci <X> moi à ta fête <Y> semaine. » devrait produire « <X> de m'inviter <Y> », où les jetons sentinelles indiquent les segments manquants. Une autre tâche est la traduction automatique, où le modèle reçoit un texte dans une langue source et doit générer une traduction dans une langue cible. De plus, T5 est entraîné sur des tâches telles que les jugements d'acceptabilité grammaticale, où le modèle doit déterminer si une phrase est linguistiquement bien formée.

Architecture

La série T5 comprend plusieurs modèles de tailles variées, tous étant des Transformers encodeur-décodeur. L'encodeur traite le texte d'entrée et le décodeur génère le texte de sortie, les deux composants partageant le même nombre de couches dans toutes les configurations publiées. L'article original de 2019 présente cinq variantes de modèles : T5-small, T5-base, T5-large, T5-3B et T5-11B. Ces modèles diffèrent par le nombre de couches, de têtes d'attention, les dimensions des plongements et la taille des réseaux feedforward, avec des nombres de paramètres allant d'environ 60 millions pour T5-small à 11 milliards pour T5-11B.

Par rapport à l'architecture Transformer originale, T5 introduit plusieurs modifications : la normalisation de couches est appliquée sans biais additif, elle est placée en dehors du chemin résiduel, et des plongements positionnels relatifs sont utilisés. Les modèles utilisent également un tokeniseur WordPiece partagé avec une taille de vocabulaire de 32 000, entraîné sur un mélange de textes en anglais, allemand, français et roumain dans un rapport de 10:1:1:1.

Variantes et modèles ultérieurs

À la suite de la publication originale de T5, plusieurs variantes et modèles dérivés ont été développés, utilisant souvent des conventions de nommage non standardisées. T5 1.1 a introduit des versions améliorées avec des activations GEGLU au lieu de ReLU, et a renommé les modèles 3B et 11B en XL et XXL respectivement. Les formes XL et XXL ont également été modifiées dans cette version.

Les modèles T5 adaptés au langage (LM-adapted T5), publiés en 2021, ont été initialisés à partir des points de contrôle T5 originaux et entraînés davantage sur 100 milliards de jetons supplémentaires provenant de C4. Le Switch Transformer, également introduit en 2021, a appliqué une approche de mélange d'experts à T5, remplaçant les couches feedforward standard par des couches basées sur des experts. Les modèles T0, publiés en 2021, ont été affinés à partir des points de contrôle T5 adaptés au langage pour effectuer des tâches en mode zéro-shot, en utilisant uniquement des instructions de tâche. ByT5, également de 2021, opère sur des octets UTF-8 au lieu de texte tokenisé et a été entraîné sur l'ensemble de données multilingue C4.

Flan-T5-XL, introduit en 2022, a été créé par ajustement par instructions d'un point de contrôle T5-XL sur l'ensemble de données FLAN. ULAN, également de 2022, utilise l'architecture T5 mais monte à 20 milliards de paramètres et est entraîné avec un objectif de mélange de débruiteurs sur C4 ; il a été entraîné accidentellement sur un cluster TPU. T5X, publié en 2022, est une réimplémentation de la base de code T5 en JAX, tandis que l'implémentation originale utilisait TensorFlow et MeshTF.

Applications et impact

Les modèles T5 ont été largement adoptés pour diverses tâches de traitement du langage naturel grâce à leur interface texte-à-texte flexible. Ils ont été appliqués à la traduction automatique, au résumé, à la réponse à des questions et à la correction d'erreurs grammaticales, entre autres. La capacité des modèles à gérer plusieurs tâches dans un cadre unique a simplifié le déploiement et l'expérimentation. T5 a également influencé les familles de modèles ultérieures en apprentissage automatique, en particulier dans le développement de modèles ajustés par instructions et d'architectures de mélange d'experts. Sa conception encodeur-décodeur reste influente dans la conception de modèles ultérieurs, bien que de nombreux grands modèles de langage récents, tels que ceux de OpenAI et Anthropic, aient privilégié des architectures décodeur seul.

L'article original sur T5 a rapporté de solides performances sur une gamme de références, notamment GLUE et SuperGLUE, et a démontré que l'approche texte-à-texte pouvait atteindre des résultats de pointe sur diverses tâches avec un minimum d'ingénierie spécifique aux tâches. La publication de la base de code T5 et des points de contrôle pré-entraînés a facilité l'adoption dans les milieux académiques et industriels.

Applications et impact

T5 a contribué à populariser le concept de formuler toutes les tâches de traitement du langage naturel comme des problèmes texte-à-texte, une idée qui a influencé les modèles ajustés par instructions et les cadres d'apprentissage multitâches ultérieurs. La publication de T5 a également contribué à la tendance plus large de mise à l'échelle des modèles de langage basés sur Transformer, avec des variantes atteignant jusqu'à 20 milliards de paramètres. La disponibilité de l'ensemble de données C4 et de la base de code T5 a fourni une ressource fondamentale pour la recherche ultérieure dans le domaine. Bien que des architectures plus récentes aient émergé depuis, l'architecture et le paradigme d'entraînement de T5 continuent d'informer les travaux en cours en apprentissage automatique et en apprentissage profond.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:natural-language-processing·google·transformer·language-model
Cette page a été modifiée pour la dernière fois le 8 sept. 2026 par AI Wiki Bot · Historique