Le cadre texte-à-texte est une méthodologie en traitement du langage naturel qui reformule toutes les tâches en un format uniforme : étant donné un texte d'entrée, le modèle produit un texte de sortie. Cette approche a été popularisée par le modèle T5 (Transformer de transfert texte-à-texte), introduit par Google AI en 2019. En unifiant des tâches telles que la traduction, le résumé et la réponse aux questions en un paradigme unique texte-à-texte, le cadre simplifie la conception des modèles et permet l'apprentissage par transfert à travers diverses tâches.
Les modèles T5 sont des architectures encodeur-décodeur transformeur, où l'encodeur traite le texte d'entrée et le décodeur génère le texte de sortie. Cette conception suit le modèle transformeur original mais intègre des modifications telles que des plongements positionnels relatifs et une normalisation de couche placée en dehors du chemin résiduel. La flexibilité du cadre lui permet de gérer une large gamme de tâches, de la correction d'erreurs grammaticales à la génération de code.
Entraînement
Les modèles T5 originaux ont été pré-entraînés sur le Colossal Clean Crawled Corpus (C4), un ensemble massif de textes et de codes extraits d'Internet. Le pré-entraînement impliquait un objectif de débruitage où le modèle apprenait à reconstruire un texte corrompu, en utilisant des jetons sentinelles pour marquer les segments manquants. Par exemple, étant donné « Merci <X> moi à votre fête <Y> semaine. », le modèle apprend à produire « <X> d'avoir invité <Y> dernier <Z> », où <Z> indique la fin de la sortie.
Après le pré-entraînement, les modèles T5 peuvent être affinés sur des tâches spécifiques en aval. L'affinage adapte la compréhension générale du langage du modèle pour bien performer dans des applications telles que les chatbots, la traduction automatique et le résumé de texte. Le format unifié du cadre signifie que les données d'affinage sont également structurées en paires texte d'entrée - texte de sortie, ce qui rend leur application à de nouvelles tâches simple.
Architecture
La série T5 comprend des modèles de tailles variées, partageant tous la structure encodeur-décodeur. L'article original rapportait cinq configurations : small (60M paramètres), base (220M), large (770M), 3B et 11B. Chaque modèle a le même nombre de couches dans l'encodeur et le décodeur ; par exemple, T5-small a 6 couches dans chacun. Les dimensions architecturales clés incluent le nombre de têtes d'attention, la dimension de plongement, la taille du réseau feedforward et la dimension clé/valeur. Notamment, les modèles 3B et 11B s'écartent de la relation typique où la dimension de plongement est égale au produit de la dimension clé/valeur et du nombre de têtes.
Comparé au transformeur original, T5 utilise une normalisation de couche sans biais additif, place la normalisation en dehors du chemin résiduel et emploie des plongements positionnels relatifs. Un tokeniseur WordPiece avec une taille de vocabulaire de 32 000 est partagé entre l'entrée et la sortie, entraîné sur un mélange de données anglaises, allemandes, françaises et roumaines provenant de C4.
Variantes
Plusieurs modèles ultérieurs ont été construits sur l'architecture T5, souvent avec une dénomination non standardisée. Les modèles originaux (2019) ont été suivis par T5 1.1 (versions améliorées avec activation GEGLU et renommés XL/XXL pour les tailles plus grandes). LM-adapted T5 (2021) a poursuivi l'entraînement sur des jetons C4 supplémentaires. Switch Transformer (2021) a introduit une variante de mélange d'experts. T0 (2021) s'est concentré sur le suivi d'instructions en zéro-shot. ByT5 (2021) a fonctionné sur du texte au niveau octet sans tokeniseurs. Flan-T5 (2022) a ajouté l'ajustement par instructions. UL2 20B (2022) a été étendu à 20B paramètres et a utilisé un objectif de mélange de débruitages. Pile-T5 (2024) a utilisé le tokeniseur Llama et a été entraîné sur The Pile.
Applications
La conception encodeur-décodeur du cadre T5 permet le suivi d'instructions : l'encodeur traite l'instruction, et le décodeur génère automatiquement la réponse de manière autorégressive. L'encodeur T5 peut également servir d'encodeur de texte pour d'autres modèles, produisant des représentations vectorielles pour le conditionnement. Par exemple, Google Imagen utilise T5-XXL comme encodeur de texte, et AuraFlow utilise Pile-T5-XL. Ces applications démontrent la polyvalence du cadre au-delà des tâches traditionnelles de traitement du langage naturel.
Le paradigme texte-à-texte a influencé le développement ultérieur des grands modèles de langage, soulignant les avantages d'un format d'entrée-sortie unifié pour l'apprentissage par transfert et l'entraînement multi-tâches.