Aus dem Englischen übersetzt

T5 (Text-to-Text Transfer Transformer) ist eine Serie von Encoder-Decoder-Modellen für große Sprachmodelle, die 2019 von Google AI eingeführt wurde, auf dem C4-Datensatz vortrainiert ist und für verschiedene textbasierte Aufgaben anpassbar ist.

T5 (Text-to-Text Transfer Transformer) ist eine Reihe großer Sprachmodelle, die von Google AI entwickelt und 2019 eingeführt wurde. Wie das ursprüngliche Transformer-Modell sind T5-Modelle Encoder-Decoder-Transformer, bei denen der Encoder den Eingabetext verarbeitet und der Decoder den Ausgabetext erzeugt. T5-Modelle werden in der Regel auf einem massiven Datensatz aus Text und Code vortrainiert, wonach sie textbasierte Aufgaben ähnlich ihren Vortrainingszielen ausführen können und für andere Aufgaben feinabgestimmt werden können. Sie wurden in Chatbots, maschineller Übersetzung, Textzusammenfassung, Codegenerierung und Robotik eingesetzt.

Training

Die ursprünglichen T5-Modelle wurden auf dem Colossal Clean Crawled Corpus (C4) vortrainiert, der aus dem Internet gescrapten Text und Code enthält. Dieses Vortraining ermöglicht es den Modellen, allgemeines Sprachverständnis und Generierung zu erlernen. T5-Modelle können dann für nachgelagerte Aufgaben feinabgestimmt werden. Das Vortraining verwendete ein Text-zu-Text-Format, bei dem jede Aufgabe als <Eingabetext> -> <Ausgabetext> formuliert wird. Beispiele umfassen das Wiederherstellen von korruptem Text (z. B. das Ausfüllen von durch Sentinel-Markern gekennzeichneten Lücken), Übersetzung (z. B. Englisch nach Deutsch) und grammatikalische Akzeptanzurteile (z. B. CoLA-Satzklassifikation).

Architektur

Die T5-Serie umfasst Modelle unterschiedlicher Größen, alle als Encoder-Decoder-Transformer. Das ursprüngliche Papier berichtete über fünf Modelle: T5-small (60M Parameter), T5-base (220M), T5-large (770M), T5-3B (3B) und T5-11B (11B). Jedes Modell hat die gleiche Anzahl von Schichten im Encoder und Decoder; zum Beispiel hat T5-small 6 Schichten in jedem. Wichtige Architekturmerkmale umfassen die Anzahl der Schichten, Aufmerksamkeitsköpfe, Einbettungsdimension, Feedforward-Dimension und Schlüssel/Wert-Dimension. Im Gegensatz zu typischen Transformatoren erfüllen die 3B- und 11B-Modelle nicht die Beziehung d_model = d_kv * n_head. Im Vergleich zum ursprünglichen Transformer verwendet T5 Schichtnormalisierung ohne additiven Bias, platziert die Schichtnormalisierung außerhalb des Residuenpfads und verwendet relative Positions-Einbettungen. Ein WordPiece-Tokenizer mit einer Vokabulargröße von 32.000 wurde verwendet, geteilt zwischen Eingabe und Ausgabe, trainiert auf einer Mischung aus englischen, deutschen, französischen und rumänischen Daten aus C4 im Verhältnis 10:1:1:1.

Varianten

Mehrere nachfolgende Modelle verwendeten die T5-Architektur. Bemerkenswerte Varianten umfassen:

  • T5 1.1 (2019-2020): Verbesserte Versionen mit GEGLU-Aktivierung anstelle von ReLU; die 3B und 11B wurden in XL und XXL umbenannt mit modifizierten Formen.
  • LM-adaptiertes T5 (2021): Startete von T5-Checkpoints und trainierte weiter auf 100B zusätzlichen Token aus C4.
  • Switch Transformer (2021): Eine Mixture-of-Experts-Variante, die Feedforward-Schichten durch Expertenschichten ersetzt.
  • T0 (2021): Startete von LM-adaptiertem T5 und trainierte, um Aufgaben im Zero-Shot-Modus basierend auf Anweisungen auszuführen.
  • ByT5 (2021): Byte-Ebene-Version, die auf UTF-8-Bytes ohne Tokenizer arbeitet, trainiert auf mehrsprachigem C4.
  • Flan-T5-XL (2022): Anweisungsabgestimmt auf dem FLAN-Datensatz, startend von T5 XL.
  • T5X (2022): Eine JAX-basierte Neuimplementierung des ursprünglichen T5-Codebasis (kein Modell).
  • UL2 20B (2022): Skaliert auf 20B Parameter, trainiert mit einem Mixture-of-Denoisers-Ziel auf C4; bemerkenswerterweise versehentlich einen Monat lang auf einem TPU-Cluster trainiert.
  • Flan-UL2 20B (2022): UL2 20B anweisungsfeinabgestimmt auf FLAN.
  • Pile-T5 (2024): Gleiche Architektur, verwendet jedoch den Llama-Tokenizer und trainiert auf The Pile, verfügbar in den Größen base, large, XL und XXL.

Anwendungen

Die Encoder-Decoder-Struktur von T5 ermöglicht Anweisungsbefolgung: Der Encoder kodiert die Anweisung, und der Decoder generiert autoregressiv die Antwort. Der T5-Encoder kann auch als Text-Encoder dienen, ähnlich wie BERT, und Vektorrepräsentationen für nachgelagerte Aufgaben erzeugen. Zum Beispiel verwendet Google Imagen T5-XXL als seinen Text-Encoder, und das AuraFlow-Diffusionsmodell verwendet Pile-T5-XL. Diese Anwendungen demonstrieren die Vielseitigkeit von T5 in generativer KI und darüber hinaus.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:large-language-model·transformer·google-deepmind·natural-language-processing
Diese Seite wurde zuletzt bearbeitet am 13. Sept. 2026 von AI Wiki Bot · Versionsgeschichte