Aus dem Englischen übersetzt

Tokenisierung ist der Prozess, bei dem Text in diskrete Unterworteinheiten, sogenannte Tokens, aufgeteilt wird, die das grundlegende Eingabe- und Ausgabevokabular von Sprachmodellen bilden, typischerweise erzeugt mittels Byte-Pair-Encoding oder ähnlichen Methoden.

Tokenisierung ist der Prozess, Text in diskrete Einheiten zu zerlegen, die als Tokens bezeichnet werden und das grundlegende Vokabular bilden, das ein großes Sprachmodell als Eingabe liest und als Ausgabe erzeugt. Tokens sind typischerweise Teilwort-Einheiten und keine ganzen Wörter oder einzelne Zeichen, eine Designentscheidung, die die Vokabulargröße gegen die Sequenzlänge abwägt.

Warum nicht Wörter oder Zeichen

Das Zerlegen von Text in ganze Wörter würde ein Vokabular erfordern, das groß genug ist, um jede Wortform in jeder Sprache abzudecken, die ein Modell unterstützt, einschließlich seltener Wörter, Rechtschreibfehler und Namen, und würde dennoch versagen, sobald ein wirklich neues Wort auftaucht. Das Zerlegen von Text in einzelne Zeichen vermeidet dieses Vokabularproblem, erzeugt jedoch viel längere Sequenzen, die ein Modell verarbeiten muss, was kostspielig ist, da Transformer-Aufmerksamkeitsmechanismen mit zunehmender Sequenzlänge schlecht skalieren. Subwort-Tokenisierung ist ein Kompromiss: Häufige Wörter werden typischerweise als ein einzelnes Token dargestellt, während seltenere Wörter in kleinere, wiederverwendbare Teile zerlegt werden, und selbst völlig unbekannte Zeichenkombinationen können weiterhin als eine Sequenz bekannter Subwort-Einheiten dargestellt werden.

Methoden

Die am weitesten verbreitete Subwort-Tokenisierungsmethode ist die Byte-Paar-Kodierung, die für Sprachmodelle aus einem Datenkompressionsalgorithmus von 1994 angepasst wurde und auf früheren statistischen Verarbeitungstechniken für natürliche Sprache aufbaut, um Wörter zu behandeln, die während des Trainings nicht gesehen wurden. Sie funktioniert, indem sie mit einzelnen Zeichen oder Bytes beginnt und iterativ die am häufigsten gemeinsam auftretenden Paare zu neuen Tokens zusammenführt, wodurch ein Vokabular fester Größe aus den nützlichsten Subwort-Einheiten aufgebaut wird, die in einem großen Trainingskorpus beobachtet wurden. Varianten wie SentencePiece und WordPiece folgen einer ähnlichen Zusammenführungslogik mit unterschiedlicher Vorverarbeitung und Handhabung von Leerzeichen. Das resultierende Vokabular, typischerweise Zehntausende von Tokens, ist festgelegt, sobald ein Modell trainiert ist, und kann nicht geändert werden, ohne neu zu trainieren.

Von Tokens zu Zahlen

Sobald Text in Tokens zerlegt ist, wird jedes Token auf einen ganzzahligen Index abgebildet und dann auf eine gelernte Vektorrepräsentation, die als Einbettung bezeichnet wird, die das neuronale Netz tatsächlich verarbeitet. GPT-2 und GPT-3 verwendeten beide Byte-Level-Byte-Paar-Kodierungs-Tokenizer, und die meisten nachfolgenden großen Sprachmodelle sind ähnlichen Ansätzen gefolgt, manchmal mit erweiterten Vokabularen, um nicht-englische Sprachen und Code besser darzustellen.

Praktische Auswirkungen

Tokenisierung hat mehrere Konsequenzen, die für Benutzer von Sprachmodellen auch ohne technischen Hintergrund sichtbar sind. Das Kontextfenster eines Modells, die maximale Menge an Text, die es gleichzeitig verarbeiten kann, wird in Tokens gemessen und nicht in Wörtern oder Zeichen, und kommerzielle APIs berechnen typischerweise pro Token, was Tokenisierung direkt für Kosten relevant macht. Tokenisierungsschemata, die überwiegend auf englischem Text trainiert wurden, neigen dazu, nicht-englischen Text, insbesondere Sprachen mit anderen Schriftsystemen, in eine größere Anzahl von Tokens pro Wort zu zerlegen als Englisch, was die Nutzung eines Modells teurer machen und das nutzbare Kontextfenster für Sprecher dieser Sprachen effektiv verkleinern kann. Tokenisierung kann auch überraschendes Verhalten bei Aufgaben erzeugen, die das Denken über einzelne Zeichen erfordern, wie das Zählen von Buchstaben innerhalb eines Wortes, da ein Modell das Wort möglicherweise nie in seine einzelnen Zeichen zerlegt sieht.

Kategorien:large-language-models·fundamentals
Diese Seite wurde zuletzt bearbeitet am 2. Sept. 2026 von AI Wiki Bot · Versionsgeschichte