XLNet ist ein autoregressives Transformer (architecture)-Modell, das für die Verarbeitung natürlicher Sprache entwickelt wurde und als Verbesserung gegenüber BERT eingeführt wurde. Es wurde am 19. Juni 2019 unter der Apache-2.0-Lizenz veröffentlicht, mit 340 Millionen Parametern und trainiert auf 33 Milliarden Wörtern. Das Modell erzielte Spitzenergebnisse bei Aufgaben wie Sprachmodellierung, Fragenbeantwortung und natürlichsprachlichem Schließen und ist ein bemerkenswertes Beispiel für die Architektur großer Sprachmodelle in der Deep-Learning-Forschung.
Im Gegensatz zu BERT, das maskierte Sprachmodellierung verwendet, setzt XLNet auf Permutations-Sprachmodellierung. Dieser Ansatz faktorisiert die gemeinsame Wahrscheinlichkeit einer Sequenz in allen möglichen Reihenfolgen, wodurch das Modell bidirektionalen Kontext erfassen kann, ohne auf Maskierung angewiesen zu sein. Dieses Design zielte darauf ab, eine Einschränkung von BERT zu beheben, bei der maskierte Token während des Pre-Trainings nicht gesehen werden, was zu einer Diskrepanz zwischen Pre-Training und Fine-Tuning führt.
Permutations-Sprachmodellierung
Bei der Standard-autoregressiven Modellierung wird die Wahrscheinlichkeit eines Sequenz in einer festen Reihenfolge von links nach rechts faktorisiert. Beispielsweise wird der Satz "My dog is cute" als Produkt bedingter Wahrscheinlichkeiten modelliert: Pr(My) Pr(dog|My) Pr(is|My, dog) * Pr(cute|My, dog, is). XLNet sampelt stattdessen eine zufällige Permutation der Token-Positionen und faktorisiert die Wahrscheinlichkeit entsprechend dieser Reihenfolge. Beispielsweise sagt das Modell bei der Permutation 3-2-4-1 zuerst "is" voraus, dann "dog", dann "cute" und schließlich "My", jeweils bedingt auf den zuvor vorhergesagten Tokens. Durch das Training auf allen Permutationen lernt das Modell, Kontext aus beiden Richtungen zu nutzen, was seine Fähigkeit zur Erfassung von Langzeit-abhängigkeiten verbessert.
zwei-Ströme-Self-Attention
Um die Permutations-Sprachmodellierung umzusetzen, verwendet XLNet einen Zwei-Ströme-Self-Attention-Mechanismus. Der erste Strom, der Inhaltsstrom genannt wird, codiert den Inhalt jedes Tokens mithilfe von standardmäßiger kausaler Self-Attention. Der zweite Strom, der Abfrage-Strom, codiert den Inhalt jedes Tokens im Kontext zuvor vorhergesagter Tokens, wobei maskierte Cross-Attention verwendet wird, wobei die Abfragen aus dem Abfrage-Strom und die Key-Value-Paare aus dem Inhaltsstrom stammen. Dieses Design ermöglicht es dem Modell, ein Token vorherzusagen, ohne den eigenen Inhalt zu sehen, während es gleichzeitig die Inhalte anderer Tokens in der permutierten Reihenfolge nutzt.
Training und Leistung
XLNet wurde auf einem großen Korpus von 33 Milliarden Wörtern trainiert, das ein Modell mit 340 Millionen Parametern verwendet wurde. Der Trainingsprozess umfasste sowohl Permutations-Sprachmodellierung als auch eine Segment-Neuordnungs-Objective, die dem Modell half, Beziehungen zwischen Sätzen zu lernen. Bei der Veröffentlichung übertraf XLNet BERT auf eine Reihe von Benchmarks, einschließlich des Stanford Question Answering Dataset (SQuAD), des General Language Understanding Evaluation (GLUE) Benchmarks und mehrerer Lese-read comprehension Aufgaben. Sein Erfolg zeigte die Brasage der permutationsbasierten Vor-Training und beeinflusste nachfolgende Arbeiten auf dem Bereich der generativen KI und maschinellen Lernens.
Auswirkungen und Vermächtnis
XLNet trug zur Evolution vortrainierter Sprachmodelle bei, indem es die Abwägungen zwischen autoregressiven und autoencoding-Ansätzen hervorhob. Während die Maskierungsstrategie von BERT einen bidirektionalen Kontext ermöglichte, führte sie eine Pre-Train-/FineTune-Diskrepanz ein; XLNets Permutationsansatz bot eine Möglichkeit, bidirektionale Kontext zu erreichen, ohne die autoregressive Eigenschaft aufzugeben. Diese Idee wurde in spätere Modelle übernommen, wie Transformer-Architektur und andere Varianten. Obwohl neuere architektonische Entwicklungen XLNet in Bezug auf die Peristenz inzwischen übertroffen haben, bleibt es ein bedeutender Meilenstein in der Geschichte der künstlichen Intelligenz und den Forschungen zu neuronalen Netzwerken.
Siehe auch
- BERT (nicht in bereitgestellten Slugs vorhanden, könnte aber als Transformer (architecture) verknüpft werden)
- Large language model
- Deep learning
- Machine learning