DeBERTa (Decoding-enhanced BERT mit disentangled attention) ist eine Familie von Transformer-basierten neuronalen Netzwerkarchitekturen für die Verarbeitung natürlicher Sprache ((NLP), eingeführt von Forschern bei Microsoft im Jahr 2021. Es baut auf dem früheren BERT-Modell auf, indem es zwei zentrale Innovationen integriert: einen disentangled attention-Mechanismus, der Inhalts- und relative Positionsinformationen getrennt modelliert, und einen erweiterten Mask-Decoder, der die Vorhersage maskierter Tokens während des Pre-Trainings verbessert. Diese Änderungen ermöglichen es DeBERTa, überlegene Leistungen bei einer Reihe von NLP-Benchmarks zu erzielen, einschließlich der SuperGLUE-Rangliste, wo es im Januar 2021 zum ersten Mal die menschlichen Basiswerte übertraf.
Hintergrund und Motivation
DeBERTa ist Teil der breiteren Entwicklung großer Sprachmodelle, die mit der Einführung der Transformer-Architektur im Jahr 2017 begann. BERT, veröffentlicht von Google im Jahr 2018, zeigte, dass das Pre-Training eines bidirektionalen Transformer-Encoders auf großen Textkorpora übertragbare Repräsentationen für viele nachgelagerte Aufgaben produzieren kann. Allerdings kodiert BERTs Aufmerksamkeitsmechanismus Token-Positionen als absolute Einbettungen, die zum Eingang hinzugefügt werden, was seine Fähigkeit einschränken kann, auf längere Sequenzen oder ungesehene Positionskombinationen zu generalisieren. DeBERTa adressiert dies, indem es Inhalts- und Positionsinformationen entkoppelt, wodurch das Modell flexiblere Beziehungen zwischen Tokens lernen kann.
Architektur
DeBERTa behält die gesamte Encoder-only-Struktur von BERT bei, bestehend aus einer Einbettungsschicht, mehreren Transformer-Encoder-Schichten, und einem aufgabenspezifischen Ausgabekopf. Die primären architektonischen Unterschiede liegen in der Aufmerksamkeitsberechnung und dem Mask-Decodierungsprozess.
Disentangled Attention
In der Standard-Transformer-Aufmerksamkeit wird jedes Token durch einen einzelnen Vektor repräsentiert, der seinen Inhalt und seine absolute Position kombiniert. DeBERTa repräsentiert stattdessen jedes Token mit zwei getrennten Vektoren: einem für Inhaltund einem für relative Position. Der Aufmerksamkeitswert zwischen zwei Tokens wird dann als Summe von vier verschiedenen Termen berechnet: Inhalt-zu-Inhalt, Inhalt-zu-Position, Position-zu-Inhalt, und Position-zu-Position. Diese Entkopplung ermöglicht es dem Modell, sowohl semantische als auch positionelle Beziehungen unabhängig zu erfassen, was besonders vorteilhaft für Aufgaben ist, die ein feinkörniges Verständnis von Wortreihenfolge und Distanz erfordern.
Enhanced Mask Decoder
Das Pre-Training-Ziel von DeBERTa ist maskiertes Sprachmodellieren, ähnlich wie bei BERT. Allerdings führt DeBERTa einen erweiterten Mask-Decoder ein, der sowohl die Inhalts- als auch die Positionsinformationen des maskierten Tokens verwendet, um das ursprüngliche Wort vorherzusagen. Dies wird erreicht, indem die absolute Position des maskierten Tokens in die Decodierungsschicht integriert wird, was dem Modell hilft, Mehrdeutigkeiten aufzulösen, die entstehen, wenn mehrere Tokens ähnliche relative Positionen teilen. Der erweiterte Decoder verbessert die Effizienz des Pre-Trainings und führt zu besseren nachgelagerten Leistungen.
Training und Varianten
DeBERTa wurde auf demselben Korpus wie BERT vortrainiert, der englische Wikipedia und BookCorpus umfasst, mit insgesamt etwa 16GB an Text. Das Basismodell, DeBERTa-base, hat 12 Schichten, 768 versteckte Einheiten, und 12 Aufmerksamkeitsköpfe, mit insgesamt rund 140 Millionen Parametern. Eine größere Variante, DeBERTa-large, hat 24 Schichten, 1024 versteckte Einheiten, und 16 Aufmerksamkeitsköpfe, mit etwa 400 Millionen Parametern. Im Jahr 2021 veröffentlichte Microsoft auch DeBERTa-v3, das eine neue Pre-Training-Methode namens ersetzte Token-Erkennung einführte, was Effizienz und Leistung weiter verbesserte.
Leistung und Auswirkung
DeBERTa erzielte modernste Ergebnisse bei mehreren wichtigen NLP-Benchmarks. Im Januar 2021 übertraf DeBERTa mit einer großen Modellgröße und zusätzlichen Trainingsdaten die menschliche Basislinie auf dem SuperGLUE-Benchmark, ein Meilenstein, der den schnellen Fortschritt großer Sprachmodelle hervorhob. DeBERTa schnitt auch stark auf dem GLUE-Benchmark und dem SQuAD-Frage-Antwort-Datensatz ab. Seine Innovationen beeinflussten nachfolgende Modelle, einschließlich jener in den GPT- und T5-Familien, und trugen zur Entwicklung effizienterer Aufmerksamkeitsmechanismen in späteren Architekturen bei.