„Attention Is All You Need“ ist ein 2017 veröffentlichtes Forschungspapier zum maschinellen Lernen, verfasst von acht Wissenschaftlern und Ingenieuren, die bei Google arbeiteten. Das Papier führte eine neue Deep-Learning-Architektur ein, die als Transformer bekannt wurde und auf dem Aufmerksamkeitsmechanismus basiert, der 2014 von Bahdanau et al. vorgeschlagen wurde. Der darin beschriebene Transformer-Ansatz ist zur Hauptarchitektur einer Vielzahl von KI-Systemen geworden, einschließlich großer Sprachmodelle. Zum Zeitpunkt der Veröffentlichung lag der Forschungsschwerpunkt auf der Verbesserung von Seq2seq-Techniken für die maschinelle Übersetzung, doch die Autoren gingen im Papier weiter und sahen das Potenzial der Technik für andere Aufgaben wie die Beantwortung von Fragen und das, was heute als multimodale generative KI bekannt ist.
Zu den ersten Beispielen, an denen das Team seine Transformer-Architektur testete, gehörten die Übersetzung von Englisch nach Deutsch, die Erstellung von Wikipedia-Artikeln über „The Transformer“ und das Parsen. Diese Überzeugten das Team davon, dass der Transformer ein allgemeinsprachliches Modell ist und nicht nur für Übersetzungen geeignet.
Bis 2026 wurde das Papier mehr als 250.000 Mal zitiert, was es unter die zehn meistzitierten Papiere des 21. Jahrhunderts bringt. Nach der Veröffentlichung des Papiers durch Google verließen alle acht Autoren das Unternehmen, um sich anderen Unternehmen anzuschließen oder Startups zu gründen.
Hintergrund
Die Autoren des Papiers sind Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan Gomez, Lukasz Kaiser und Illia Polosukhin. Alle acht Autoren waren „gleichberechtigte Mitwirkende“ an dem Papier; die aufgeführte Reihenfolge war randomisiert (laut dem Papier selbst). Nach dem Papier verließen alle Autoren Google, um sich anderen Unternehmen anzuschließen oder Startups zu gründen.
Der Titel des Papiers ist eine Anspielung auf das Lied „All You Need Is Love“ der Beatles. Der Name „Transformer“ wurde gewählt, weil Jakob Uszkoreit, einer der Autoren des Papiers, den Klang dieses Wortes mochte. Ein frühes Designdokument trug den Titel „Transformers: Iterative Self-Attention and Processing for Various Tasks“ und enthielt eine Illustration von sechs Charakteren aus dem Transformers-Franchise. Das Team wurde Team Transformer genannt.
Diskutierte und eingeführte Methoden
Das Papier ist vor allem für die Einführung der Transformer-Architektur bekannt, die den meisten modernen großen Sprachmodellen (LLMs) zugrunde liegt. Ein Hauptgrund, warum die Architektur von den meisten modernen LLMs bevorzugt wird, ist die Parallelisierbarkeit der Architektur gegenüber ihren Vorgängern. Dies stellt sicher, dass die für das Training notwendigen Operationen auf einer GPU beschleunigt werden können, was sowohl schnellere Trainingszeiten als auch das Training größerer Modelle ermöglicht.
Das Papier führte die folgenden Mechanismen als Teil der Entwicklung der Transformer-Architektur ein.
Skalierte Punktprodukt-Aufmerksamkeit und Selbstaufmerksamkeit
Die Verwendung der skalierten Punktprodukt-Aufmerksamkeit und des Selbstaufmerksamkeitsmechanismus anstelle eines rekurrenten neuronalen Netzes (RNN) oder eines Long Short-Term Memory (die auf Rekurrenz beruhen) ermöglicht eine bessere Leistung, wie im folgenden Absatz beschrieben. Das Papier beschrieb die skalierte Punktprodukt-Aufmerksamkeit wie folgt:
Attention(Query, Key, Value) := softmax(Query × Key^T / √d_k) × Value
wobei Query, Key, Value jeweils die Query-, Key- und Value-Matrizen sind und d_k die Dimension der Werte ist.
Da das Modell auf Query-, Key- und Value-Matrizen angewiesen ist, die aus derselben Quelle stammen (d. h. der Eingabesequenz oder dem Kontextfenster), entfällt die Notwendigkeit von RNNs, was die Parallelisierbarkeit der Architektur vollständig gewährleistet. Dies unterscheidet sich von der ursprünglichen Form des 2014 eingeführten Aufmerksamkeitsmechanismus. Darüber hinaus diskutiert das Papier die Verwendung eines zusätzlichen Skalierungsfaktors, der in Bezug auf die Dimension der Key-Vektoren (dargestellt als d_k und im Papier zunächst auf 64 gesetzt) in der oben gezeigten Weise als am effektivsten befunden wurde.
Im spezifischen Kontext der Übersetzung, auf den sich das Papier konzentrierte, werden die Query- und Key-Matrizen normalerweise in Einbettungen dargestellt, die der Ausgangssprache entsprechen, während die Value-Matrix der Zielsprache entspricht.
Multi-Head-Aufmerksamkeit
Im Selbstaufmerksamkeitsmechanismus werden Queries (Q), Keys (K) und Values (V) dynamisch für jede Eingabesequenz generiert (typischerweise begrenzt durch die Größe des Kontextfensters), sodass das Modell sich zu verschiedenen Schritten auf verschiedene Teile der Eingabesequenz konzentrieren kann. Multi-Head-Aufmerksamkeit verbessert diesen Prozess durch die Einführung mehrerer paralleler Aufmerksamkeitsköpfe. Jeder Aufmerksamkeitskopf lernt unterschiedliche lineare Projektionen der Q-, K- und V-Matrizen. Dies ermöglicht es dem Modell, verschiedene Aspekte der Beziehungen zwischen Wörtern in der Sequenz gleichzeitig zu erfassen, anstatt sich auf einen einzelnen Aspekt zu konzentrieren.
Dadurch ermöglicht die Multi-Head-Aufmerksamkeit dem Modell, Informationen aus verschiedenen Darstellungsunterräumen an verschiedenen Positionen zu berücksichtigen. Das Papier setzte die Anzahl der Köpfe auf 8, wobei jeder Kopf eine reduzierte Dimension (d_k = 64) hatte, was zu Gesamtberechnungskosten führte, die denen eines einzelnen voll-dimensionalen Aufmerksamkeitskopfes ähneln.
Positionskodierung
Da die Transformer-Architektur die Reihenfolge der Token in einer Sequenz nicht inhärent erfasst, führte das Papier Positionskodierungen ein. Dies sind Vektoren, die zu den Eingabeeinbettungen hinzugefügt werden, um Informationen über die Position jedes Tokens zu liefern. Das Papier verwendete Sinus- und Kosinusfunktionen verschiedener Frequenzen, sodass das Modell lernen kann, sich auf relative Positionen zu konzentrieren. Dies war eine entscheidende Komponente für Aufgaben wie Übersetzung, bei denen die Wortreihenfolge wichtig ist.
Andere Komponenten
Das Papier integrierte auch mehrere andere Techniken, die in der Deep-Learning-Gemeinschaft bereits bekannt waren. Es verwendete Schichtnormalisierung zur Stabilisierung des Trainings, Dropout zur Regularisierung und den Adam-Optimierer mit einem benutzerdefinierten Lernratenplan, der eine Aufwärmphase gefolgt von einem Abklingen umfasste. Die Architektur folgte einer Encoder-Decoder-Struktur mit gestapelten Schichten von Multi-Head-Aufmerksamkeit und Feed-Forward-Netzen und verwendete Residualverbindungen um jede Unterschicht.
Auswirkungen und Vermächtnis
Die im Papier eingeführte Transformer-Architektur wurde schnell zum dominierenden Ansatz in der Verarbeitung natürlicher Sprache. Sie ersetzte rekurrente neuronale Netze in vielen Anwendungen und führte zur Entwicklung von Modellen wie BERT und GPT. Diese Modelle wiederum untermauerten den Aufstieg großer Sprachmodelle wie der von OpenAI, Anthropic und Google DeepMind entwickelten. Die Parallelisierbarkeit der Architektur machte sie besonders geeignet für das Training auf spezialisierter Hardware wie GPUs und TPUs, was die Skalierung von Modellen auf beispiellose Größen ermöglichte.
Über die Sprache hinaus wurde der Transformer auf Computer Vision, Audioverarbeitung und sogar Proteinfaltung angewendet, was seine Vielseitigkeit demonstriert. Der Einfluss des Papiers spiegelt sich in seiner Zitationszahl wider, die bis 2026 250.000 überschritt und es zu einem der meistzitierten Papiere in der Geschichte der Informatik machte.
Die anschließenden Karrieren der Autoren unterstreichen ebenfalls die Bedeutung des Papiers. Nachdem sie Google verlassen hatten, gründeten sie verschiedene KI-Startups und Forschungslabore oder schlossen sich diesen an, darunter Unternehmen wie AI21 Labs, Essential AI und Inceptive, und trugen so zum breiteren KI-Ökosystem bei.
Rezeption und Anerkennung
Das Papier wurde ursprünglich auf der Konferenz für neuronale Informationsverarbeitungssysteme (NeurIPS) 2017 in Long Beach, Kalifornien, präsentiert, wo es den Best Paper Award erhielt. Es wurde für seine elegante Vereinfachung der Sequenzmodellierung und seine starken empirischen Ergebnisse gelobt, wobei es auf maschinellen Übersetzungsaufgaben den Stand der Technik erreichte und schnellere Trainingszeiten als bestehende rekurrente Modelle bot.
Im Laufe der Zeit wurde das Papier als grundlegende Arbeit im Bereich des Deep Learning anerkannt. Es wird oft als wichtiger Meilenstein in der Geschichte der künstlichen Intelligenz zitiert, neben anderen Durchbrüchen wie dem Residualnetzwerk und dem Adam-Optimierer. Der Begriff „Aufmerksamkeit“ selbst ist zu einem zentralen Konzept in der KI-Forschung geworden, mit zahlreichen Erweiterungen und Variationen, die in den folgenden Jahren vorgeschlagen wurden.
Trotz seines Erfolgs wurde das Papier auch hinsichtlich der Interpretierbarkeit von Aufmerksamkeitsmechanismen und der Rechenkosten großer Transformer kritisch betrachtet, was zu laufender Forschung an effizienteren Architekturen und alternativen Aufmerksamkeitsmechanismen führte. Dennoch bleibt der Transformer bis 2026 das Rückgrat der meisten modernen KI-Systeme.