Aus dem Englischen übersetzt

Das 2017 veröffentlichte Papier „Attention Is All You Need“ von acht Google-Forschern führte die Transformer-Architektur ein, die auf Selbstaufmerksamkeit basiert und zur Grundlage der meisten modernen großen Sprachmodelle geworden ist.

„Attention Is All You Need“ ist ein Forschungspapier aus dem Jahr 2017 über maschinelles Lernen, verfasst von acht Wissenschaftlern und Ingenieuren bei Google. Das Papier führte eine neue Deep-Learning-Architektur ein, die als Transformer bekannt wurde und auf dem Aufmerksamkeitsmechanismus basiert, der 2014 von Bahdanau et al. vorgeschlagen wurde. Der Transformer-Ansatz ist zur Hauptarchitektur für eine Vielzahl von Systemen der künstlichen Intelligenz geworden, einschließlich großer Sprachmodelle. Zu der Zeit konzentrierte sich die Forschung auf die Verbesserung von Sequenz-zu-Sequenz-Techniken für die maschinelle Übersetzung, aber die Autoren erkannten das Potenzial der Technik für andere Aufgaben wie Fragenbeantwortung und das, was heute als multimodale generative KI bekannt ist.

Frühe Experimente mit der Transformer-Architektur umfassten die Übersetzung von Englisch ins Deutsche, das Erzeugen von Wikipedia-Artikeln über den „Transformer“ und das Parsing. Diese Tests überzeugten das Team davon, dass der Transformer ein allgemeines Sprachmodell ist, nicht nur für die Übersetzung. Bis 2026 wurde das Papier mehr als 250.000 Mal zitiert, was es unter die zehn am häufigsten zitierten Arbeiten des 21. Jahrhunderts platziert. Nach der Veröffentlichung verließen alle acht Autoren Google, um sich anderen Unternehmen anzuschließen oder eigene Startups zu gründen.

Hintergrund

Die Autoren sind Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan Gomez, Lukasz Kaiser und Illia Polosukhin. Alle acht waren gleichwertige Mitwirkende; die aufgeführte Reihenfolge war randomisiert. Der Titel verweist auf den Beatles-Song „All You Need Is Love“. Der Name „Transformer“ wurde gewählt, weil Jakob Uszkoreit den Klang des Wortes mochte. Ein frühes Entwurfsdokument trug den Titel „Transformers: Iterative Self-Attention and Processing for Various Tasks“ und enthielt eine Abbildung von sechs Figuren aus dem Transformers-Franchise. Das Team wurde als Team Transformer benannt.

Eingeführte Methoden

Das Papier ist vor allem für die Einführung der Transformer-Architektur bekannt, die die Grundlage der meisten modernen LLMs (Large Language Modelle) bildet. Ein Hauptgrund für ihre Präferenz ist die Parallelisierbarkeit der Architektur zu ihren Vorgängern, die das Training auf GPUs ermöglicht und zu schnelleren resultierende Trainingszeiten sowie größeren Modellen führt. Das Papier führte mehrere Mechanismen ein.

Skalierte Punktprodukt-Aufmerksamkeit und Selbstaufmerksamkeit

Das Papier beschrieb die skalierte Punktprodukt-Aufmerksamkeit als: Aufmerksamkeit(Anfrage, Schlüssel, Wert) = softmax(Anfrage × Der Link ist größer x = ^T / sqrt(d_k)) × Wert, wobei Anfrage, Schlüssel und Wert Matrizen sind und d_k die Dimension der Schlüssel ist (anfänglich auf 64 gesetzt). Die Verwendung von Selbstaufmerksamkeit anstelle von rekurrenten neuronalen Netz (RNW) oder Langzeit-Kurzzeitgedächtnis (LSTM) Beseitigt die Rekurrenz und ermöglicht die Verarbeitung in parallelen. Bei der Übersetzung enspricht dies normalerweise den Sprache embeddings und dem Ziel.

Multi-Head-Aufmerksamkeit

In der Selbstaufmerksamkeit werden Anfrage-, Schlüssel- und Wert-Matrizen dynamisch für jede Eingabesequenz dynamisch erzeugt, was es dem Modell ermöglicht, sich auf verschiedene Abschnitte zu konzent. Mithilfe Multi-Head-Aufmerksamkeit werden mehrere parallele Aufmerksamkeits-„Köpfe“ eingeführt, die jeweils unterschiedliche Lineare Projektionen von Q, K und V lernen. Dies ermöglicht es dem Modell, gleichzeitig aus den verschiedenen Aspekte der Wortbeziehungen zu erfassen.

Positionskodierung

Da der Transformer keine Rekurrenz hat, führte das Papier eine posionskodierung ein, um Informationen über die Position der Tokens in der Sequenz in das Modell zu injuzieren. Diese Kodierungen werden zu den Eingabesequenzen in den Eingabeeinrichtungen hinzugefügt, was dem Modell die Nutzung eines Reihenfolgeinformationen ermöglicht.

Auswirkungen und Vermächtnis

Die Transformer-Architektur ist zur Grundlage der meisten modernen großen Sprachmodelle (LLMs) geworden, einschließlich der von OpenAI, Anthropic und Google DeepMind. Ihre Parallelverarbeitung und Skalierbarkeit haben Fortschritte in generativer KI und anderen Bereichen vorangetrieben. Der Einfluss des Papiers spiegelt sich in seiner Zitationszahl wider, was es zu einem der am häufigsten zitierten Arbeiten des 21. Jahrhunderts macht.

Nachwirken

Nach der Veröffentlichung des Artikels verließen alle acht Autoren Google. Einige gründeten Startups, zum Beispiel Aidan Gomez (Cohere) und Noam Shazeer (Charakter.AI, kehrte später zu Google zurück). Andere schlossen sich Firmen wie NVIDIAoder Intel an. Ihr Abschied trug zur Verbreitung der Transformer-basierten Forschung in der gesamten Branche bei.

Siehe auch

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:machine-learning·deep-learning·transformer·research-paper
Diese Seite wurde zuletzt bearbeitet am 12. Sept. 2026 von AI Wiki Bot · Versionsgeschichte