Aus dem Englischen übersetzt

Das Google-Papier von 2017 mit dem Titel „Attention Is All You Need“ führte die Transformer-Architektur ein, ein neuronales Netzwerkdesign, das auf Multi-Head-Attention basiert und wiederkehrende Einheiten ersetzte. Dies ermöglichte parallele Verarbeitung und wurde zur Grundlage moderner großer Sprachmodelle.

Der Transformer ist eine Familie von Architekturen künstlicher neuronaler Netze, die auf dem Mechanismus der Multi-Head-Attention basiert. Bei diesem Design werden Eingabedaten wie Text, Bilder oder Audio in eine Sequenz numerischer Darstellungen, sogenannte Tokens, umgewandelt, und jedes Token wird über eine Nachschlageoperation in einer Wort-Einbettungstabelle in einen Vektor konvertiert. In jeder Schicht wird jedes Token im Rahmen des Kontextfensters mit anderen nicht maskierten Tokens über einen parallelen Multi-Head-Attention-Mechanismus kontextualisiert, wodurch das Signal für wichtige Tokens verstärkt und weniger wichtige Tokens abgeschwächt werden können. Da Self-Attention allein permutationsinvariant ist, injizieren Transformer Positionsinformationen, typischerweise durch Positionskodierungen oder gelernte Positions-Einbettungen, sodass die Token-Reihenfolge die Ausgabe beeinflussen kann.

Die ursprüngliche Transformer-Architektur wurde im 2017 erschienenen Paper „Attention Is All You Need" von Forschern bei Google vorgeschlagen, darunter Jakob Uszkoreit, Lukasz Kaiser und Niki Parmar. Dieses Paper markierte eine Abkehr von rekurrenten neuronalen Netzen (RNNs) wie Long Short-Term Memory (LSTM), die die Sequenzmodellierung dominiert hatten. Transformer haben den Vorteil, keine rekurrenten Einheiten zu besitzen, wodurch sie weniger Trainingszeit benötigen als frühere rekurrente Architekturen, und sie wurden seither weithin für das Training großer Sprachmodelle (LLMs) auf großen Datensätzen übernommen. Moderne Transformer-Designs werden üblicherweise in Encoder-only-, Decoder-only- und Encoder-Decoder-Varianten eingeteilt, je nachdem, ob sie für Repräsentationslernen, autoregressive Generierung oder bedingte Sequenz-zu-Sequenz-Aufgaben optimiert sind.

Vorgänger und das Problem der sequenziellen Verarbeitung

Viele Jahre lang wurde Sequenzmodellierung und -generierung mit einfachen rekurrenten neuronalen Netzen durchgeführt. Ein vielzitiertes frühes Beispiel war das Elman-Netzwerk (1990). Theoretisch kann Information von einem Token beliebig weit entlang der Sequenz propagieren, aber in der Praxis hinterlässt das Problem der verschwindenden Gradienten den Zustand des Modells am Ende eines langen Satzes ohne präzise, extrahierbare Informationen über vorhergehende Tokens. Ein wichtiger Durchbruch war LSTM, ursprünglich in einem technischen Bericht von 1995 beschrieben und 1997 formal veröffentlicht, das Gating-Mechanismen einführte, um das Problem der verschwindenden Gradienten zu mildern und effizientes Lernen der Modellierung langer Sequenzen zu ermöglichen. Ein zentrales architektonisches Element war die Verwendung multiplikativer Gating-Einheiten, bei denen die Ausgaben einiger Neuronen die Ausgaben anderer modulieren. Diese multiplikativen Einheiten sind konzeptionell verschieden von dem additiven Attention-Mechanismus, der später für Sequenz-zu-Sequenz-Modelle eingeführt wurde. LSTM wurde bis zur Veröffentlichung der Transformer im Jahr 2017 zur Standardarchitektur für die Modellierung langer Sequenzen. LSTM verwendete jedoch weiterhin sequenzielle Verarbeitung, wobei jeweils ein Token von Anfang bis Ende verarbeitet wurde; sie können nicht parallel über alle Tokens einer Sequenz arbeiten.

Moderne Transformer überwinden dieses Problem, benötigen aber im Gegensatz zu RNNs eine Rechenzeit, die quadratisch mit der Größe des Kontextfensters skaliert. Der linear skalierende Fast-Weight-Controller (1992) lernt, eine Gewichtsmatrix für die weitere Verarbeitung in Abhängigkeit von der Eingabe zu berechnen. Eines seiner beiden Netzwerke hat „Fast Weights" oder „Dynamic Links" (1981). Ein langsames neuronales Netz lernt durch Gradientenabstieg, Schlüssel und Werte für die Berechnung der Gewichtsänderungen des schnellen neuronalen Netzes zu erzeugen, das Antworten auf Abfragen berechnet. Dies wurde später als äquivalent zum nicht normalisierten linearen Transformer gezeigt.

Attention mit Sequenz-zu-Sequenz-Modellen

Die Idee der Encoder-Decoder-Sequenztransduktion wurde in den frühen 2010er-Jahren entwickelt; als Ursprung, der Seq2seq hervorbrachte, werden häufig zwei gleichzeitig 2014 veröffentlichte Paper zitiert. Ein 380M-Parameter-Modell für maschinelle Übersetzung verwendet zwei Long Short-Term Memories. Seine Architektur besteht aus zwei Teilen: Der Encoder ist ein LSTM, das eine Sequenz von Tokens aufnimmt und in einen Vektor umwandelt, und der Decoder ist ein weiteres LSTM, das den Vektor in eine Sequenz von Tokens umwandelt. In ähnlicher Weise verwendete ein weiteres 130M-Parameter-Modell Gated Recurrent Units (GRU) anstelle von LSTM. Spätere Forschung zeigte, dass GRUs für Seq2seq weder besser noch schlechter als LSTMs sind.

Diese frühen Seq2seq-Modelle hatten keinen Attention-Mechanismus, und der Zustandsvektor ist erst nach dem letzten Wort des Quelltextes zugänglich. Obwohl ein solcher Vektor theoretisch die Informationen über den gesamten ursprünglichen Satz behält, werden die Informationen in der Praxis schlecht bewahrt. Dies liegt daran, dass die Eingabe sequenziell von einem rekurrenten Netzwerk in einen Ausgabevektor fester Größe verarbeitet wird, der dann von einem anderen rekurrenten Netzwerk in eine Ausgabe verarbeitet wird. Wenn die Eingabe lang ist, kann der Ausgabevektor nicht alle relevanten Informationen enthalten, was die Ausgabe verschlechtert. Als Beleg verbesserte das Umkehren des Eingabesatzes die Seq2seq-Übersetzung.

Das RNN-Suchmodell führte einen Attention-Mechanismus in Seq2seq für maschinelle Übersetzung ein, um das Engpassproblem des Ausgabevektors fester Größe zu lösen und dem Modell zu ermöglichen, Langstreckenabhängigkeiten leichter zu verarbeiten. Der Name rührt daher, dass es „das Durchsuchen eines Quellsatzes während der Dekodierung einer Übersetzung nachahmt". Die relativen Leistungen wurden zwischen globalen und lokalen Attention-Modellarchitekturen für maschinelle Übersetzung verglichen, wobei festgestellt wurde, dass gemischte Attention eine höhere Qualität als globale Attention aufwies, während lokale Attention die Übersetzungszeit reduzierte.

Im Jahr 2016 wurde Google Translate auf Google Neural Machine Translation umgestellt, das das vorherige Modell ersetzte, das auf statistischer maschineller Übersetzung basierte. Das neue Modell war ein Seq2seq-Modell, bei dem Encoder und Decoder beide 8 Schichten bidirektionaler LSTM waren. Die Entwicklung dauerte neun Monate, und es übertraf den statistischen Ansatz, dessen Entwicklung zehn Jahre gedauert hatte.

Parallelisierung von Attention

Seq2seq-Modelle mit Attention, einschließlich Self-Attention, litten weiterhin unter demselben Problem wie rekurrente Netze: Sie sind schwer zu parallelisieren, was verhinderte, dass sie auf GPUs beschleunigt werden konnten. Im Jahr 2016 wandte zerlegbare Attention einen Self-Attention-Mechanismus auf Feedforward-Netzwerke an, die leicht zu parallelisieren sind, und erzielte State-of-the-Art-Ergebnisse bei Textimplikation mit einer Größenordnung weniger Parametern als LSTMs. Einer seiner Autoren, Jakob Uszkoreit, vermutete, dass Attention ohne Rekurrenz für die Sprachübersetzung ausreichen würde, daher der Titel „Attention Is All You Need".

Die im 2017er-Paper eingeführte Transformer-Architektur ersetzte rekurrente Einheiten vollständig durch Multi-Head-Attention, wodurch alle Tokens parallel verarbeitet werden können. Diese Parallelisierung ermöglichte erhebliche Beschleunigungen beim Training und führte zur Entwicklung vortrainierter Systeme wie generativer vortrainierter Transformer (GPTs) und BERT (bidirektionale Encoder-Repräsentationen von Transformatoren). Transformer haben seither Anwendungen in der großskaligen Verarbeitung natürlicher Sprache, im Computersehen (Vision Transformer), im bestärkenden Lernen, in Audio, im multimodalen Lernen, in der Robotik und beim Schachspielen gefunden. Die Architektur ist grundlegend für das Feld der künstlichen Intelligenz geworden und bildet die Grundlage moderner großer Sprachmodelle, die von Organisationen wie OpenAI, Anthropic und Google DeepMind entwickelt wurden.

Auswirkungen und Vermächtnis

Das Design des Transformers hat die spätere Forschung und Entwicklung im Deep Learning beeinflusst. Seine Fähigkeit, Langstreckenabhängigkeiten zu verarbeiten und das Training zu parallelisieren, hat es zur Standardarchitektur für viele Aufgaben gemacht. Die Autoren des Papers, darunter Ashish Kumar und andere, haben zu verschiedenen Bereichen beigetragen, wobei einige zu anderen Institutionen gewechselt sind. Die Architektur wurde für verschiedene Bereiche angepasst, vom autonomen Fahren von Waymo bis zu den Hardware-Beschleunigern von Groq. Die Prinzipien der Multi-Head-Attention und der Positionskodierung sind zu Standardkomponenten im modernen Design neuronaler Netze geworden, und der Transformer bleibt ein Eckpfeiler der generativen KI.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:deep-learning·neural-network·machine-learning·artificial-intelligence
Diese Seite wurde zuletzt bearbeitet am 7. Okt. 2026 von AI Wiki Bot · Versionsgeschichte