"Attention Is All You Need" 2017 में प्रकाशित एक शोध पत्र है, जो Machine learning पर आधारित है और इसे Google में कार्यरत आठ वैज्ञानिकों और इंजीनियरों ने लिखा था। इस पत्र ने एक नई Deep learning वास्तुकला पेश की, जिसे Transformer (architecture) के रूप में जाना जाता है, जो 2014 में Bahdanau एट अल. द्वारा प्रस्तावित ध्यान तंत्र पर आधारित है। ट्रांसफॉर्मर दृष्टिकोण विभिन्न प्रकार के Artificial intelligence सिस्टमों के लिए मुख्य वास्तुकला बन गया है, जिसमें Large language model शामिल हैं। उस समय, शोध मुख्य रूप से मशीन अनुवाद के लिए अनुक्रम-से-अनुक्रम तकनीकों को बेहतर बनाने पर केंद्रित था, लेकिन लेखकों ने प्रश्न उत्तर देने और जिसे अब मल्टीमॉडल Generative AI कहा जाता है, जैसे अन्य कार्यों के लिए इस तकनीक की क्षमता का पूर्वानुमान लगाया था।
ट्रांसफॉर्मर वास्तुकला के साथ प्रारंभिक प्रयोगों में अंग्रेजी-से-जर्मन अनुवाद, "द ट्रांसफॉर्मर" पर विकिपीडिया लेख उत्पन्न करना और पार्सिंग शामिल थे। इन परीक्षणों ने टीम को आश्वस्त किया कि ट्रांसफॉर्मर एक सामान्य-उद्देश्यीय भाषा मॉडल है, न कि केवल अनुवाद के लिए। 2026 तक, इस पत्र को 250,000 से अधिक बार उद्धृत किया गया है, जो इसे 21वीं सदी के शीर्ष दस सबसे अधिक उद्धृत पत्रों में रखता है। प्रकाशन के बाद, आठों लेखकों ने Google छोड़ दिया और अन्य कंपनियों में शामिल हो गए या स्टार्टअप स्थापित किए।
पृष्ठभूमि
लेखक हैं Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan Gomez, Lukasz Kaiser, और Illia Polosukhin। आठों समान योगदानकर्ता थे; सूचीबद्ध क्रम यादृच्छिक था। शीर्षक बीटल्स गीत "ऑल यू नीड इज़ लव" को संदर्भित करता है। "ट्रांसफॉर्मर" नाम इसलिए चुना गया क्योंकि Jakob Uszkoreit को शब्द की ध्वनि पसंद थी। एक प्रारंभिक डिज़ाइन दस्तावेज़ का शीर्षक "ट्रांसफॉर्मर्स: इटरेटिव सेल्फ-अटेंशन एंड प्रोसेसिंग फॉर वेरियस टास्क्स" था और इसमें ट्रांसफॉर्मर्स फ्रैंचाइज़ के छह पात्रों का चित्रण शामिल था। टीम का नाम टीम ट्रांसफॉर्मर रखा गया था।
प्रस्तुत विधियाँ
यह पत्र मुख्य रूप से ट्रांसफॉर्मर वास्तुकला पेश करने के लिए जाना जाता है, जो अधिकांश आधुनिक LLM की नींव है। इसकी प्राथमिकता का एक प्रमुख कारण अपने पूर्ववर्तियों की तुलना में वास्तुकला की समानांतरकरण क्षमता है, जो GPU पर प्रशिक्षण को सक्षम बनाती है और तेज़ प्रशिक्षण समय तथा बड़े मॉडल की अनुमति देती है। पत्र ने कई तंत्र पेश किए।
स्केल्ड डॉट-प्रोडक्ट अटेंशन और सेल्फ-अटेंशन
पत्र ने स्केल्ड डॉट-प्रोडक्ट अटेंशन को इस प्रकार वर्णित किया: Attention(Query, Key, Value) = softmax(Query × Key^T / sqrt(d_k)) × Value, जहाँ Query, Key, और Value मैट्रिक्स हैं और d_k कुंजियों का आयाम है (शुरुआत में 64 सेट किया गया)। पुनरावर्ती तंत्रिका नेटवर्क (RNN) या लंबी अल्पकालिक स्मृति (LSTM) के बजाय सेल्फ-अटेंशन का उपयोग करने से पुनरावृत्ति समाप्त हो जाती है, जिससे समानांतरकरण सुनिश्चित होता है। अनुवाद में, Query और Key मैट्रिक्स आमतौर पर स्रोत-भाषा एम्बेडिंग के अनुरूप होते हैं, जबकि Value लक्ष्य भाषा के अनुरूप होता है।
मल्टी-हेड अटेंशन
सेल्फ-अटेंशन में, प्रत्येक इनपुट अनुक्रम के लिए क्वेरी, कुंजी और मान गतिशील रूप से उत्पन्न होते हैं, जिससे मॉडल विभिन्न भागों पर ध्यान केंद्रित कर सकता है। मल्टी-हेड अटेंशन कई समानांतर ध्यान हेड पेश करता है, जिनमें से प्रत्येक Q, K, और V के विभिन्न रैखिक प्रक्षेपण सीखता है। यह मॉडल को शब्द संबंधों के विभिन्न पहलुओं को एक साथ पकड़ने की अनुमति देता है।
स्थितीय एन्कोडिंग
चूंकि ट्रांसफॉर्मर में पुनरावृत्ति नहीं होती है, पत्र ने अनुक्रम में टोकन की स्थिति के बारे में जानकारी इंजेक्ट करने के लिए Positional Encoding पेश किया। ये एन्कोडिंग इनपुट एम्बेडिंग में जोड़े जाते हैं, जिससे मॉडल क्रम जानकारी का उपयोग कर सकता है।
प्रभाव और विरासत
ट्रांसफॉर्मर वास्तुकला अधिकांश आधुनिक बड़े भाषा मॉडलों की नींव बन गई है, जिसमें OpenAI, Anthropic, और Google DeepMind द्वारा विकसित मॉडल शामिल हैं। इसकी समानांतरकरण क्षमता और स्केलेबिलिटी ने Generative AI और अन्य क्षेत्रों में प्रगति को बढ़ावा दिया है। पत्र का प्रभाव इसके उद्धरण संख्या में परिलक्षित होता है, जो इसे 21वीं सदी के सबसे अधिक उद्धृत पत्रों में से एक बनाता है।
परिणाम
पत्र के प्रकाशन के बाद, आठों लेखकों ने Google छोड़ दिया। कुछ ने स्टार्टअप स्थापित किए, जैसे Aidan Gomez (Cohere) और Noam Shazeer (Character.AI, बाद में Google लौटे)। अन्य NVIDIA या Intel जैसी कंपनियों में शामिल हो गए। उनके प्रस्थान ने उद्योग में ट्रांसफॉर्मर-आधारित शोध के प्रसार में योगदान दिया।