"Attention Is All You Need" एक 2017 का शोध पत्र है जो मशीन लर्निंग पर आधारित है, जिसे Google में कार्यरत आठ वैज्ञानिकों और इंजीनियरों ने लिखा था। इस पत्र ने एक नया डीप लर्निंग आर्किटेक्चर पेश किया जिसे ट्रांसफॉर्मर के रूप में जाना जाता है, जो 2014 में बहदानाऊ एट अल द्वारा प्रस्तावित अटेंशन तंत्र पर आधारित था। इस पत्र में वर्णित ट्रांसफॉर्मर दृष्टिकोण कई प्रकार की कृत्रिम बुद्धिमत्ता प्रणालियों का मुख्य आर्किटेक्चर बन गया है, जिसमें बड़े भाषा मॉडल शामिल हैं। उस समय, शोध का ध्यान मशीन अनुवाद के लिए Seq2seq तकनीकों को बेहतर बनाने पर था, लेकिन लेखकों ने पत्र में आगे जाकर इस तकनीक की क्षमता को अन्य कार्यों जैसे प्रश्न-उत्तर और जिसे अब मल्टीमॉडल जनरेटिव एआई कहा जाता है, के लिए देखा।
कुछ शुरुआती उदाहरण जिन पर टीम ने अपने ट्रांसफॉर्मर आर्किटेक्चर का परीक्षण किया, उनमें अंग्रेजी-से-जर्मन अनुवाद, "द ट्रांसफॉर्मर" पर विकिपीडिया लेख उत्पन्न करना और पार्सिंग शामिल थे। इन्होंने टीम को आश्वस्त किया कि ट्रांसफॉर्मर एक सामान्य-उद्देश्यीय भाषा मॉडल है, न कि केवल अनुवाद के लिए अच्छा।
2026 तक, इस पत्र को 250,000 से अधिक बार उद्धृत किया गया है, जो इसे 21वीं सदी के शीर्ष दस सबसे अधिक उद्धृत पत्रों में रखता है। Google द्वारा पत्र प्रकाशित होने के बाद, आठों लेखकों ने कंपनी छोड़ दी और अन्य कंपनियों में शामिल हो गए या स्टार्टअप की स्थापना की।
पृष्ठभूमि
पत्र के लेखक हैं आशीष वासवानी, नोम शज़ीर, निकी परमार, जैकब उज़कोराइट, लियोन जोन्स, एडन गोमेज़, लुकाज़ कैसर और इलिया पोलोसुखिन। सभी आठ लेखक पत्र के "समान योगदानकर्ता" थे; सूचीबद्ध क्रम यादृच्छिक था (पत्र के अनुसार)। पत्र के बाद, प्रत्येक लेखक ने Google छोड़ दिया और अन्य कंपनियों में शामिल हो गए या स्टार्टअप की स्थापना की।
पत्र का शीर्षक बीटल्स के गीत "ऑल यू नीड इज़ लव" का संदर्भ है। "ट्रांसफॉर्मर" नाम इसलिए चुना गया क्योंकि पत्र के लेखकों में से एक जैकब उज़कोराइट को उस शब्द की ध्वनि पसंद थी। एक प्रारंभिक डिज़ाइन दस्तावेज़ का शीर्षक "ट्रांसफॉर्मर्स: इटरेटिव सेल्फ-अटेंशन एंड प्रोसेसिंग फॉर वेरियस टास्क्स" था, और इसमें ट्रांसफॉर्मर्स फ्रैंचाइज़ के छह पात्रों का चित्रण शामिल था। टीम का नाम टीम ट्रांसफॉर्मर रखा गया था।
चर्चित और प्रस्तुत विधियाँ
यह पत्र ट्रांसफॉर्मर आर्किटेक्चर पेश करने के लिए सबसे प्रसिद्ध है, जो अधिकांश आधुनिक बड़े भाषा मॉडल (LLM) का आधार है। एक प्रमुख कारण जिसके लिए यह आर्किटेक्चर अधिकांश आधुनिक LLM द्वारा पसंद किया जाता है, वह है अपने पूर्ववर्तियों पर आर्किटेक्चर की समानांतरीकरण क्षमता। यह सुनिश्चित करता है कि प्रशिक्षण के लिए आवश्यक संचालन GPU पर त्वरित किए जा सकते हैं, जिससे तेज़ प्रशिक्षण समय और बड़े आकार के मॉडल दोनों को प्रशिक्षित किया जा सकता है।
पत्र ने ट्रांसफॉर्मर आर्किटेक्चर के विकास के हिस्से के रूप में निम्नलिखित तंत्र पेश किए।
स्केल्ड डॉट-प्रोडक्ट अटेंशन और सेल्फ-अटेंशन
आवर्तक तंत्रिका नेटवर्क (RNN) या लॉन्ग शॉर्ट-टर्म मेमोरी (जो पुनरावृत्ति पर निर्भर करते हैं) के बजाय स्केल्ड डॉट-प्रोडक्ट अटेंशन और सेल्फ-अटेंशन तंत्र का उपयोग निम्नलिखित अनुच्छेद में वर्णित बेहतर प्रदर्शन की अनुमति देता है। पत्र ने स्केल्ड डॉट-प्रोडक्ट अटेंशन को इस प्रकार वर्णित किया:
Attention(Query, Key, Value) := softmax(Query × Key^T / √d_k) × Value
जहाँ Query, Key, Value क्रमशः क्वेरी, कुंजी, मान मैट्रिक्स हैं, और d_k मानों का आयाम है।
चूंकि मॉडल Query, Key और Value मैट्रिक्स पर निर्भर करता है जो एक ही स्रोत (यानी इनपुट अनुक्रम या संदर्भ विंडो) से आते हैं, यह RNN की आवश्यकता को समाप्त करता है, पूरी तरह से आर्किटेक्चर के लिए समानांतरीकरण सुनिश्चित करता है। यह 2014 में पेश किए गए अटेंशन तंत्र के मूल रूप से भिन्न है। इसके अतिरिक्त, पत्र एक अतिरिक्त स्केलिंग कारक के उपयोग पर चर्चा करता है जो कुंजी वैक्टर के आयाम (जिसे d_k के रूप में दर्शाया गया है और शुरू में पत्र के भीतर 64 पर सेट किया गया था) के संबंध में सबसे प्रभावी पाया गया था, जैसा कि ऊपर दिखाया गया है।
अनुवाद के विशिष्ट संदर्भ में, जिस पर पत्र केंद्रित था, Query और Key मैट्रिक्स आमतौर पर स्रोत भाषा के अनुरूप एम्बेडिंग में दर्शाए जाते हैं, जबकि Value मैट्रिक्स लक्ष्य भाषा से मेल खाता है।
मल्टी-हेड अटेंशन
सेल्फ-अटेंशन तंत्र में, क्वेरी (Q), कुंजी (K) और मान (V) प्रत्येक इनपुट अनुक्रम के लिए गतिशील रूप से उत्पन्न होते हैं (आमतौर पर संदर्भ विंडो के आकार द्वारा सीमित), जिससे मॉडल विभिन्न चरणों में इनपुट अनुक्रम के विभिन्न हिस्सों पर ध्यान केंद्रित कर सकता है। मल्टी-हेड अटेंशन कई समानांतर अटेंशन हेड पेश करके इस प्रक्रिया को बढ़ाता है। प्रत्येक अटेंशन हेड Q, K और V मैट्रिक्स के विभिन्न रैखिक प्रक्षेपण सीखता है। यह मॉडल को अनुक्रम में शब्दों के बीच संबंधों के विभिन्न पहलुओं को एक साथ पकड़ने की अनुमति देता है, न कि केवल एक पहलू पर ध्यान केंद्रित करने की।
ऐसा करके, मल्टी-हेड अटेंशन मॉडल को विभिन्न स्थितियों पर विभिन्न प्रतिनिधित्व उप-स्थानों से जानकारी पर ध्यान देने में सक्षम बनाता है। पत्र ने हेड की संख्या 8 निर्धारित की, प्रत्येक हेड के साथ कम आयाम (d_k = 64) होता है, जिसके परिणामस्वरूप कुल कम्प्यूटेशनल लागत एकल पूर्ण-आयामी अटेंशन हेड के समान होती है।
स्थितीय एन्कोडिंग
चूंकि ट्रांसफॉर्मर आर्किटेक्चर स्वाभाविक रूप से अनुक्रम में टोकन के क्रम को नहीं पकड़ता है, पत्र ने स्थितीय एन्कोडिंग पेश की। ये वेक्टर हैं जो प्रत्येक टोकन की स्थिति के बारे में जानकारी प्रदान करने के लिए इनपुट एम्बेडिंग में जोड़े जाते हैं। पत्र ने विभिन्न आवृत्तियों के साइन और कोसाइन फ़ंक्शन का उपयोग किया, जिससे मॉडल को सापेक्ष स्थिति द्वारा ध्यान देने के लिए सीखने की अनुमति मिली। यह अनुवाद जैसे कार्यों के लिए एक महत्वपूर्ण घटक था, जहाँ शब्द क्रम मायने रखता है।
अन्य घटक
पत्र ने कई अन्य तकनीकों को भी शामिल किया जो पहले से ही डीप लर्निंग समुदाय में ज्ञात थीं। इसने प्रशिक्षण को स्थिर करने के लिए लेयर नॉर्मलाइज़ेशन, नियमितीकरण के लिए Dropout और एक कस्टम लर्निंग रेट शेड्यूल के साथ एडम ऑप्टिमाइज़र का उपयोग किया जिसमें वार्मअप चरण और उसके बाद क्षय शामिल था। आर्किटेक्चर ने एनकोडर-डिकोडर संरचना का पालन किया, जिसमें मल्टी-हेड अटेंशन और फीड-फॉरवर्ड नेटवर्क की स्टैक्ड परतें थीं, और प्रत्येक उप-परत के चारों ओर अवशिष्ट कनेक्शन का उपयोग किया।
प्रभाव और विरासत
पत्र में पेश किया गया ट्रांसफॉर्मर आर्किटेक्चर जल्दी ही प्राकृतिक भाषा प्रसंस्करण में प्रमुख दृष्टिकोण बन गया। इसने कई अनुप्रयोगों में आवर्तक तंत्रिका नेटवर्क को बदल दिया, जिससे BERT और GPT जैसे मॉडलों का विकास हुआ। इन मॉडलों ने, बदले में, OpenAI, Anthropic और Google DeepMind जैसी कंपनियों द्वारा विकसित बड़े भाषा मॉडलों के उदय को रेखांकित किया। आर्किटेक्चर की समानांतरीकरण क्षमता ने इसे GPU और TPU जैसे विशेष हार्डवेयर पर प्रशिक्षण के लिए विशेष रूप से उपयुक्त बनाया, जिससे मॉडलों को अभूतपूर्व आकारों तक स्केल करना संभव हुआ।
भाषा से परे, ट्रांसफॉर्मर को कंप्यूटर विज़न, ऑडियो प्रोसेसिंग और यहां तक कि प्रोटीन फोल्डिंग पर भी लागू किया गया है, जो इसकी बहुमुखी प्रतिभा को प्रदर्शित करता है। पत्र का प्रभाव इसके उद्धरण संख्या में परिलक्षित होता है, जो 2026 तक 250,000 से अधिक हो गई, जिससे यह कंप्यूटर विज्ञान के इतिहास में सबसे अधिक उद्धृत पत्रों में से एक बन गया।
लेखकों के बाद के करियर भी पत्र के महत्व को उजागर करते हैं। Google छोड़ने के बाद, उन्होंने AI21 Labs, Essential AI और Inceptive जैसी कंपनियों सहित विभिन्न AI स्टार्टअप और शोध प्रयोगशालाओं की स्थापना की या उनमें शामिल हुए, जो व्यापक AI पारिस्थितिकी तंत्र में योगदान देते हैं।
स्वागत और मान्यता
यह पत्र शुरू में लॉन्ग बीच, कैलिफोर्निया में 2017 के न्यूरल इंफॉर्मेशन प्रोसेसिंग सिस्टम्स सम्मेलन (NeurIPS) में प्रस्तुत किया गया था, जहाँ इसे सर्वश्रेष्ठ पत्र पुरस्कार मिला। इसे अनुक्रम मॉडलिंग के सुरुचिपूर्ण सरलीकरण और मजबूत अनुभवजन्य परिणामों के लिए प्रशंसा मिली, जिसने मौजूदा आवर्तक मॉडलों की तुलना में तेज़ प्रशिक्षण समय के साथ मशीन अनुवाद कार्यों पर अत्याधुनिक प्रदर्शन प्राप्त किया।
समय के साथ, पत्र को डीप लर्निंग के क्षेत्र में एक मौलिक कार्य के रूप में मान्यता दी गई है। इसे अक्सर कृत्रिम बुद्धिमत्ता के इतिहास में एक प्रमुख मील का पत्थर के रूप में उद्धृत किया जाता है, साथ ही अवशिष्ट नेटवर्क और एडम ऑप्टिमाइज़र जैसी अन्य सफलताओं के साथ। "अटेंशन" शब्द स्वयं AI शोध में एक केंद्रीय अवधारणा बन गया है, जिसमें बाद के वर्षों में कई विस्तार और विविधताएं प्रस्तावित की गईं।
अपनी सफलता के बावजूद, पत्र को अटेंशन तंत्र की व्याख्या क्षमता और बड़े ट्रांसफॉर्मरों की कम्प्यूटेशनल लागतों के संबंध में भी जांच का सामना करना पड़ा है, जिससे अधिक कुशल आर्किटेक्चर और वैकल्पिक अटेंशन तंत्रों पर चल रहे शोध हुए हैं। फिर भी, 2026 तक ट्रांसफॉर्मर अधिकांश अत्याधुनिक AI प्रणालियों की रीढ़ बना हुआ है।