"Attention Is All You Need" 2017 में प्रकाशित एक मशीन लर्निंग शोध पत्र है, जिसे Google में कार्यरत आठ वैज्ञानिकों और इंजीनियरों ने लिखा था। इस पत्र ने ट्रांसफॉर्मर नामक एक नई डीप लर्निंग आर्किटेक्चर पेश की, जो 2014 में बहदानाऊ एट अल. द्वारा प्रस्तावित अटेंशन तंत्र पर आधारित थी। इस पत्र में वर्णित ट्रांसफॉर्मर दृष्टिकोण बड़े भाषा मॉडल सहित विभिन्न प्रकार की कृत्रिम बुद्धिमत्ता प्रणालियों का मुख्य आर्किटेक्चर बन गया है। उस समय, शोध का ध्यान मशीन अनुवाद के लिए Seq2seq तकनीकों को बेहतर बनाने पर था, लेकिन लेखकों ने पत्र में आगे जाकर प्रश्न-उत्तर और अब जिसे मल्टीमॉडल जनरेटिव AI कहा जाता है, जैसे अन्य कार्यों के लिए इस तकनीक की क्षमता का पूर्वानुमान लगाया।
कुछ शुरुआती उदाहरण जिन पर टीम ने अपनी ट्रांसफॉर्मर आर्किटेक्चर का परीक्षण किया, उनमें अंग्रेज़ी-से-जर्मन अनुवाद, "द ट्रांसफॉर्मर" पर विकिपीडिया लेख उत्पन्न करना और पार्सिंग शामिल थे। इन्होंने टीम को आश्वस्त किया कि ट्रांसफॉर्मर एक सामान्य-उद्देश्यीय भाषा मॉडल है, न कि केवल अनुवाद के लिए अच्छा। 2026 तक, इस पत्र को 250,000 से अधिक बार उद्धृत किया गया है, जो इसे 21वीं सदी के शीर्ष दस सबसे अधिक उद्धृत पत्रों में रखता है। Google द्वारा पत्र प्रकाशित होने के बाद, आठों लेखकों ने कंपनी छोड़कर अन्य कंपनियों में शामिल होने या स्टार्टअप स्थापित करने का निर्णय लिया।
पृष्ठभूमि
पत्र के लेखक हैं आशीष वासवानी, नोम शज़ीर, निकी परमार, जैकब उज़कोरिट, लियोन जोन्स, एडन गोमेज़, लुकाज़ कैसर और इलिया पोलोसुखिन। सभी आठ लेखक पत्र के "समान योगदानकर्ता" थे; सूचीबद्ध क्रम यादृच्छिक था (पत्र के अनुसार)। पत्र के बाद, प्रत्येक लेखक ने Google छोड़कर अन्य कंपनियों में शामिल होने या स्टार्टअप स्थापित करने का निर्णय लिया।
पत्र का शीर्षक बीटल्स के गीत "ऑल यू नीड इज़ लव" का संदर्भ है। "ट्रांसफॉर्मर" नाम इसलिए चुना गया क्योंकि पत्र के लेखकों में से एक, जैकब उज़कोरिट को उस शब्द की ध्वनि पसंद थी। एक प्रारंभिक डिज़ाइन दस्तावेज़ का शीर्षक "ट्रांसफॉर्मर्स: इटरेटिव सेल्फ-अटेंशन एंड प्रोसेसिंग फॉर वेरियस टास्क्स" था, और इसमें ट्रांसफॉर्मर्स फ्रैंचाइज़ के छह पात्रों का चित्रण शामिल था। टीम का नाम टीम ट्रांसफॉर्मर रखा गया था।
चर्चित और प्रस्तुत विधियाँ
यह पत्र ट्रांसफॉर्मर आर्किटेक्चर पेश करने के लिए सबसे अधिक जाना जाता है, जो अधिकांश आधुनिक बड़े भाषा मॉडल (LLM) का आधार है। अधिकांश आधुनिक LLM द्वारा इस आर्किटेक्चर को प्राथमिकता देने का एक प्रमुख कारण इसके पूर्ववर्तियों की तुलना में इसकी समानांतरीकरण क्षमता है। यह सुनिश्चित करता है कि प्रशिक्षण के लिए आवश्यक संचालन GPU पर त्वरित किए जा सकें, जिससे तेज़ प्रशिक्षण समय और बड़े आकार के मॉडल दोनों को प्रशिक्षित किया जा सके।
पत्र ने ट्रांसफॉर्मर आर्किटेक्चर के विकास के भाग के रूप में निम्नलिखित तंत्र पेश किए।
स्केल्ड डॉट-प्रोडक्ट अटेंशन और सेल्फ-अटेंशन
आवर्तक तंत्रिका नेटवर्क (RNN) या लॉन्ग शॉर्ट-टर्म मेमोरी (जो पुनरावृत्ति पर निर्भर करते हैं) के बजाय स्केल्ड डॉट-प्रोडक्ट अटेंशन और सेल्फ-अटेंशन तंत्र का उपयोग निम्नलिखित अनुच्छेद में वर्णित बेहतर प्रदर्शन की अनुमति देता है। पत्र ने स्केल्ड डॉट-प्रोडक्ट अटेंशन को इस प्रकार वर्णित किया:
Attention(Query, Key, Value) := softmax(Query × Key^T / sqrt(d_k)) × Value
जहाँ Query, Key, Value क्रमशः क्वेरी, की और वैल्यू मैट्रिक्स हैं, और d_k वैल्यू का आयाम है। चूँकि मॉडल Query, Key और Value मैट्रिक्स पर निर्भर करता है जो एक ही स्रोत (यानी इनपुट अनुक्रम या संदर्भ विंडो) से आते हैं, यह RNN की आवश्यकता को समाप्त करता है, जिससे आर्किटेक्चर के लिए पूर्ण समानांतरीकरण सुनिश्चित होता है। यह 2014 में पेश किए गए अटेंशन तंत्र के मूल रूप से भिन्न है। इसके अतिरिक्त, पत्र एक अतिरिक्त स्केलिंग कारक के उपयोग पर चर्चा करता है जो की वेक्टर के आयाम (d_k के रूप में दर्शाया गया और पत्र में प्रारंभ में 64 पर सेट) के संबंध में सबसे प्रभावी पाया गया, जैसा कि ऊपर दिखाया गया है। अनुवाद के विशिष्ट संदर्भ में, जिस पर पत्र केंद्रित था, Query और Key मैट्रिक्स आमतौर पर स्रोत भाषा के अनुरूप एम्बेडिंग में दर्शाए जाते हैं, जबकि Value मैट्रिक्स लक्ष्य भाषा के अनुरूप होता है।
मल्टी-हेड अटेंशन
सेल्फ-अटेंशन तंत्र में, क्वेरी (Q), की (K) और वैल्यू (V) प्रत्येक इनपुट अनुक्रम के लिए गतिशील रूप से उत्पन्न होते हैं (आमतौर पर संदर्भ विंडो के आकार द्वारा सीमित), जिससे मॉडल विभिन्न चरणों में इनपुट अनुक्रम के विभिन्न भागों पर ध्यान केंद्रित कर सकता है। मल्टी-हेड अटेंशन कई समानांतर अटेंशन हेड पेश करके इस प्रक्रिया को बढ़ाता है। प्रत्येक अटेंशन हेड Q, K और V मैट्रिक्स के विभिन्न रैखिक प्रक्षेपण सीखता है। यह मॉडल को अनुक्रम में शब्दों के बीच संबंधों के विभिन्न पहलुओं को एक साथ पकड़ने की अनुमति देता है, बजाय एक ही पहलू पर ध्यान केंद्रित करने के। ऐसा करके, मॉडल विभिन्न स्थितियों पर विभिन्न प्रतिनिधित्व उप-स्थानों से जानकारी पर ध्यान दे सकता है, जो जटिल भाषा पैटर्न को संभालने की इसकी क्षमता में सुधार करता है।
पोज़िशनल एन्कोडिंग
पत्र ने Positional Encoding पेश किया ताकि अनुक्रम में टोकन की स्थिति के बारे में जानकारी इंजेक्ट की जा सके, क्योंकि आर्किटेक्चर स्वाभाविक रूप से टोकन को क्रम में संसाधित नहीं करता है। लेखकों ने विभिन्न आवृत्तियों के साइन और कोसाइन फ़ंक्शन का उपयोग करके स्थितियों को एन्कोड करने का प्रस्ताव रखा, जिससे मॉडल सापेक्ष स्थितियों को सीख सके। यह तंत्र ट्रांसफॉर्मर-आधारित मॉडल में मानक बन गया है, हालाँकि बाद के संस्करणों ने सीखी गई एम्बेडिंग या अन्य दृष्टिकोणों का पता लगाया है।
अन्य नवाचार
पत्र ने प्रशिक्षण को स्थिर करने के लिए Layer Normalization और residual connections के उपयोग के साथ-साथ नियमितीकरण के लिए Dropout पर भी चर्चा की। ये घटक, अटेंशन तंत्र के साथ मिलकर, ट्रांसफॉर्मर ब्लॉक का आधार बने। लेखकों ने अपने मॉडल को मशीन अनुवाद कार्यों पर प्रशिक्षित किया, जिसमें आवर्तक मॉडल की तुलना में तेज़ प्रशिक्षण समय के साथ अत्याधुनिक परिणाम प्राप्त हुए।
प्रभाव और विरासत
इसके प्रकाशन के बाद, ट्रांसफॉर्मर आर्किचेक्चर तेजी से प्राकृतिक भाषा प्रसंस्करण में प्रमुख दृष्टिकोण बन गया। यह OpenAI, Google DeepMind और Anthropic जैसे संगठनों द्वारा विकसित प्रमुख प्रणालियों का आधार है, जिसमें GPT और BERT जैसे बड़े भाषा मॉडल शामिल हैं। आर्किटेक्चर को पाठ से परे भी लागू किया गया है, जिसने कंप्यूटर विज़न और ऑडियो प्रोसेसिंग जैसे क्षेत्रों को प्रभावित किया है। पत्र का प्रभाव इसकी उद्धरण संख्या में परिलक्षित होता है, जो 2026 तक 250,000 से अधिक है, जो इसे कंप्यूटर विज्ञान में सबसे अधिक उद्धृत कार्यों में से एक बनाता है।
प्रकाशन के तुरंत बाद सभी आठ लेखकों का Google से प्रस्थान कई AI स्टार्टअप की स्थापना का कारण बना, जिसमें Cohere और Inceptive शामिल हैं, और ट्रांसफॉर्मर-आधारित तकनीकों के व्यापक व्यावसायीकरण में योगदान दिया। पत्र का शीर्षक, जो बीटल्स गीत का संदर्भ देता है, और टीम की चंचल नामकरण परंपराएँ AI की लोककथा का हिस्सा बन गई हैं।