ध्यान ही आपको सब कुछ चाहिए (2017)

अंग्रेज़ी से अनुवादित

"Attention Is All You Need" 2017年由八位谷歌研究人员发表的机器学习论文,引入了基于注意力机制的深度学习模型--Transformer架构。该论文已成为现代AI系统(包括大型语言模型)的基础,截至2026年被引用超过25万次。

"Attention Is All You Need" 2017 में प्रकाशित एक मशीन लर्निंग शोध पत्र है, जिसे Google में कार्यरत आठ वैज्ञानिकों और इंजीनियरों ने लिखा था। इस पत्र ने ट्रांसफॉर्मर नामक एक नई डीप लर्निंग आर्किटेक्चर पेश की, जो 2014 में बहदानाऊ एट अल. द्वारा प्रस्तावित अटेंशन तंत्र पर आधारित थी। इस पत्र में वर्णित ट्रांसफॉर्मर दृष्टिकोण बड़े भाषा मॉडल सहित विभिन्न प्रकार की कृत्रिम बुद्धिमत्ता प्रणालियों का मुख्य आर्किटेक्चर बन गया है। उस समय, शोध का ध्यान मशीन अनुवाद के लिए Seq2seq तकनीकों को बेहतर बनाने पर था, लेकिन लेखकों ने पत्र में आगे जाकर प्रश्न-उत्तर और अब जिसे मल्टीमॉडल जनरेटिव AI कहा जाता है, जैसे अन्य कार्यों के लिए इस तकनीक की क्षमता का पूर्वानुमान लगाया।

कुछ शुरुआती उदाहरण जिन पर टीम ने अपनी ट्रांसफॉर्मर आर्किटेक्चर का परीक्षण किया, उनमें अंग्रेज़ी-से-जर्मन अनुवाद, "द ट्रांसफॉर्मर" पर विकिपीडिया लेख उत्पन्न करना और पार्सिंग शामिल थे। इन्होंने टीम को आश्वस्त किया कि ट्रांसफॉर्मर एक सामान्य-उद्देश्यीय भाषा मॉडल है, न कि केवल अनुवाद के लिए अच्छा। 2026 तक, इस पत्र को 250,000 से अधिक बार उद्धृत किया गया है, जो इसे 21वीं सदी के शीर्ष दस सबसे अधिक उद्धृत पत्रों में रखता है। Google द्वारा पत्र प्रकाशित होने के बाद, आठों लेखकों ने कंपनी छोड़कर अन्य कंपनियों में शामिल होने या स्टार्टअप स्थापित करने का निर्णय लिया।

पृष्ठभूमि

पत्र के लेखक हैं आशीष वासवानी, नोम शज़ीर, निकी परमार, जैकब उज़कोरिट, लियोन जोन्स, एडन गोमेज़, लुकाज़ कैसर और इलिया पोलोसुखिन। सभी आठ लेखक पत्र के "समान योगदानकर्ता" थे; सूचीबद्ध क्रम यादृच्छिक था (पत्र के अनुसार)। पत्र के बाद, प्रत्येक लेखक ने Google छोड़कर अन्य कंपनियों में शामिल होने या स्टार्टअप स्थापित करने का निर्णय लिया।

पत्र का शीर्षक बीटल्स के गीत "ऑल यू नीड इज़ लव" का संदर्भ है। "ट्रांसफॉर्मर" नाम इसलिए चुना गया क्योंकि पत्र के लेखकों में से एक, जैकब उज़कोरिट को उस शब्द की ध्वनि पसंद थी। एक प्रारंभिक डिज़ाइन दस्तावेज़ का शीर्षक "ट्रांसफॉर्मर्स: इटरेटिव सेल्फ-अटेंशन एंड प्रोसेसिंग फॉर वेरियस टास्क्स" था, और इसमें ट्रांसफॉर्मर्स फ्रैंचाइज़ के छह पात्रों का चित्रण शामिल था। टीम का नाम टीम ट्रांसफॉर्मर रखा गया था।

चर्चित और प्रस्तुत विधियाँ

यह पत्र ट्रांसफॉर्मर आर्किटेक्चर पेश करने के लिए सबसे अधिक जाना जाता है, जो अधिकांश आधुनिक बड़े भाषा मॉडल (LLM) का आधार है। अधिकांश आधुनिक LLM द्वारा इस आर्किटेक्चर को प्राथमिकता देने का एक प्रमुख कारण इसके पूर्ववर्तियों की तुलना में इसकी समानांतरीकरण क्षमता है। यह सुनिश्चित करता है कि प्रशिक्षण के लिए आवश्यक संचालन GPU पर त्वरित किए जा सकें, जिससे तेज़ प्रशिक्षण समय और बड़े आकार के मॉडल दोनों को प्रशिक्षित किया जा सके।

पत्र ने ट्रांसफॉर्मर आर्किटेक्चर के विकास के भाग के रूप में निम्नलिखित तंत्र पेश किए।

स्केल्ड डॉट-प्रोडक्ट अटेंशन और सेल्फ-अटेंशन

आवर्तक तंत्रिका नेटवर्क (RNN) या लॉन्ग शॉर्ट-टर्म मेमोरी (जो पुनरावृत्ति पर निर्भर करते हैं) के बजाय स्केल्ड डॉट-प्रोडक्ट अटेंशन और सेल्फ-अटेंशन तंत्र का उपयोग निम्नलिखित अनुच्छेद में वर्णित बेहतर प्रदर्शन की अनुमति देता है। पत्र ने स्केल्ड डॉट-प्रोडक्ट अटेंशन को इस प्रकार वर्णित किया:

Attention(Query, Key, Value) := softmax(Query × Key^T / sqrt(d_k)) × Value

जहाँ Query, Key, Value क्रमशः क्वेरी, की और वैल्यू मैट्रिक्स हैं, और d_k वैल्यू का आयाम है। चूँकि मॉडल Query, Key और Value मैट्रिक्स पर निर्भर करता है जो एक ही स्रोत (यानी इनपुट अनुक्रम या संदर्भ विंडो) से आते हैं, यह RNN की आवश्यकता को समाप्त करता है, जिससे आर्किटेक्चर के लिए पूर्ण समानांतरीकरण सुनिश्चित होता है। यह 2014 में पेश किए गए अटेंशन तंत्र के मूल रूप से भिन्न है। इसके अतिरिक्त, पत्र एक अतिरिक्त स्केलिंग कारक के उपयोग पर चर्चा करता है जो की वेक्टर के आयाम (d_k के रूप में दर्शाया गया और पत्र में प्रारंभ में 64 पर सेट) के संबंध में सबसे प्रभावी पाया गया, जैसा कि ऊपर दिखाया गया है। अनुवाद के विशिष्ट संदर्भ में, जिस पर पत्र केंद्रित था, Query और Key मैट्रिक्स आमतौर पर स्रोत भाषा के अनुरूप एम्बेडिंग में दर्शाए जाते हैं, जबकि Value मैट्रिक्स लक्ष्य भाषा के अनुरूप होता है।

मल्टी-हेड अटेंशन

सेल्फ-अटेंशन तंत्र में, क्वेरी (Q), की (K) और वैल्यू (V) प्रत्येक इनपुट अनुक्रम के लिए गतिशील रूप से उत्पन्न होते हैं (आमतौर पर संदर्भ विंडो के आकार द्वारा सीमित), जिससे मॉडल विभिन्न चरणों में इनपुट अनुक्रम के विभिन्न भागों पर ध्यान केंद्रित कर सकता है। मल्टी-हेड अटेंशन कई समानांतर अटेंशन हेड पेश करके इस प्रक्रिया को बढ़ाता है। प्रत्येक अटेंशन हेड Q, K और V मैट्रिक्स के विभिन्न रैखिक प्रक्षेपण सीखता है। यह मॉडल को अनुक्रम में शब्दों के बीच संबंधों के विभिन्न पहलुओं को एक साथ पकड़ने की अनुमति देता है, बजाय एक ही पहलू पर ध्यान केंद्रित करने के। ऐसा करके, मॉडल विभिन्न स्थितियों पर विभिन्न प्रतिनिधित्व उप-स्थानों से जानकारी पर ध्यान दे सकता है, जो जटिल भाषा पैटर्न को संभालने की इसकी क्षमता में सुधार करता है।

पोज़िशनल एन्कोडिंग

पत्र ने Positional Encoding पेश किया ताकि अनुक्रम में टोकन की स्थिति के बारे में जानकारी इंजेक्ट की जा सके, क्योंकि आर्किटेक्चर स्वाभाविक रूप से टोकन को क्रम में संसाधित नहीं करता है। लेखकों ने विभिन्न आवृत्तियों के साइन और कोसाइन फ़ंक्शन का उपयोग करके स्थितियों को एन्कोड करने का प्रस्ताव रखा, जिससे मॉडल सापेक्ष स्थितियों को सीख सके। यह तंत्र ट्रांसफॉर्मर-आधारित मॉडल में मानक बन गया है, हालाँकि बाद के संस्करणों ने सीखी गई एम्बेडिंग या अन्य दृष्टिकोणों का पता लगाया है।

अन्य नवाचार

पत्र ने प्रशिक्षण को स्थिर करने के लिए Layer Normalization और residual connections के उपयोग के साथ-साथ नियमितीकरण के लिए Dropout पर भी चर्चा की। ये घटक, अटेंशन तंत्र के साथ मिलकर, ट्रांसफॉर्मर ब्लॉक का आधार बने। लेखकों ने अपने मॉडल को मशीन अनुवाद कार्यों पर प्रशिक्षित किया, जिसमें आवर्तक मॉडल की तुलना में तेज़ प्रशिक्षण समय के साथ अत्याधुनिक परिणाम प्राप्त हुए।

प्रभाव और विरासत

इसके प्रकाशन के बाद, ट्रांसफॉर्मर आर्किचेक्चर तेजी से प्राकृतिक भाषा प्रसंस्करण में प्रमुख दृष्टिकोण बन गया। यह OpenAI, Google DeepMind और Anthropic जैसे संगठनों द्वारा विकसित प्रमुख प्रणालियों का आधार है, जिसमें GPT और BERT जैसे बड़े भाषा मॉडल शामिल हैं। आर्किटेक्चर को पाठ से परे भी लागू किया गया है, जिसने कंप्यूटर विज़न और ऑडियो प्रोसेसिंग जैसे क्षेत्रों को प्रभावित किया है। पत्र का प्रभाव इसकी उद्धरण संख्या में परिलक्षित होता है, जो 2026 तक 250,000 से अधिक है, जो इसे कंप्यूटर विज्ञान में सबसे अधिक उद्धृत कार्यों में से एक बनाता है।

प्रकाशन के तुरंत बाद सभी आठ लेखकों का Google से प्रस्थान कई AI स्टार्टअप की स्थापना का कारण बना, जिसमें Cohere और Inceptive शामिल हैं, और ट्रांसफॉर्मर-आधारित तकनीकों के व्यापक व्यावसायीकरण में योगदान दिया। पत्र का शीर्षक, जो बीटल्स गीत का संदर्भ देता है, और टीम की चंचल नामकरण परंपराएँ AI की लोककथा का हिस्सा बन गई हैं।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:machine-learning·transformer·research-paper·artificial-intelligence
इस पृष्ठ को अंतिम बार संपादित किया गया 9 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास