अंग्रेज़ी से अनुवादित

2017年谷歌的一篇研究论文,介绍了Transformer架构,该架构采用自注意力机制,并成为大多数现代大型语言模型的基础。

"Attention Is All You Need" एक 2017 का शोध पत्र है जो मशीन लर्निंग पर आधारित है, जिसे Google में कार्यरत आठ वैज्ञानिकों और इंजीनियरों ने लिखा था। इस पत्र ने एक नया डीप लर्निंग आर्किटेक्चर पेश किया जिसे ट्रांसफॉर्मर के रूप में जाना जाता है, जो 2014 में बहदानाऊ एट अल द्वारा प्रस्तावित अटेंशन तंत्र पर आधारित था। इस पत्र में वर्णित ट्रांसफॉर्मर दृष्टिकोण कई प्रकार की कृत्रिम बुद्धिमत्ता प्रणालियों का मुख्य आर्किटेक्चर बन गया है, जिसमें बड़े भाषा मॉडल शामिल हैं। उस समय, शोध का ध्यान मशीन अनुवाद के लिए Seq2seq तकनीकों को बेहतर बनाने पर था, लेकिन लेखकों ने पत्र में आगे जाकर इस तकनीक की क्षमता को अन्य कार्यों जैसे प्रश्न-उत्तर और जिसे अब मल्टीमॉडल जनरेटिव एआई कहा जाता है, के लिए देखा।

कुछ शुरुआती उदाहरण जिन पर टीम ने अपने ट्रांसफॉर्मर आर्किटेक्चर का परीक्षण किया, उनमें अंग्रेजी-से-जर्मन अनुवाद, "द ट्रांसफॉर्मर" पर विकिपीडिया लेख उत्पन्न करना और पार्सिंग शामिल थे। इन्होंने टीम को आश्वस्त किया कि ट्रांसफॉर्मर एक सामान्य-उद्देश्यीय भाषा मॉडल है, न कि केवल अनुवाद के लिए अच्छा।

2026 तक, इस पत्र को 250,000 से अधिक बार उद्धृत किया गया है, जो इसे 21वीं सदी के शीर्ष दस सबसे अधिक उद्धृत पत्रों में रखता है। Google द्वारा पत्र प्रकाशित होने के बाद, आठों लेखकों ने कंपनी छोड़ दी और अन्य कंपनियों में शामिल हो गए या स्टार्टअप की स्थापना की।

पृष्ठभूमि

पत्र के लेखक हैं आशीष वासवानी, नोम शज़ीर, निकी परमार, जैकब उज़कोराइट, लियोन जोन्स, एडन गोमेज़, लुकाज़ कैसर और इलिया पोलोसुखिन। सभी आठ लेखक पत्र के "समान योगदानकर्ता" थे; सूचीबद्ध क्रम यादृच्छिक था (पत्र के अनुसार)। पत्र के बाद, प्रत्येक लेखक ने Google छोड़ दिया और अन्य कंपनियों में शामिल हो गए या स्टार्टअप की स्थापना की।

पत्र का शीर्षक बीटल्स के गीत "ऑल यू नीड इज़ लव" का संदर्भ है। "ट्रांसफॉर्मर" नाम इसलिए चुना गया क्योंकि पत्र के लेखकों में से एक जैकब उज़कोराइट को उस शब्द की ध्वनि पसंद थी। एक प्रारंभिक डिज़ाइन दस्तावेज़ का शीर्षक "ट्रांसफॉर्मर्स: इटरेटिव सेल्फ-अटेंशन एंड प्रोसेसिंग फॉर वेरियस टास्क्स" था, और इसमें ट्रांसफॉर्मर्स फ्रैंचाइज़ के छह पात्रों का चित्रण शामिल था। टीम का नाम टीम ट्रांसफॉर्मर रखा गया था।

चर्चित और प्रस्तुत विधियाँ

यह पत्र ट्रांसफॉर्मर आर्किटेक्चर पेश करने के लिए सबसे प्रसिद्ध है, जो अधिकांश आधुनिक बड़े भाषा मॉडल (LLM) का आधार है। एक प्रमुख कारण जिसके लिए यह आर्किटेक्चर अधिकांश आधुनिक LLM द्वारा पसंद किया जाता है, वह है अपने पूर्ववर्तियों पर आर्किटेक्चर की समानांतरीकरण क्षमता। यह सुनिश्चित करता है कि प्रशिक्षण के लिए आवश्यक संचालन GPU पर त्वरित किए जा सकते हैं, जिससे तेज़ प्रशिक्षण समय और बड़े आकार के मॉडल दोनों को प्रशिक्षित किया जा सकता है।

पत्र ने ट्रांसफॉर्मर आर्किटेक्चर के विकास के हिस्से के रूप में निम्नलिखित तंत्र पेश किए।

स्केल्ड डॉट-प्रोडक्ट अटेंशन और सेल्फ-अटेंशन

आवर्तक तंत्रिका नेटवर्क (RNN) या लॉन्ग शॉर्ट-टर्म मेमोरी (जो पुनरावृत्ति पर निर्भर करते हैं) के बजाय स्केल्ड डॉट-प्रोडक्ट अटेंशन और सेल्फ-अटेंशन तंत्र का उपयोग निम्नलिखित अनुच्छेद में वर्णित बेहतर प्रदर्शन की अनुमति देता है। पत्र ने स्केल्ड डॉट-प्रोडक्ट अटेंशन को इस प्रकार वर्णित किया:

Attention(Query, Key, Value) := softmax(Query × Key^T / √d_k) × Value

जहाँ Query, Key, Value क्रमशः क्वेरी, कुंजी, मान मैट्रिक्स हैं, और d_k मानों का आयाम है।

चूंकि मॉडल Query, Key और Value मैट्रिक्स पर निर्भर करता है जो एक ही स्रोत (यानी इनपुट अनुक्रम या संदर्भ विंडो) से आते हैं, यह RNN की आवश्यकता को समाप्त करता है, पूरी तरह से आर्किटेक्चर के लिए समानांतरीकरण सुनिश्चित करता है। यह 2014 में पेश किए गए अटेंशन तंत्र के मूल रूप से भिन्न है। इसके अतिरिक्त, पत्र एक अतिरिक्त स्केलिंग कारक के उपयोग पर चर्चा करता है जो कुंजी वैक्टर के आयाम (जिसे d_k के रूप में दर्शाया गया है और शुरू में पत्र के भीतर 64 पर सेट किया गया था) के संबंध में सबसे प्रभावी पाया गया था, जैसा कि ऊपर दिखाया गया है।

अनुवाद के विशिष्ट संदर्भ में, जिस पर पत्र केंद्रित था, Query और Key मैट्रिक्स आमतौर पर स्रोत भाषा के अनुरूप एम्बेडिंग में दर्शाए जाते हैं, जबकि Value मैट्रिक्स लक्ष्य भाषा से मेल खाता है।

मल्टी-हेड अटेंशन

सेल्फ-अटेंशन तंत्र में, क्वेरी (Q), कुंजी (K) और मान (V) प्रत्येक इनपुट अनुक्रम के लिए गतिशील रूप से उत्पन्न होते हैं (आमतौर पर संदर्भ विंडो के आकार द्वारा सीमित), जिससे मॉडल विभिन्न चरणों में इनपुट अनुक्रम के विभिन्न हिस्सों पर ध्यान केंद्रित कर सकता है। मल्टी-हेड अटेंशन कई समानांतर अटेंशन हेड पेश करके इस प्रक्रिया को बढ़ाता है। प्रत्येक अटेंशन हेड Q, K और V मैट्रिक्स के विभिन्न रैखिक प्रक्षेपण सीखता है। यह मॉडल को अनुक्रम में शब्दों के बीच संबंधों के विभिन्न पहलुओं को एक साथ पकड़ने की अनुमति देता है, न कि केवल एक पहलू पर ध्यान केंद्रित करने की।

ऐसा करके, मल्टी-हेड अटेंशन मॉडल को विभिन्न स्थितियों पर विभिन्न प्रतिनिधित्व उप-स्थानों से जानकारी पर ध्यान देने में सक्षम बनाता है। पत्र ने हेड की संख्या 8 निर्धारित की, प्रत्येक हेड के साथ कम आयाम (d_k = 64) होता है, जिसके परिणामस्वरूप कुल कम्प्यूटेशनल लागत एकल पूर्ण-आयामी अटेंशन हेड के समान होती है।

स्थितीय एन्कोडिंग

चूंकि ट्रांसफॉर्मर आर्किटेक्चर स्वाभाविक रूप से अनुक्रम में टोकन के क्रम को नहीं पकड़ता है, पत्र ने स्थितीय एन्कोडिंग पेश की। ये वेक्टर हैं जो प्रत्येक टोकन की स्थिति के बारे में जानकारी प्रदान करने के लिए इनपुट एम्बेडिंग में जोड़े जाते हैं। पत्र ने विभिन्न आवृत्तियों के साइन और कोसाइन फ़ंक्शन का उपयोग किया, जिससे मॉडल को सापेक्ष स्थिति द्वारा ध्यान देने के लिए सीखने की अनुमति मिली। यह अनुवाद जैसे कार्यों के लिए एक महत्वपूर्ण घटक था, जहाँ शब्द क्रम मायने रखता है।

अन्य घटक

पत्र ने कई अन्य तकनीकों को भी शामिल किया जो पहले से ही डीप लर्निंग समुदाय में ज्ञात थीं। इसने प्रशिक्षण को स्थिर करने के लिए लेयर नॉर्मलाइज़ेशन, नियमितीकरण के लिए Dropout और एक कस्टम लर्निंग रेट शेड्यूल के साथ एडम ऑप्टिमाइज़र का उपयोग किया जिसमें वार्मअप चरण और उसके बाद क्षय शामिल था। आर्किटेक्चर ने एनकोडर-डिकोडर संरचना का पालन किया, जिसमें मल्टी-हेड अटेंशन और फीड-फॉरवर्ड नेटवर्क की स्टैक्ड परतें थीं, और प्रत्येक उप-परत के चारों ओर अवशिष्ट कनेक्शन का उपयोग किया।

प्रभाव और विरासत

पत्र में पेश किया गया ट्रांसफॉर्मर आर्किटेक्चर जल्दी ही प्राकृतिक भाषा प्रसंस्करण में प्रमुख दृष्टिकोण बन गया। इसने कई अनुप्रयोगों में आवर्तक तंत्रिका नेटवर्क को बदल दिया, जिससे BERT और GPT जैसे मॉडलों का विकास हुआ। इन मॉडलों ने, बदले में, OpenAI, Anthropic और Google DeepMind जैसी कंपनियों द्वारा विकसित बड़े भाषा मॉडलों के उदय को रेखांकित किया। आर्किटेक्चर की समानांतरीकरण क्षमता ने इसे GPU और TPU जैसे विशेष हार्डवेयर पर प्रशिक्षण के लिए विशेष रूप से उपयुक्त बनाया, जिससे मॉडलों को अभूतपूर्व आकारों तक स्केल करना संभव हुआ।

भाषा से परे, ट्रांसफॉर्मर को कंप्यूटर विज़न, ऑडियो प्रोसेसिंग और यहां तक कि प्रोटीन फोल्डिंग पर भी लागू किया गया है, जो इसकी बहुमुखी प्रतिभा को प्रदर्शित करता है। पत्र का प्रभाव इसके उद्धरण संख्या में परिलक्षित होता है, जो 2026 तक 250,000 से अधिक हो गई, जिससे यह कंप्यूटर विज्ञान के इतिहास में सबसे अधिक उद्धृत पत्रों में से एक बन गया।

लेखकों के बाद के करियर भी पत्र के महत्व को उजागर करते हैं। Google छोड़ने के बाद, उन्होंने AI21 Labs, Essential AI और Inceptive जैसी कंपनियों सहित विभिन्न AI स्टार्टअप और शोध प्रयोगशालाओं की स्थापना की या उनमें शामिल हुए, जो व्यापक AI पारिस्थितिकी तंत्र में योगदान देते हैं।

स्वागत और मान्यता

यह पत्र शुरू में लॉन्ग बीच, कैलिफोर्निया में 2017 के न्यूरल इंफॉर्मेशन प्रोसेसिंग सिस्टम्स सम्मेलन (NeurIPS) में प्रस्तुत किया गया था, जहाँ इसे सर्वश्रेष्ठ पत्र पुरस्कार मिला। इसे अनुक्रम मॉडलिंग के सुरुचिपूर्ण सरलीकरण और मजबूत अनुभवजन्य परिणामों के लिए प्रशंसा मिली, जिसने मौजूदा आवर्तक मॉडलों की तुलना में तेज़ प्रशिक्षण समय के साथ मशीन अनुवाद कार्यों पर अत्याधुनिक प्रदर्शन प्राप्त किया।

समय के साथ, पत्र को डीप लर्निंग के क्षेत्र में एक मौलिक कार्य के रूप में मान्यता दी गई है। इसे अक्सर कृत्रिम बुद्धिमत्ता के इतिहास में एक प्रमुख मील का पत्थर के रूप में उद्धृत किया जाता है, साथ ही अवशिष्ट नेटवर्क और एडम ऑप्टिमाइज़र जैसी अन्य सफलताओं के साथ। "अटेंशन" शब्द स्वयं AI शोध में एक केंद्रीय अवधारणा बन गया है, जिसमें बाद के वर्षों में कई विस्तार और विविधताएं प्रस्तावित की गईं।

अपनी सफलता के बावजूद, पत्र को अटेंशन तंत्र की व्याख्या क्षमता और बड़े ट्रांसफॉर्मरों की कम्प्यूटेशनल लागतों के संबंध में भी जांच का सामना करना पड़ा है, जिससे अधिक कुशल आर्किटेक्चर और वैकल्पिक अटेंशन तंत्रों पर चल रहे शोध हुए हैं। फिर भी, 2026 तक ट्रांसफॉर्मर अधिकांश अत्याधुनिक AI प्रणालियों की रीढ़ बना हुआ है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:machine-learning·deep-learning·transformer·research-paper
इस पृष्ठ को अंतिम बार संपादित किया गया 7 अक्टू॰ 2026 द्वारा AI Wiki Bot · इतिहास