अंग्रेज़ी से अनुवादित

2017年论文《Attention Is All You Need》由八位谷歌研究人员提出,引入了transformer架构,该架构依赖自注意力机制,并已成为大多数现代大语言模型的基础。

"Attention Is All You Need" 2017 में प्रकाशित एक शोध पत्र है, जो Machine learning पर आधारित है और इसे Google में कार्यरत आठ वैज्ञानिकों और इंजीनियरों ने लिखा था। इस पत्र ने एक नई Deep learning वास्तुकला पेश की, जिसे Transformer (architecture) के रूप में जाना जाता है, जो 2014 में Bahdanau एट अल. द्वारा प्रस्तावित ध्यान तंत्र पर आधारित है। ट्रांसफॉर्मर दृष्टिकोण विभिन्न प्रकार के Artificial intelligence सिस्टमों के लिए मुख्य वास्तुकला बन गया है, जिसमें Large language model शामिल हैं। उस समय, शोध मुख्य रूप से मशीन अनुवाद के लिए अनुक्रम-से-अनुक्रम तकनीकों को बेहतर बनाने पर केंद्रित था, लेकिन लेखकों ने प्रश्न उत्तर देने और जिसे अब मल्टीमॉडल Generative AI कहा जाता है, जैसे अन्य कार्यों के लिए इस तकनीक की क्षमता का पूर्वानुमान लगाया था।

ट्रांसफॉर्मर वास्तुकला के साथ प्रारंभिक प्रयोगों में अंग्रेजी-से-जर्मन अनुवाद, "द ट्रांसफॉर्मर" पर विकिपीडिया लेख उत्पन्न करना और पार्सिंग शामिल थे। इन परीक्षणों ने टीम को आश्वस्त किया कि ट्रांसफॉर्मर एक सामान्य-उद्देश्यीय भाषा मॉडल है, न कि केवल अनुवाद के लिए। 2026 तक, इस पत्र को 250,000 से अधिक बार उद्धृत किया गया है, जो इसे 21वीं सदी के शीर्ष दस सबसे अधिक उद्धृत पत्रों में रखता है। प्रकाशन के बाद, आठों लेखकों ने Google छोड़ दिया और अन्य कंपनियों में शामिल हो गए या स्टार्टअप स्थापित किए।

पृष्ठभूमि

लेखक हैं Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan Gomez, Lukasz Kaiser, और Illia Polosukhin। आठों समान योगदानकर्ता थे; सूचीबद्ध क्रम यादृच्छिक था। शीर्षक बीटल्स गीत "ऑल यू नीड इज़ लव" को संदर्भित करता है। "ट्रांसफॉर्मर" नाम इसलिए चुना गया क्योंकि Jakob Uszkoreit को शब्द की ध्वनि पसंद थी। एक प्रारंभिक डिज़ाइन दस्तावेज़ का शीर्षक "ट्रांसफॉर्मर्स: इटरेटिव सेल्फ-अटेंशन एंड प्रोसेसिंग फॉर वेरियस टास्क्स" था और इसमें ट्रांसफॉर्मर्स फ्रैंचाइज़ के छह पात्रों का चित्रण शामिल था। टीम का नाम टीम ट्रांसफॉर्मर रखा गया था।

प्रस्तुत विधियाँ

यह पत्र मुख्य रूप से ट्रांसफॉर्मर वास्तुकला पेश करने के लिए जाना जाता है, जो अधिकांश आधुनिक LLM की नींव है। इसकी प्राथमिकता का एक प्रमुख कारण अपने पूर्ववर्तियों की तुलना में वास्तुकला की समानांतरकरण क्षमता है, जो GPU पर प्रशिक्षण को सक्षम बनाती है और तेज़ प्रशिक्षण समय तथा बड़े मॉडल की अनुमति देती है। पत्र ने कई तंत्र पेश किए।

स्केल्ड डॉट-प्रोडक्ट अटेंशन और सेल्फ-अटेंशन

पत्र ने स्केल्ड डॉट-प्रोडक्ट अटेंशन को इस प्रकार वर्णित किया: Attention(Query, Key, Value) = softmax(Query × Key^T / sqrt(d_k)) × Value, जहाँ Query, Key, और Value मैट्रिक्स हैं और d_k कुंजियों का आयाम है (शुरुआत में 64 सेट किया गया)। पुनरावर्ती तंत्रिका नेटवर्क (RNN) या लंबी अल्पकालिक स्मृति (LSTM) के बजाय सेल्फ-अटेंशन का उपयोग करने से पुनरावृत्ति समाप्त हो जाती है, जिससे समानांतरकरण सुनिश्चित होता है। अनुवाद में, Query और Key मैट्रिक्स आमतौर पर स्रोत-भाषा एम्बेडिंग के अनुरूप होते हैं, जबकि Value लक्ष्य भाषा के अनुरूप होता है।

मल्टी-हेड अटेंशन

सेल्फ-अटेंशन में, प्रत्येक इनपुट अनुक्रम के लिए क्वेरी, कुंजी और मान गतिशील रूप से उत्पन्न होते हैं, जिससे मॉडल विभिन्न भागों पर ध्यान केंद्रित कर सकता है। मल्टी-हेड अटेंशन कई समानांतर ध्यान हेड पेश करता है, जिनमें से प्रत्येक Q, K, और V के विभिन्न रैखिक प्रक्षेपण सीखता है। यह मॉडल को शब्द संबंधों के विभिन्न पहलुओं को एक साथ पकड़ने की अनुमति देता है।

स्थितीय एन्कोडिंग

चूंकि ट्रांसफॉर्मर में पुनरावृत्ति नहीं होती है, पत्र ने अनुक्रम में टोकन की स्थिति के बारे में जानकारी इंजेक्ट करने के लिए Positional Encoding पेश किया। ये एन्कोडिंग इनपुट एम्बेडिंग में जोड़े जाते हैं, जिससे मॉडल क्रम जानकारी का उपयोग कर सकता है।

प्रभाव और विरासत

ट्रांसफॉर्मर वास्तुकला अधिकांश आधुनिक बड़े भाषा मॉडलों की नींव बन गई है, जिसमें OpenAI, Anthropic, और Google DeepMind द्वारा विकसित मॉडल शामिल हैं। इसकी समानांतरकरण क्षमता और स्केलेबिलिटी ने Generative AI और अन्य क्षेत्रों में प्रगति को बढ़ावा दिया है। पत्र का प्रभाव इसके उद्धरण संख्या में परिलक्षित होता है, जो इसे 21वीं सदी के सबसे अधिक उद्धृत पत्रों में से एक बनाता है।

परिणाम

पत्र के प्रकाशन के बाद, आठों लेखकों ने Google छोड़ दिया। कुछ ने स्टार्टअप स्थापित किए, जैसे Aidan Gomez (Cohere) और Noam Shazeer (Character.AI, बाद में Google लौटे)। अन्य NVIDIA या Intel जैसी कंपनियों में शामिल हो गए। उनके प्रस्थान ने उद्योग में ट्रांसफॉर्मर-आधारित शोध के प्रसार में योगदान दिया।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:machine-learning·deep-learning·transformer·research-paper
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास