अंग्रेज़ी से अनुवादित

एक ध्यान तंत्र (attention mechanism) एक तंत्रिका नेटवर्क घटक है जो किसी दिए गए संदर्भ के सापेक्ष उनकी प्रासंगिकता के आधार पर इनपुट तत्वों के भारित संयोजन की गणना करता है, जो ट्रांसफॉर्मर मॉडल के अंदर मुख्य गणना का निर्माण करता है।

एक अटेंशन तंत्र एक तंत्रिका नेटवर्क घटक है जो अपने इनपुट के तत्वों का भारित संयोजन उनकी प्रासंगिकता के आधार पर एक दिए गए संदर्भ के लिए गणना करता है, जिससे एक मॉडल गतिशील रूप से उस इनपुट के सबसे प्रासंगिक हिस्सों पर ध्यान केंद्रित कर सकता है, बजाय हर तत्व को समान रूप से मानने के। अटेंशन ट्रांसफॉर्मर वास्तुकला के पीछे केंद्रीय कम्प्यूटेशनल विचार है और, विस्तार से, अधिकांश आधुनिक बड़े भाषा मॉडल का।

इतिहास

अटेंशन को लगभग 2014 और 2015 में अनुक्रम-से-अनुक्रम मशीन अनुवाद मॉडल के संदर्भ में पेश किया गया था, जो आवर्ती तंत्रिका नेटवर्क-आधारित डिकोडर को प्रत्येक आउटपुट शब्द उत्पन्न करते समय एनकोडर के सभी छिपे हुए राज्यों को देखने की अनुमति देता था, बजाय पूरे इनपुट वाक्य के एकल निश्चित-लंबाई सारांश वेक्टर पर निर्भर रहने के। इसने पहले के एनकोडर-डिकोडर मॉडल की एक विशिष्ट कमजोरी को संबोधित किया, जो लंबे इनपुट अनुक्रमों से जानकारी खो देते थे। 2017 का पेपर अटेंशन इज़ ऑल यू नीड, जिसका नेतृत्व आशीष वासवानी और सहयोगियों ने किया, ने दिखाया कि पूरी तरह से अटेंशन परतों से बना एक मॉडल, बिना किसी आवर्तन के, आवर्ती वास्तुकला से बेहतर प्रदर्शन कर सकता है, जबकि प्रशिक्षण में कहीं अधिक समानांतरीकरण योग्य था, जिससे ट्रांसफॉर्मर का उदय हुआ।

स्व-अटेंशन

ट्रांसफॉर्मर में उपयोग की जाने वाली प्रमुख नवीनता स्व-अटेंशन है, जिसमें अनुक्रम का प्रत्येक तत्व उसी अनुक्रम के हर दूसरे तत्व पर ध्यान देता है, बजाय एक डिकोडर के एक अलग एनकोडर पर ध्यान देने के। प्रत्येक स्थिति के लिए, मॉडल तीन वैक्टर की गणना करता है, जिन्हें आमतौर पर क्वेरी, की और वैल्यू कहा जाता है, जो उस स्थिति के एम्बेडिंग से प्राप्त होते हैं। एक स्थिति की क्वेरी और हर दूसरी स्थिति की की के बीच समानता यह निर्धारित करती है कि उस दूसरी स्थिति की वैल्यू वर्तमान स्थिति में आउटपुट में कितना भार योगदान करती है। यह एक मॉडल को एक वाक्य को संसाधित करते समय दूर के शब्दों, जैसे एक सर्वनाम और उस संज्ञा को सीधे संबंधित करने की अनुमति देता है, जिसके लिए जानकारी को कई मध्यवर्ती चरणों से गुजरना नहीं पड़ता, जैसा कि एक आवर्ती नेटवर्क में होता।

विविधताएं

ट्रांसफॉर्मर आमतौर पर मल्टी-हेड अटेंशन का उपयोग करते हैं, जिसमें विभिन्न सीखे गए प्रोजेक्शन के साथ कई अटेंशन गणनाएं समानांतर में चलती हैं, जिससे मॉडल विभिन्न प्रकार के संबंधों, जैसे वाक्यात्मक संरचना और विषयगत समानता, को एक साथ पकड़ सकता है। क्रॉस-अटेंशन, जिसमें एक अनुक्रम एक अलग अनुक्रम पर ध्यान देता है, एनकोडर-डिकोडर ट्रांसफॉर्मर और कुछ मल्टीमॉडल सिस्टम में उपयोग किया जाता है, उदाहरण के लिए एक डिकोडर को एक छवि के एनकोडेड क्षेत्रों पर ध्यान देते हुए एक कैप्शन उत्पन्न करने की अनुमति देना।

व्यावहारिक महत्व

अटेंशन की कम्प्यूटेशनल लागत इनपुट अनुक्रम की लंबाई के साथ द्विघात रूप से बढ़ती है, क्योंकि प्रत्येक स्थिति की तुलना हर दूसरी स्थिति से की जानी चाहिए, जिसने बहुत लंबे इनपुट को संसाधित करना महंगा बना दिया है और दक्षता-केंद्रित अटेंशन विविधताओं और वैकल्पिक वास्तुकलाओं जैसे राज्य-स्थान मॉडल दोनों को प्रेरित किया है। इस लागत के बावजूद, अटेंशन की इनपुट के दूर के तत्वों को सीधे संबंधित करने की क्षमता, इसकी समानांतरीकरण क्षमता के साथ, इसे वह तंत्र बनाती है जिसने बड़े भाषा मॉडल के प्रशिक्षण के पैमाने को खोला, जिसमें संदर्भ-विंडो की वृद्धि शामिल है जो यह निर्धारित करती है कि एक मॉडल एक ही इंटरैक्शन में कितना पाठ देख सकता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:deep-learning·large-language-models
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास