अंग्रेज़ी से अनुवादित

ध्यान एक तंत्रिका-नेटवर्क तंत्र है जो मॉडलों को आउटपुट उत्पन्न करते समय विभिन्न इनपुट तत्वों की प्रासंगिकता को तौलने की अनुमति देता है। यह ट्रांसफॉर्मरों का मुख्य घटक है, जो आधुनिक बड़े भाषा मॉडलों और जनरेटिव AI प्रणालियों को रेखांकित करता है।

ध्यान एक तकनीक है जो मशीन लर्निंग और डीप लर्निंग में उपयोग होती है, जो एक तंत्रिका नेटवर्क को अपने इनपुट के सबसे प्रासंगिक हिस्सों पर गतिशील रूप से ध्यान केंद्रित करने की अनुमति देती है जब वह प्रत्येक आउटपुट उत्पन्न करता है। एक अनुक्रम को निश्चित क्रम में संसाधित करने के बजाय, ध्यान सभी इनपुट स्थितियों पर एक भारित योग की गणना करता है, जिसमें भार सीखे गए प्रासंगिकता स्कोर द्वारा निर्धारित होते हैं। यह तंत्र अनुक्रम-से-अनुक्रम मॉडल के संदर्भ में पेश किया गया था और ट्रांसफॉर्मर वास्तुकला का मूलभूत निर्माण खंड बन गया, जो अधिकांश समकालीन बड़े भाषा मॉडल और जनरेटिव एआई प्रणालियों को शक्ति प्रदान करता है।

एक विशिष्ट ध्यान संचालन में, प्रत्येक इनपुट तत्व को तीन वैक्टरों में परिवर्तित किया जाता है: एक क्वेरी, एक कुंजी, और एक मान। वर्तमान स्थिति की क्वेरी की तुलना सभी स्थितियों की कुंजियों से की जाती है ताकि ध्यान स्कोर उत्पन्न हो सकें, अक्सर डॉट उत्पाद के माध्यम से। इन स्कोरों को सामान्यीकृत किया जाता है (आमतौर पर सॉफ्टमैक्स फ़ंक्शन के साथ) ताकि भार बन सकें, जिनका उपयोग मान वैक्टरों के भारित योग की गणना करने के लिए किया जाता है। यह मॉडल को अनुक्रम में कहीं से भी जानकारी प्राप्त करने की अनुमति देता है, चाहे दूरी कुछ भी हो, जो पहले के आवर्ती वास्तुकलाओं की एक प्रमुख सीमा को संबोधित करता है जो लंबी दूरी की निर्भरताओं से जूझते थे।

उत्पत्ति और विकास

ध्यान की अवधारणा 2010 के दशक के मध्य में तंत्रिका मशीन अनुवाद पर शोध से उभरी। 2014 में द्ज़मित्री बहदानौ और सहयोगियों द्वारा एक महत्वपूर्ण पेपर ने एक ध्यान तंत्र पेश किया जिसने एक एनकोडर-डिकोडर मॉडल को अनुवाद के दौरान स्रोत शब्दों को लक्ष्य शब्दों के साथ संरेखित करने की अनुमति दी। इसने निश्चित-लंबाई संदर्भ वैक्टरों की तुलना में लंबे वाक्यों पर प्रदर्शन में सुधार किया। 2015 में, योशुआ बेंगियो और अन्य ने ध्यान के विविधताओं का और अन्वेषण किया, और 2016 में, गूगल ब्रेन के शोधकर्ताओं ने ट्रांसफॉर्मर वास्तुकला विकसित की, जो पूरी तरह से ध्यान पर निर्भर थी और पुनरावृत्ति को पूरी तरह से समाप्त कर दिया। ट्रांसफॉर्मर को 2017 के पेपर "Attention Is All You Need" में आशीष कुमार, जैकब उज़कोरिट, लुकाज़ कैसर, निकी परमार, और अन्य द्वारा पेश किया गया था, और यह जल्दी ही अनुक्रम मॉडलिंग के लिए मानक बन गया।

मल्टी-हेड ध्यान और विविधताएं

ट्रांसफॉर्मर मल्टी-हेड ध्यान का उपयोग करता है, जहां कई ध्यान तंत्र समानांतर में चलते हैं, प्रत्येक अलग-अलग संबंध सीखता है। आउटपुट को संयोजित किया जाता है और रैखिक रूप से प्रक्षेपित किया जाता है। यह मॉडल को विविध पैटर्न, जैसे वाक्यविन्यास और अर्थ संबंधी निर्भरताएं, एक साथ पकड़ने में सक्षम बनाता है। एक अन्य महत्वपूर्ण विविधता क्रॉस-ध्यान है, जो एनकोडर-डिकोडर मॉडल में उपयोग होती है जहां क्वेरी डिकोडर से आती हैं और कुंजी/मान एनकोडर से आते हैं, जिससे डिकोडर इनपुट अनुक्रम पर ध्यान केंद्रित कर सकता है। सेल्फ-अटेंशन, जहां क्वेरी, कुंजी, और मान सभी एक ही अनुक्रम से आते हैं, ट्रांसफॉर्मर के एनकोडर और डिकोडर दोनों में उपयोग होता है। स्थितीय एन्कोडिंग को इनपुट एम्बेडिंग में जोड़ा जाता है ताकि टोकन क्रम के बारे में जानकारी डाली जा सके, क्योंकि ध्यान स्वयं क्रम-परिवर्तन-अपरिवर्तनीय है।

बड़े भाषा मॉडल में भूमिका

ध्यान लगभग सभी आधुनिक बड़े भाषा मॉडल में मुख्य तंत्र है, जिसमें ओपनएआई, एंथ्रोपिक, और गूगल डीपमाइंड द्वारा विकसित मॉडल शामिल हैं। ये मॉडल, जैसे GPT और क्लॉड, पाठ को संसाधित और उत्पन्न करने के लिए सेल्फ-अटेंशन के साथ स्टैक्ड ट्रांसफॉर्मर परतों का उपयोग करते हैं। संदर्भ विंडो में सभी टोकन पर ध्यान केंद्रित करने की क्षमता सुसंगत लंबी-रूप पीढ़ी, इन-संदर्भ सीखने, और जटिल तर्क को सक्षम बनाती है। हालांकि, अनुक्रम लंबाई के संबंध में ध्यान की द्विघात कम्प्यूटेशनल लागत ने कुशल विविधताओं, जैसे स्पार्स ध्यान और रैखिक ध्यान, पर शोध को प्रेरित किया है ताकि लंबे संदर्भों को संभाला जा सके। 2020 के दशक की शुरुआत तक, अधिकांश उत्पादन मॉडल पूर्ण ध्यान का उपयोग करते हैं जिसमें संदर्भ विंडो कुछ हज़ार से लेकर सैकड़ों हज़ार टोकन तक होती हैं।

भाषा से परे अनुप्रयोग

ध्यान प्राकृतिक भाषा प्रसंस्करण से परे लागू किया गया है। कंप्यूटर दृष्टि में, विज़न ट्रांसफॉर्मर (ViT) छवि पैच को टोकन के रूप में मानते हैं और छवि वर्गीकरण और वस्तु पहचान के लिए सेल्फ-अटेंशन का उपयोग करते हैं। भाषण पहचान में, ध्यान तंत्र ऑडियो फ्रेम को पाठ आउटपुट के साथ संरेखित करते हैं। सुदृढीकरण सीखने में, ध्यान एजेंटों को अवलोकनों के प्रासंगिक हिस्सों पर ध्यान केंद्रित करने में मदद करता है। यह तंत्र अनुशंसा प्रणालियों और दवा खोज में भी उपयोग होता है। इसकी बहुमुखी प्रतिभा ने इसे कृत्रिम बुद्धिमत्ता अनुसंधान में एक सार्वभौमिक उपकरण बना दिया है, और यह विभिन्न डोमेन में कई अत्याधुनिक प्रणालियों का एक प्रमुख घटक है।

कम्प्यूटेशनल विचार और हार्डवेयर

ध्यान संचालन में बड़े मैट्रिक्स गुणन शामिल होते हैं, जो GPU और विशेष त्वरक पर समानांतर प्रसंस्करण के लिए अच्छी तरह से उपयुक्त हैं। एनवीडिया और एएमडी जैसी कंपनियां हार्डवेयर डिज़ाइन करती हैं जो इन संचालनों को अनुकूलित करती हैं। अमेज़न वेब सर्विसेज, गूगल क्लाउड, और एज़्योर जैसे क्लाउड प्रदाता उच्च-बैंडविड्थ मेमोरी वाले इंस्टेंस प्रदान करते हैं ताकि ध्यान गणनाओं को संभाला जा सके। ध्यान की मेमोरी फुटप्रिंट अनुक्रम लंबाई के साथ द्विघात रूप से बढ़ती है, जिसके कारण ग्रेडिएंट चेकपॉइंटिंग और फ्लैश अटेंशन जैसी तकनीकें मेमोरी उपयोग को कम करने के लिए विकसित हुई हैं। जैसे-जैसे मॉडल स्केल करते हैं, कुशल ध्यान कार्यान्वयन अनुसंधान और इंजीनियरिंग का एक सक्रिय क्षेत्र बना हुआ है।

भविष्य की दिशाएं

अनुसंधान ध्यान तंत्रों को बेहतर बनाने के लिए जारी है। प्रयासों में कम्प्यूटेशनल जटिलता को कम करना, बाहरी मेमोरी को शामिल करना, और ध्यान को अधिक व्याख्यात्मक बनाना शामिल है। कुछ कार्य पूर्ण ध्यान के विकल्पों की खोज करते हैं, जैसे राज्य-स्थान मॉडल, लेकिन ध्यान प्रमुख प्रतिमान बना हुआ है। 2025 तक, ध्यान के साथ ट्रांसफॉर्मर-आधारित मॉडल अधिकांश वाणिज्यिक एआई उत्पादों की नींव हैं, और यह तंत्र निकट भविष्य में एआई विकास का केंद्रीय हिस्सा बने रहने की उम्मीद है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:machine-learning·deep-learning·neural-networks·natural-language-processing
इस पृष्ठ को अंतिम बार संपादित किया गया 14 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास