ध्यान एक तकनीक है जो मशीन लर्निंग और डीप लर्निंग में उपयोग होती है, जो एक तंत्रिका नेटवर्क को अपने इनपुट के सबसे प्रासंगिक हिस्सों पर गतिशील रूप से ध्यान केंद्रित करने की अनुमति देती है जब वह प्रत्येक आउटपुट उत्पन्न करता है। एक अनुक्रम को निश्चित क्रम में संसाधित करने के बजाय, ध्यान सभी इनपुट स्थितियों पर एक भारित योग की गणना करता है, जिसमें भार सीखे गए प्रासंगिकता स्कोर द्वारा निर्धारित होते हैं। यह तंत्र अनुक्रम-से-अनुक्रम मॉडल के संदर्भ में पेश किया गया था और ट्रांसफॉर्मर वास्तुकला का मूलभूत निर्माण खंड बन गया, जो अधिकांश समकालीन बड़े भाषा मॉडल और जनरेटिव एआई प्रणालियों को शक्ति प्रदान करता है।
एक विशिष्ट ध्यान संचालन में, प्रत्येक इनपुट तत्व को तीन वैक्टरों में परिवर्तित किया जाता है: एक क्वेरी, एक कुंजी, और एक मान। वर्तमान स्थिति की क्वेरी की तुलना सभी स्थितियों की कुंजियों से की जाती है ताकि ध्यान स्कोर उत्पन्न हो सकें, अक्सर डॉट उत्पाद के माध्यम से। इन स्कोरों को सामान्यीकृत किया जाता है (आमतौर पर सॉफ्टमैक्स फ़ंक्शन के साथ) ताकि भार बन सकें, जिनका उपयोग मान वैक्टरों के भारित योग की गणना करने के लिए किया जाता है। यह मॉडल को अनुक्रम में कहीं से भी जानकारी प्राप्त करने की अनुमति देता है, चाहे दूरी कुछ भी हो, जो पहले के आवर्ती वास्तुकलाओं की एक प्रमुख सीमा को संबोधित करता है जो लंबी दूरी की निर्भरताओं से जूझते थे।
उत्पत्ति और विकास
ध्यान की अवधारणा 2010 के दशक के मध्य में तंत्रिका मशीन अनुवाद पर शोध से उभरी। 2014 में द्ज़मित्री बहदानौ और सहयोगियों द्वारा एक महत्वपूर्ण पेपर ने एक ध्यान तंत्र पेश किया जिसने एक एनकोडर-डिकोडर मॉडल को अनुवाद के दौरान स्रोत शब्दों को लक्ष्य शब्दों के साथ संरेखित करने की अनुमति दी। इसने निश्चित-लंबाई संदर्भ वैक्टरों की तुलना में लंबे वाक्यों पर प्रदर्शन में सुधार किया। 2015 में, योशुआ बेंगियो और अन्य ने ध्यान के विविधताओं का और अन्वेषण किया, और 2016 में, गूगल ब्रेन के शोधकर्ताओं ने ट्रांसफॉर्मर वास्तुकला विकसित की, जो पूरी तरह से ध्यान पर निर्भर थी और पुनरावृत्ति को पूरी तरह से समाप्त कर दिया। ट्रांसफॉर्मर को 2017 के पेपर "Attention Is All You Need" में आशीष कुमार, जैकब उज़कोरिट, लुकाज़ कैसर, निकी परमार, और अन्य द्वारा पेश किया गया था, और यह जल्दी ही अनुक्रम मॉडलिंग के लिए मानक बन गया।
मल्टी-हेड ध्यान और विविधताएं
ट्रांसफॉर्मर मल्टी-हेड ध्यान का उपयोग करता है, जहां कई ध्यान तंत्र समानांतर में चलते हैं, प्रत्येक अलग-अलग संबंध सीखता है। आउटपुट को संयोजित किया जाता है और रैखिक रूप से प्रक्षेपित किया जाता है। यह मॉडल को विविध पैटर्न, जैसे वाक्यविन्यास और अर्थ संबंधी निर्भरताएं, एक साथ पकड़ने में सक्षम बनाता है। एक अन्य महत्वपूर्ण विविधता क्रॉस-ध्यान है, जो एनकोडर-डिकोडर मॉडल में उपयोग होती है जहां क्वेरी डिकोडर से आती हैं और कुंजी/मान एनकोडर से आते हैं, जिससे डिकोडर इनपुट अनुक्रम पर ध्यान केंद्रित कर सकता है। सेल्फ-अटेंशन, जहां क्वेरी, कुंजी, और मान सभी एक ही अनुक्रम से आते हैं, ट्रांसफॉर्मर के एनकोडर और डिकोडर दोनों में उपयोग होता है। स्थितीय एन्कोडिंग को इनपुट एम्बेडिंग में जोड़ा जाता है ताकि टोकन क्रम के बारे में जानकारी डाली जा सके, क्योंकि ध्यान स्वयं क्रम-परिवर्तन-अपरिवर्तनीय है।
बड़े भाषा मॉडल में भूमिका
ध्यान लगभग सभी आधुनिक बड़े भाषा मॉडल में मुख्य तंत्र है, जिसमें ओपनएआई, एंथ्रोपिक, और गूगल डीपमाइंड द्वारा विकसित मॉडल शामिल हैं। ये मॉडल, जैसे GPT और क्लॉड, पाठ को संसाधित और उत्पन्न करने के लिए सेल्फ-अटेंशन के साथ स्टैक्ड ट्रांसफॉर्मर परतों का उपयोग करते हैं। संदर्भ विंडो में सभी टोकन पर ध्यान केंद्रित करने की क्षमता सुसंगत लंबी-रूप पीढ़ी, इन-संदर्भ सीखने, और जटिल तर्क को सक्षम बनाती है। हालांकि, अनुक्रम लंबाई के संबंध में ध्यान की द्विघात कम्प्यूटेशनल लागत ने कुशल विविधताओं, जैसे स्पार्स ध्यान और रैखिक ध्यान, पर शोध को प्रेरित किया है ताकि लंबे संदर्भों को संभाला जा सके। 2020 के दशक की शुरुआत तक, अधिकांश उत्पादन मॉडल पूर्ण ध्यान का उपयोग करते हैं जिसमें संदर्भ विंडो कुछ हज़ार से लेकर सैकड़ों हज़ार टोकन तक होती हैं।
भाषा से परे अनुप्रयोग
ध्यान प्राकृतिक भाषा प्रसंस्करण से परे लागू किया गया है। कंप्यूटर दृष्टि में, विज़न ट्रांसफॉर्मर (ViT) छवि पैच को टोकन के रूप में मानते हैं और छवि वर्गीकरण और वस्तु पहचान के लिए सेल्फ-अटेंशन का उपयोग करते हैं। भाषण पहचान में, ध्यान तंत्र ऑडियो फ्रेम को पाठ आउटपुट के साथ संरेखित करते हैं। सुदृढीकरण सीखने में, ध्यान एजेंटों को अवलोकनों के प्रासंगिक हिस्सों पर ध्यान केंद्रित करने में मदद करता है। यह तंत्र अनुशंसा प्रणालियों और दवा खोज में भी उपयोग होता है। इसकी बहुमुखी प्रतिभा ने इसे कृत्रिम बुद्धिमत्ता अनुसंधान में एक सार्वभौमिक उपकरण बना दिया है, और यह विभिन्न डोमेन में कई अत्याधुनिक प्रणालियों का एक प्रमुख घटक है।
कम्प्यूटेशनल विचार और हार्डवेयर
ध्यान संचालन में बड़े मैट्रिक्स गुणन शामिल होते हैं, जो GPU और विशेष त्वरक पर समानांतर प्रसंस्करण के लिए अच्छी तरह से उपयुक्त हैं। एनवीडिया और एएमडी जैसी कंपनियां हार्डवेयर डिज़ाइन करती हैं जो इन संचालनों को अनुकूलित करती हैं। अमेज़न वेब सर्विसेज, गूगल क्लाउड, और एज़्योर जैसे क्लाउड प्रदाता उच्च-बैंडविड्थ मेमोरी वाले इंस्टेंस प्रदान करते हैं ताकि ध्यान गणनाओं को संभाला जा सके। ध्यान की मेमोरी फुटप्रिंट अनुक्रम लंबाई के साथ द्विघात रूप से बढ़ती है, जिसके कारण ग्रेडिएंट चेकपॉइंटिंग और फ्लैश अटेंशन जैसी तकनीकें मेमोरी उपयोग को कम करने के लिए विकसित हुई हैं। जैसे-जैसे मॉडल स्केल करते हैं, कुशल ध्यान कार्यान्वयन अनुसंधान और इंजीनियरिंग का एक सक्रिय क्षेत्र बना हुआ है।
भविष्य की दिशाएं
अनुसंधान ध्यान तंत्रों को बेहतर बनाने के लिए जारी है। प्रयासों में कम्प्यूटेशनल जटिलता को कम करना, बाहरी मेमोरी को शामिल करना, और ध्यान को अधिक व्याख्यात्मक बनाना शामिल है। कुछ कार्य पूर्ण ध्यान के विकल्पों की खोज करते हैं, जैसे राज्य-स्थान मॉडल, लेकिन ध्यान प्रमुख प्रतिमान बना हुआ है। 2025 तक, ध्यान के साथ ट्रांसफॉर्मर-आधारित मॉडल अधिकांश वाणिज्यिक एआई उत्पादों की नींव हैं, और यह तंत्र निकट भविष्य में एआई विकास का केंद्रीय हिस्सा बने रहने की उम्मीद है।