मल्टी-हेड अटेंशन Transformer (architecture) आर्किटेक्चर का एक मुख्य घटक है, जो Deep learning में उपयोग होता है। यह मूल अटेंशन तंत्र को विस्तारित करता है, जिसमें कई अटेंशन ऑपरेशन समानांतर रूप से किए जाते हैं, प्रत्येक के पास क्वेरी, की और वैल्यू के अपने सीखे गए प्रोजेक्शन होते हैं। यह मॉडल को इनपुट अनुक्रम के भीतर विभिन्न प्रकार के संबंधों और पैटर्न, जैसे वाक्यात्मक निर्भरता, सह-संदर्भ, या स्थितीय संकेत, को कई प्रतिनिधित्व उप-स्थानों में पकड़ने की अनुमति देता है। इन समानांतर अटेंशन हेड्स के आउटपुट को फिर संयोजित (concatenate) किया जाता है और रैखिक रूप से प्रोजेक्ट करके अंतिम परिणाम उत्पन्न किया जाता है, जिससे मॉडल विभिन्न स्थितियों पर विभिन्न प्रतिनिधित्व उप-स्थानों से जानकारी पर संयुक्त रूप से ध्यान केंद्रित कर सकता है।
यह अवधारणा 2017 के पेपर "Attention Is All You Need" में पेश की गई थी, जिसे Google के शोधकर्ताओं, जिनमें जैकब उज़्कोरिट, लुकाज़ कैसर, और निकी पार्मर शामिल थे, ने लिखा था। पेपर ने ट्रांसफॉर्मर का प्रस्ताव रखा, जो पूरी तरह से अटेंशन तंत्र पर निर्भर करता है और पुनरावृत्ति (recurrence) तथा कन्वोल्यूशन को हटा देता है, जिससे अनुक्रम-से-अनुक्रम कार्यों में प्रशिक्षण गति और प्रदर्शन में महत्वपूर्ण सुधार हुआ। तब से मल्टी-हेड अटेंशन बड़े भाषा मॉडल जैसे GPT, BERT, और T5 का आधारभूत तत्व बन गया है, और प्राकृतिक भाषा प्रसंस्करण, कंप्यूटर विज़न, और वाक् पहचान में व्यापक रूप से उपयोग किया जाता है।
तंत्र
अटेंशन तंत्र में, प्रत्येक इनपुट टोकन को एक वेक्टर के रूप में दर्शाया जाता है, जिसे अक्सर टोकन एम्बेडिंग कहा जाता है। टोकनों के अनुक्रम के लिए, मॉडल तीन मैट्रिक्स की गणना करता है: क्वेरी (Q), की (K), और वैल्यू (V)। क्वेरी और की के बीच अटेंशन स्कोर आमतौर पर डॉट उत्पाद के रूप में गणना की जाती है, जिसे की आयाम के वर्गमूल से स्केल किया जाता है। इन स्कोरों को सॉफ्टमैक्स फ़ंक्शन का उपयोग करके सामान्यीकृत किया जाता है ताकि अटेंशन भार उत्पन्न हो सकें, जिनका उपयोग वैल्यू के भारित योग की गणना करने के लिए किया जाता है।
मल्टी-हेड अटेंशन इस प्रक्रिया को कई बार समानांतर रूप से चलाता है, प्रत्येक बार मूल क्वेरी, की और वैल्यू के विभिन्न सीखे गए रैखिक प्रोजेक्शन के साथ। उदाहरण के लिए, 8 हेड्स के साथ, मॉडल 8 अलग-अलग अटेंशन आउटपुट की गणना करता है, प्रत्येक अनुक्रम के विभिन्न पहलुओं पर ध्यान केंद्रित करता है। आउटपुट को संयोजित किया जाता है और एक अंतिम रैखिक परत से गुजारा जाता है। यह डिज़ाइन मॉडल को विभिन्न प्रतिनिधित्व उप-स्थानों से जानकारी पर ध्यान केंद्रित करने की अनुमति देता है, जो विविध भाषाई पैटर्न को पकड़ने के लिए विशेष रूप से उपयोगी है।
"हार्ड" भारों के विपरीत, जो प्रशिक्षण के दौरान निर्धारित होते हैं, अटेंशन भार "सॉफ्ट" होते हैं और फॉरवर्ड पास के दौरान गणना किए जाते हैं, जिसका अर्थ है कि वे प्रत्येक इनपुट के साथ बदलते हैं। यह मॉडल को इनपुट के प्रासंगिक भागों पर गतिशील रूप से ध्यान केंद्रित करने की अनुमति देता है, जैसा कि मशीन अनुवाद में संरेखण उदाहरण द्वारा दर्शाया गया है: "I love you" का फ्रेंच में अनुवाद करते समय, मॉडल "je" उत्पन्न करते समय "I" पर, "t'" उत्पन्न करते समय "you" पर, और "aime" उत्पन्न करते समय "love" पर उच्च अटेंशन भार निर्धारित करता है।
इतिहास
अटेंशन तंत्र पुनरावर्ती तंत्रिका नेटवर्क (RNN) की कमजोरियों को दूर करने के लिए विकसित किया गया था, जो वाक्य के अंत में जानकारी को प्राथमिकता देते हैं और पहले के शब्दों के महत्व को कम करते हैं। प्रारंभिक अटेंशन तंत्र, जैसे बहदानाउ-शैली योगात्मक अटेंशन (2014) और लुओंग-शैली गुणात्मक अटेंशन (2015), को मशीन अनुवाद के लिए एनकोडर-डिकोडर RNN आर्किटेक्चर में जोड़ा गया था। इन्होंने डिकोडर को केवल अंतिम छिपी स्थिति पर निर्भर रहने के बजाय सभी एनकोडर छिपी स्थितियों तक सीधे पहुंचने की अनुमति दी।
प्रमुख सफलता सेल्फ-अटेंशन के साथ आई, जहां इनपुट अनुक्रम का प्रत्येक तत्व अन्य सभी पर ध्यान केंद्रित करता है, जिससे मॉडल वैश्विक निर्भरताओं को पकड़ सकता है। यह विचार ट्रांसफॉर्मर का केंद्र था, जिसने पुनरावृत्ति को पूरी तरह से अटेंशन तंत्र से बदल दिया। ट्रांसफॉर्मर की समानांतरीकरण योग्य आर्किटेक्चर ने प्रशिक्षण में महत्वपूर्ण गति प्रदान की, जिससे BERT, T5, और जनरेटिव प्री-ट्रेंड ट्रांसफॉर्मर (GPT) जैसे मॉडलों में इसका अपनाना हुआ।
विविधताएँ
अटेंशन की कई विविधताएँ विकसित की गई हैं, जिनमें से कई सॉफ्ट भार लागू करती हैं। इनमें शामिल हैं:
- फास्ट वेट प्रोग्रामर (1992): एक "धीमा" तंत्रिका नेटवर्क बाहरी उत्पादों के माध्यम से दूसरे तंत्रिका नेटवर्क के "तेज़" भार उत्पन्न करता है। इसे बाद में "रैखिककृत सेल्फ-अटेंशन" नाम दिया गया।
- बहदानाउ-शैली अटेंशन (योगात्मक अटेंशन): संरेखण स्कोर की गणना के लिए फीड-फॉरवर्ड नेटवर्क का उपयोग करता है।
- लुओंग-शैली अटेंशन (गुणात्मक अटेंशन): डिकोडर और एनकोडर स्थितियों के बीच डॉट उत्पादों का उपयोग करता है।
- स्थितीय अटेंशन और कारकीकृत स्थितीय अटेंशन: अटेंशन गणनाओं में स्थितीय जानकारी शामिल करते हैं।
- स्थानिक और चैनल अटेंशन कन्वोल्यूशनल तंत्रिका नेटवर्क के लिए: स्थानिक आयामों या फीचर चैनलों पर कार्य करते हैं।
ये विविधताएँ प्रत्येक लक्ष्य आउटपुट पर प्रभावों को पुनर्वितरित करने के लिए एनकोडर-पक्ष इनपुट को पुनः संयोजित करती हैं, अक्सर पुनर्भार गुणांक के लिए डॉट उत्पादों के सहसंबंध-शैली मैट्रिक्स का उपयोग करती हैं।
अनुकूलन
अटेंशन मैट्रिक्स का आकार इनपुट टोकनों की संख्या के वर्ग के समानुपाती होता है, जो लंबे अनुक्रमों के लिए मेमोरी-गहन हो सकता है। फ्लैश अटेंशन एक कार्यान्वयन है जो मेमोरी आवश्यकताओं को कम करता है और सटीकता का त्याग किए बिना दक्षता बढ़ाता है। यह अटेंशन गणना को छोटे ब्लॉकों में विभाजित करता है जो GPU की तेज़ ऑन-चिप मेमोरी में फिट होते हैं, जिससे बड़े मध्यवर्ती मैट्रिक्स को संग्रहीत करने की आवश्यकता कम हो जाती है।
मेटा द्वारा विकसित फ्लेक्सअटेंशन, एक अटेंशन कर्नेल है जो उपयोगकर्ताओं को सॉफ्टमैक्स से पहले अटेंशन स्कोर संशोधित करने की अनुमति देता है और गतिशील रूप से इष्टतम अटेंशन एल्गोरिदम चुनता है, जो कस्टम अटेंशन पैटर्न के लिए लचीलापन प्रदान करता है।
अनुप्रयोग
अटेंशन का व्यापक रूप से प्राकृतिक भाषा प्रसंस्करण, कंप्यूटर विज़न, और वाक् पहचान में उपयोग किया जाता है। NLP में, यह प्रश्न-उत्तर और सारांशीकरण जैसे कार्यों में संदर्भ समझ में सुधार करता है। विज़न में, दृश्य अटेंशन मॉडल को प्रासंगिक छवि क्षेत्रों पर ध्यान केंद्रित करने में मदद करता है, जिससे वस्तु पहचान और छवि कैप्शनिंग में वृद्धि होती है।
कंप्यूटर विज़न में, विज़न ट्रांसफॉर्मर (ViT) छवि पैच पर मल्टी-हेड अटेंशन लागू करते हैं। अटेंशन मैप, जो अटेंशन स्कोर को हीट मैप के रूप में विज़ुअलाइज़ करते हैं, ViT मॉडल की निर्णय-निर्माण प्रक्रिया की जांच करने का एक नियमित तरीका बन गए हैं। गहरी परतें अधिक अर्थपूर्ण विज़ुअलाइज़ेशन दिखाती हैं। अटेंशन रोलआउट एक पुनरावर्ती एल्गोरिदम है जो क्रमिक अटेंशन मैप के डॉट उत्पाद की गणना करके सभी परतों में अटेंशन स्कोर को जोड़ता है।
क्योंकि विज़न ट्रांसफॉर्मर आमतौर पर स्व-पर्यवेक्षित तरीके से प्रशिक्षित होते हैं, अटेंशन मैप आम तौर पर वर्ग-संवेदनशील नहीं होते हैं। जब एक वर्गीकरण हेड जोड़ा जाता है, तो वर्ग-विभेदक अटेंशन मैप (CDAM) वर्ग टोकन के संबंध में अटेंशन मैप और ग्रेडिएंट्स को जोड़ते हैं ताकि वर्ग-विशिष्ट स्पष्टीकरण प्रदान किए जा सकें।
प्रभाव
मल्टी-हेड अटेंशन जनरेटिव एआई और बड़े भाषा मॉडल के उदय में सहायक रहा है। यह मॉडलों को लंबे अनुक्रमों को कुशलतापूर्वक संसाधित करने और जटिल निर्भरताओं को पकड़ने में सक्षम बनाता है, जिससे यह ओपनएआई, एंथ्रोपिक, और गूगल डीपमाइंड जैसे संगठनों द्वारा विकसित प्रणालियों में एक प्रमुख घटक बन गया है। आर्किटेक्चर ने हार्डवेयर डिज़ाइन को भी प्रभावित किया है, जिसमें एनवीडिया और सेरेब्रास जैसी कंपनियाँ अटेंशन-आधारित गणनाओं के लिए चिप्स को अनुकूलित कर रही हैं।
अटेंशन दक्षता और व्याख्यात्मकता में सुधार पर शोध जारी है। स्पार्स अटेंशन, रैखिक अटेंशन, और कर्नेल-आधारित विधियों जैसी तकनीकें अटेंशन की द्विघात जटिलता को कम करने का लक्ष्य रखती हैं, जबकि व्याख्यात्मकता उपकरण यह समझने में मदद करते हैं कि मॉडल क्या सीखते हैं। मल्टी-हेड अटेंशन मशीन लर्निंग और कृत्रिम बुद्धिमत्ता में अध्ययन का एक जीवंत क्षेत्र बना हुआ है।