Linformer एक Transformer (architecture) आर्किटेक्चर है जिसे मानक स्व-ध्यान तंत्रों की द्विघातीय संगणनात्मक और स्मृति लागत को संबोधित करने के लिए डिज़ाइन किया गया है। एक पारंपरिक ट्रांसफॉर्मर में, स्व-ध्यान परत अनुक्रम में प्रत्येक टोकन के बीच समानता स्कोर की गणना करती है, जिससे लंबाई n के अनुक्रम के लिए O(n²) की जटिलता उत्पन्न होती है। यह स्केलिंग लंबे अनुक्रमों के लिए निषेधात्मक हो जाती है, जैसे कि दस्तावेज़ प्रसंस्करण, जीनोमिक डेटा, या उच्च-रिज़ॉल्यूशन छवि विश्लेषण में पाए जाने वाले। Linformer कुंजी और मान मैट्रिक्स को निम्न-आयामी स्थान में प्रक्षेपित करके एक रैखिक-जटिलता स्व-ध्यान तंत्र प्रस्तुत करता है, जिससे लागत O(n) तक कम हो जाती है, जबकि डाउनस्ट्रीम कार्यों पर प्रतिस्पर्धी प्रदर्शन बनाए रखता है।
इस आर्किटेक्चर को 2020 के एक पेपर में सिनोंग वांग, बेलिंडा जेड. ली, मादियान खब्सा, हान फैंग, और हाओ मा द्वारा प्रस्तुत किया गया था, जो Facebook AI Research (अब मेटा AI का हिस्सा) के शोधकर्ता हैं। "Linformer: Self-Attention with Linear Complexity" शीर्षक वाले पेपर ने प्रदर्शित किया कि ध्यान मैट्रिक्स अक्सर निम्न-रैंक का होता है, जिसका अर्थ है कि इसे महत्वपूर्ण जानकारी के नुकसान के बिना बहुत छोटे मैट्रिक्स द्वारा अनुमानित किया जा सकता है। यह अंतर्दृष्टि विधि की सैद्धांतिक नींव बनाती है।
तंत्र और निम्न-रैंक प्रक्षेपण
Linformer का मुख्य नवाचार कुंजी और मान मैट्रिक्स के उपचार में निहित है। मानक मल्टी-हेड ध्यान में, ध्यान स्कोर की गणना क्वेरी और कुंजियों के गुणनफल के सॉफ्टमैक्स के रूप में की जाती है, जिसके लिए n×n मैट्रिक्स की आवश्यकता होती है। Linformer इसके बजाय कुंजियों और मानों को एक निश्चित आयाम k में प्रक्षेपित करता है, जहाँ k अनुक्रम लंबाई n से बहुत छोटा होता है, सीखे गए रैखिक प्रक्षेपणों का उपयोग करके। यह प्रक्षेपण ध्यान मैट्रिक्स को n×n से n×k तक कम कर देता है, जिसके परिणामस्वरूप अनुक्रम लंबाई के संबंध में रैखिक जटिलता उत्पन्न होती है।
k का चयन एक हाइपरपैरामीटर है जो दक्षता और सटीकता को संतुलित करता है। लेखकों ने दिखाया कि कई व्यावहारिक कार्यों के लिए, k का मान लगभग 128 या 256 पर्याप्त होता है, यहाँ तक कि हजारों टोकन के अनुक्रमों के लिए भी। प्रक्षेपण मैट्रिक्स कुछ प्रकारों में ध्यान हेड्स के बीच साझा किए जाते हैं, जिससे पैरामीटर गणना और स्मृति उपयोग और कम हो जाता है।
अन्य कुशल ट्रांसफॉर्मरों के साथ तुलना
Linformer 2020-2021 के आसपास विकसित कुशल ट्रांसफॉर्मर आर्किटेक्चर के व्यापक परिवार का हिस्सा है। इसकी तुलना अक्सर reformer (जो लोकैलिटी-सेंसिटिव हैशिंग का उपयोग करता है) और longformer (जो स्लाइडिंग विंडो ध्यान का उपयोग करता है) के साथ की जाती है। रिफॉर्मर के विपरीत, जो हैशिंग के माध्यम से ध्यान का अनुमान लगाता है, Linformer एक निश्चित निम्न-रैंक प्रक्षेपण का उपयोग करता है, जो सरल और हार्डवेयर-अनुकूल है। लॉन्गफॉर्मर के विपरीत, जो ध्यान को स्थानीय विंडो तक सीमित करता है, Linformer वैश्विक ध्यान जानकारी को बनाए रखता है, यद्यपि संपीड़ित रूप में।
IMDb भावना विश्लेषण और पाठ वर्गीकरण जैसे बेंचमार्क कार्यों पर अनुभवजन्य मूल्यांकनों ने दिखाया कि Linformer मूल ट्रांसफॉर्मर के बराबर सटीकता प्राप्त करता है, जबकि लंबे अनुक्रमों के लिए काफी कम स्मृति और समय का उपयोग करता है। उदाहरण के लिए, लंबाई 4096 के अनुक्रम पर, Linformer मानक ट्रांसफॉर्मर की तुलना में स्मृति उपयोग को 90% तक कम कर सकता है।
अनुप्रयोग और प्रभाव
Linformer का प्राथमिक उद्देश्य ट्रांसफॉर्मरों को लंबे संदर्भों को संभालने में सक्षम बनाना था, जो दस्तावेज़ सारांशीकरण, लंबे अंशों पर प्रश्नोत्तर, और चिकित्सा या कानूनी रिकॉर्ड के प्रसंस्करण जैसे कार्यों के लिए महत्वपूर्ण है। इसका रैखिक स्केलिंग इसे संसाधन-सीमित उपकरणों, जैसे मोबाइल फोन या एज हार्डवेयर, पर तैनाती के लिए भी आकर्षक बनाता है, जहाँ स्मृति और संगणना सीमित होती है।
ध्यान में निम्न-रैंक सन्निकटन के विचार ने बाद के कार्यों को प्रभावित किया है, जिसमें performer (जो यादृच्छिक फीचर मैप्स का उपयोग करता है) और फ्लैश-अटेंशन (जो I/O अनुकूलन पर केंद्रित है) शामिल हैं। जबकि Linformer स्वयं 2025 तक बड़े पैमाने पर उत्पादन मॉडलों में व्यापक रूप से उपयोग नहीं किया जाता है, इसके सिद्धांतों को हाइब्रिड आर्किटेक्चर में शामिल किया गया है और कुशल ध्यान तंत्रों पर शोध को सूचित किया है।
सीमाएँ और आलोचनाएँ
Linformer की एक सीमा यह है कि निम्न-रैंक धारणा सभी प्रकार के डेटा के लिए सत्य नहीं हो सकती है। उन कार्यों के लिए जहाँ ध्यान पैटर्न अत्यधिक विरल होते हैं या जटिल संरचना रखते हैं, निश्चित प्रक्षेपण महत्वपूर्ण जानकारी खो सकता है। इसके अतिरिक्त, प्रक्षेपण मैट्रिक्स प्रशिक्षण के दौरान सीखे जाते हैं, जिसका अर्थ है कि मॉडल को नए कार्यों के अनुकूल होने के लिए शुरू से प्रशिक्षित या फाइन-ट्यून किया जाना चाहिए; इसे संशोधन के बिना सीधे पूर्व-प्रशिक्षित ट्रांसफॉर्मर पर लागू नहीं किया जा सकता है।
एक और आलोचना यह है कि रैखिक जटिलता एक निश्चित अड़चन आयाम k की कीमत पर प्राप्त की जाती है, जिसे बहुत लंबे अनुक्रमों के लिए बढ़ाने की आवश्यकता हो सकती है, जिससे दक्षता लाभ संभावित रूप से कम हो सकता है। कुछ अध्ययनों ने यह भी नोट किया है कि Linformer का प्रदर्शन सूक्ष्म टोकन-स्तरीय तर्क की आवश्यकता वाले कार्यों पर घट जाता है, जैसे कि कुछ प्राकृतिक भाषा अनुमान बेंचमार्क।
विरासत और भविष्य की दिशाएँ
Linformer पेपर उन शुरुआती कार्यों में से एक था जिसने कुशल ध्यान के विचार को लोकप्रिय बनाया, जिसने ट्रांसफॉर्मरों को स्केलेबल बनाने पर शोध की लहर में योगदान दिया। निम्न-रैंक संरचना पर इसका जोर विभिन्न तरीकों से विस्तारित किया गया है, जिसमें अनुकूली रैंक चयन और पदानुक्रमित प्रक्षेपण शामिल हैं। 2025 तक, प्रमुख बड़े भाषा मॉडल, जैसे कि OpenAI और Google DeepMind से, अभी भी अपने मुख्य आर्किटेक्चर के लिए मानक द्विघातीय ध्यान का उपयोग करते हैं, लेकिन Linformer जैसे कुशल प्रकार विशेष अनुप्रयोगों और लंबे-संदर्भ प्रसंस्करण पर शोध के लिए प्रासंगिक बने हुए हैं।
आर्किटेक्चर Deep learning में मॉडल अभिव्यक्ति और संगणनात्मक दक्षता के बीच व्यापार-नापसंद को समझने के लिए एक उपयोगी शैक्षिक उदाहरण भी है। इसकी सरलता और स्पष्ट सैद्धांतिक प्रेरणा इसे Neural network डिज़ाइन और Artificial intelligence पर उन्नत पाठ्यक्रमों में एक सामान्य विषय बनाती है।