अनऋणात्मक मैट्रिक्स गुणनखंडन (NMF या NNMF), जिसे अनऋणात्मक मैट्रिक्स सन्निकटन भी कहा जाता है, बहुचर विश्लेषण और रैखिक बीजगणित में एल्गोरिदम का एक समूह है। लक्ष्य किसी दिए गए मैट्रिक्स V को दो मैट्रिक्स, सामान्यतः W और H से निरूपित, में गुणनखंडित करना है, ताकि तीनों मैट्रिक्स में केवल अनऋणात्मक तत्व हों। यह बाधा परिणामी गुणनखंडों का निरीक्षण और व्याख्या करना आसान बनाती है, और यह उन अनुप्रयोगों के साथ संरेखित होती है जहां डेटा स्वाभाविक रूप से अनऋणात्मक होता है, जैसे ऑडियो स्पेक्ट्रोग्राम या मांसपेशी गतिविधि माप। चूंकि एक सटीक गुणनखंडन सामान्यतः संभव नहीं होता, NMF विधियाँ संख्यात्मक रूप से एक अनुमानित समाधान की गणना करती हैं।
NMF ने विभिन्न क्षेत्रों में अनुप्रयोग पाए हैं, जिनमें खगोल विज्ञान, कंप्यूटर दृष्टि, दस्तावेज़ क्लस्टरिंग, लुप्त डेटा प्रतिस्थापन, केमोमेट्रिक्स, ऑडियो सिग्नल प्रोसेसिंग, अनुशंसा प्रणाली, और जैव सूचना विज्ञान शामिल हैं। इसकी अपील इसकी भाग-आधारित प्रतिनिधित्व उत्पन्न करने की क्षमता में निहित है, जहां मूल डेटा को सीखे गए घटकों के एक छोटे सेट के योगात्मक संयोजन के रूप में व्यक्त किया जाता है।
इतिहास
अनऋणात्मक गुणनखंडन की अवधारणा की जड़ें केमोमेट्रिक्स में हैं, जहां इसे लंबे समय से "स्व-मॉडलिंग वक्र समाधान" के रूप में जाना जाता था। उस ढांचे में, दाएं गुणनखंड मैट्रिक्स में वेक्टरों को असतत वेक्टरों के बजाय सतत वक्रों के रूप में माना जाता था। 1990 के दशक में, एक फिनिश शोध समूह ने "सकारात्मक मैट्रिक्स गुणनखंडन" नाम से संबंधित विधियाँ विकसित कीं। डैनियल डी. ली और एच. सेबेस्टियन सियुंग ने इसके गुणों की जांच की और 1999 और 2001 में दो प्रकार के गुणनखंडन के लिए सरल और प्रभावी एल्गोरिदम प्रकाशित किए, जिसके बाद यह दृष्टिकोण अनऋणात्मक मैट्रिक्स गुणनखंडन के रूप में व्यापक मान्यता प्राप्त कर गया। उनके कार्य ने परिणामी गुणनखंडों की व्याख्यात्मकता पर प्रकाश डाला और विधि में व्यापक रुचि जगाई।
पृष्ठभूमि
आकार m × n का एक मैट्रिक्स V दिया गया है, NMF इसे दो मैट्रिक्स के गुणनफल के रूप में अनुमानित करना चाहता है: V ≈ W H, जहां W आकार m × p है और H आकार p × n है। रैंक p को सामान्यतः m और n दोनों से बहुत छोटा चुना जाता है, ताकि गुणनखंडन मूल डेटा को निम्न-आयामी प्रतिनिधित्व में संपीड़ित कर सके। मैट्रिक्स गुणन को स्तंभ-वार समझा जा सकता है: V का प्रत्येक स्तंभ वेक्टर W के स्तंभ वेक्टरों का एक रैखिक संयोजन है, जिसमें गुणांक H के संगत स्तंभ द्वारा दिए गए हैं।
उदाहरण के लिए, एक पाठ-खनन अनुप्रयोग में, V में 10,000 पंक्तियाँ शब्दों का प्रतिनिधित्व करती हैं और 500 स्तंभ दस्तावेज़ों का प्रतिनिधित्व करते हैं। यदि एल्गोरिदम को 10 विशेषताएँ खोजने के लिए कहा जाता है, तो W आकार 10,000 × 10 होगा और H आकार 10 × 500 होगा। गुणनफल W H का प्रत्येक स्तंभ तब W में 10 विशेषता वेक्टरों का एक रैखिक संयोजन होता है, जो H के संगत स्तंभ में प्रविष्टियों द्वारा भारित होता है। W में प्रत्येक विशेषता वेक्टर को एक दस्तावेज़ आदर्श के रूप में व्याख्या किया जा सकता है, जहां सेल मान उस विशेषता में प्रत्येक शब्द के महत्व को दर्शाते हैं। इसी तरह, H का प्रत्येक स्तंभ किसी विशिष्ट दस्तावेज़ के लिए इन विशेषताओं के भार देता है, जिससे मूल दस्तावेज़ को आदर्शों के भारित योग के रूप में पुनर्निर्माण करने की अनुमति मिलती है।
क्लस्टरिंग गुण
NMF में एक अंतर्निहित क्लस्टरिंग गुण होता है। जब V को W H द्वारा अनुमानित किया जाता है, तो एल्गोरिदम स्वचालित रूप से इनपुट डेटा के स्तंभों को क्लस्टर करता है। सन्निकटन W और H पर अनऋणात्मकता बाधाओं के अधीन, V और W H के बीच अंतर के फ्रोबेनियस मानदंड, जो अक्सर एक त्रुटि फलन होता है, को न्यूनतम करके प्राप्त किया जाता है। यदि H पर एक अतिरिक्त ऑर्थोगोनैलिटी बाधा लगाई जाती है (अर्थात, H Hᵀ = I), तो न्यूनतमकरण गणितीय रूप से K-मीन्स क्लस्टरिंग के बराबर हो जाता है। इस मामले में, H की प्रविष्टियाँ सीधे क्लस्टर सदस्यता का संकेत देती हैं: किसी दिए गए स्तंभ j के लिए, सबसे बड़ी प्रविष्टि H_kj उस क्लस्टर की पहचान करती है जिससे डेटा बिंदु v_j संबंधित है। यह गुण NMF को अनुपरिवेक्षित अधिगम और खोजपूर्ण डेटा विश्लेषण के लिए एक उपयोगी उपकरण बनाता है।
एल्गोरिदम और गणना
NMF की गणना के लिए कई एल्गोरिदम विकसित किए गए हैं। सबसे व्यापक रूप से उपयोग किया जाने वाला ली और सियुंग द्वारा प्रस्तुत गुणक अद्यतन नियम है, जो अनऋणात्मकता को बनाए रखते हुए W और H को पुनरावृत्त रूप से अद्यतन करता है। अन्य दृष्टिकोणों में वैकल्पिक न्यूनतम वर्ग, प्रक्षेपित प्रवणता विधियाँ, और विरलता या स्मूथनेस बाधाओं को शामिल करने वाले प्रकार शामिल हैं। एल्गोरिदम का चयन अक्सर डेटा के आकार, वांछित सटीकता और विशिष्ट अनुप्रयोग पर निर्भर करता है। चूंकि समस्या गैर-उत्तल है, समाधान आरंभीकरण पर निर्भर हो सकते हैं, और स्थिर परिणाम प्राप्त करने के लिए कभी-कभी विभिन्न प्रारंभिक बिंदुओं के साथ कई रन का उपयोग किया जाता है।
अनुप्रयोग
NMF का उपयोग विभिन्न क्षेत्रों में किया जाता है। ऑडियो सिग्नल प्रोसेसिंग में, इसका उपयोग स्पेक्ट्रोग्राम को वर्णक्रमीय घटकों में विघटित करने के लिए किया जाता है, जिससे स्रोत पृथक्करण या संगीत प्रतिलेखन संभव होता है। दस्तावेज़ क्लस्टरिंग और विषय मॉडलिंग में, NMF अव्यक्त विषयों को शब्दों के सेट के रूप में पहचानता है, जिसमें प्रत्येक दस्तावेज़ विषयों के मिश्रण के रूप में प्रस्तुत होता है। जैव सूचना विज्ञान में, यह सह-व्यक्त जीनों के पैटर्न की पहचान करके जीन अभिव्यक्ति डेटा का विश्लेषण करने में मदद करता है। अनुशंसा प्रणालियों में, NMF उपयोगकर्ता-आइटम रेटिंग मैट्रिक्स को गुणनखंडित कर सकता है ताकि उपयोगकर्ता प्राथमिकताओं की भविष्यवाणी करने वाले अव्यक्त कारकों को उजागर किया जा सके। इसके अतिरिक्त, NMF का उपयोग कंप्यूटर दृष्टि में चेहरे की विशेषता निष्कर्षण और केमोमेट्रिक्स में अतिव्यापी वर्णक्रमीय संकेतों को हल करने के लिए किया गया है।