मशीन लर्निंग और डेटा विश्लेषण में, किसी डेटासेट का आंतरिक आयाम (intrinsic dimension) उन स्वतंत्र चरों की न्यूनतम संख्या को संदर्भित करता है जो बिना महत्वपूर्ण सूचना हानि के डेटा को प्रस्तुत करने के लिए आवश्यक होते हैं। जबकि डेटा उच्च-आयामी परिवेशीय स्थान (जैसे, किसी छवि के लिए हजारों पिक्सेल मान) में अंतर्निहित हो सकता है, इसकी वास्तविक संरचना अक्सर निम्न-आयामी मैनिफोल्ड पर स्थित होती है। आंतरिक आयाम इस निम्न-आयामी जटिलता को मापता है, जो अनावश्यक या सहसंबद्ध विशेषताओं और डेटा की परिवर्तनशीलता को नियंत्रित करने वाली वास्तविक स्वतंत्रता की डिग्री के बीच अंतर करता है।
यह अवधारणा "आयामीता के अभिशाप" (curse of dimensionality) और Deep learning मॉडलों की आश्चर्यजनक दक्षता को समझने के लिए केंद्रीय है। उदाहरण के लिए, प्राकृतिक छवियाँ, ऑडियो सिग्नल और टेक्स्ट एम्बेडिंग अक्सर अपनी कच्ची फीचर संख्या से कहीं छोटे आंतरिक आयाम प्रदर्शित करते हैं। यह गुण Model Pruning, Data Augmentation और मैनिफोल्ड लर्निंग जैसी तकनीकों को रेखांकित करता है, जहाँ आयामीता को कम करने से सामान्यीकरण, कम्प्यूटेशनल दक्षता और व्याख्यात्मकता में सुधार हो सकता है।
मापन और अनुमान
आंतरिक आयाम का अनुमान लगाना एक गैर-तुच्छ समस्या है, जिसकी विधियाँ दो व्यापक श्रेणियों में आती हैं: वैश्विक और स्थानीय। वैश्विक विधियाँ, जैसे प्रिंसिपल कंपोनेंट विश्लेषण (PCA) या मल्टीडायमेंशनल स्केलिंग, यह मानती हैं कि डेटा एक रैखिक उपसमष्टि पर स्थित है। हालाँकि, वास्तविक दुनिया का डेटा अक्सर अरैखिक मैनिफोल्ड पर स्थित होता है, जिसके लिए स्थानीय दृष्टिकोण की आवश्यकता होती है। सामान्य स्थानीय अनुमानकों में सहसंबंध आयाम, ग्रासबर्गर-प्रोकैसिया एल्गोरिदम, और निकटतम-पड़ोसी-आधारित विधियाँ जैसे 2005 में लेविना और बिकेल द्वारा प्रस्तुत अधिकतम संभावना अनुमानक (MLE) शामिल हैं। ये विधियाँ उस दर की गणना करती हैं जिस पर दूरी के साथ पड़ोसियों की संख्या बढ़ती है, जिससे एक स्थानीय आयाम अनुमान प्राप्त होता है जिसे डेटासेट पर औसत किया जा सकता है।
हाल के दृष्टिकोण स्वयं तंत्रिका नेटवर्क का लाभ उठाते हैं। उदाहरण के लिए, किसी डेटासेट के आंतरिक आयाम का अनुमान एक क्लासिफायर या ऑटोएनकोडर को प्रशिक्षित करके और सीखी गई फीचर प्रस्तुतियों की रैंक को मापकर लगाया जा सकता है। Neural network अनुसंधान में, हानि परिदृश्य का आंतरिक आयाम - न्यूनतम तक पहुँचने के लिए आवश्यक प्रभावी मापदंडों की संख्या - का अध्ययन सामान्यीकरण और अतिप्राचुर्यीकरण (overparameterization) को समझने के लिए किया गया है।
तंत्रिका नेटवर्क प्रशिक्षण में भूमिका
आधुनिक मशीन लर्निंग में एक प्रमुख खोज यह है कि Neural network मापदंडों का अनुकूलन अक्सर पूर्ण मापदंड संख्या की तुलना में बहुत कम आंतरिक आयाम वाले उपसमष्टि में होता है। ली एट अल. (2018) के शोध ने प्रदर्शित किया कि कई आर्किटेक्चर के लिए, पैरामीटर स्पेस के केवल एक छोटे यादृच्छिक प्रक्षेपण को अनुकूलित करके नेटवर्क को लगभग पूर्ण सटीकता तक प्रशिक्षित किया जा सकता है, जिसमें आवश्यक आयाम मापदंडों की संख्या के साथ लघुगणकीय रूप से स्केल होता है। यह घटना, जिसे कभी-कभी "अनुकूलन का आंतरिक आयाम" कहा जाता है, यह समझाती है कि Gradient Clipping और Learning Rate Scheduling रणनीतियाँ विशाल मॉडलों में भी प्रभावी क्यों हो सकती हैं।
इस अंतर्दृष्टि के व्यावहारिक निहितार्थ हैं। यह Model Pruning और निम्न-रैंक फैक्टराइजेशन तकनीकों की प्रभावशीलता का समर्थन करता है, जहाँ अनावश्यक मापदंडों को प्रदर्शन से समझौता किए बिना हटा दिया जाता है। यह Large language model के लिए पैरामीटर-कुशल फाइन-ट्यूनिंग विधियों के डिजाइन को भी सूचित करता है, जैसे एडेप्टर या निम्न-रैंक अपडेट, जो कार्य-विशिष्ट समायोजनों के निम्न आंतरिक आयाम का लाभ उठाते हैं।
डेटा विज्ञान में अनुप्रयोग
अनुपरीक्षित लर्निंग (unsupervised learning) में, आंतरिक आयाम t-SNE या UMAP जैसे एल्गोरिदम के लिए एम्बेडिंग आयामों के चयन का मार्गदर्शन करता है। आंतरिक आयाम जानने से Loss Functions-आधारित मैट्रिक्स फैक्टराइजेशन या Autoencoder-शैली मॉडलों में अव्यक्त कारकों की संख्या निर्धारित करने में मदद मिलती है। विसंगति का पता लगाने में, असामान्य रूप से उच्च स्थानीय आंतरिक आयाम वाले बिंदु शोर या आउटलायर का संकेत दे सकते हैं, क्योंकि वे मैनिफोल्ड संरचना से विचलित होते हैं।
Computer vision और Natural language processing में, मॉडल चयन से पहले डेटासेट की जटिलता का आकलन करने के लिए आंतरिक आयाम अनुमानों का उपयोग किया जाता है। उदाहरण के लिए, छवि पैच का आंतरिक आयाम वर्गीकरण कार्यों की कठिनाई की भविष्यवाणी कर सकता है, जबकि Transformer (architecture) मॉडलों से टेक्स्ट एम्बेडिंग अधिक सुसंगत विषयों के लिए अक्सर कम आंतरिक आयाम दिखाते हैं।
अतिप्राचुर्यीकरण और सामान्यीकरण से संबंध
अतिप्राचुर्यीकृत मॉडलों, जैसे Residual Network (ResNet) और Transformer (architecture) की सफलता, आंशिक रूप से डेटा और हानि परिदृश्य के निम्न आंतरिक आयाम के लिए जिम्मेदार ठहराई गई है। सैद्धांतिक कार्य बताता है कि जब डेटा का आंतरिक आयाम कम होता है, तो मॉडल बिना अतिफिटिंग के शोर को याद कर सकते हैं, क्योंकि प्रभावी परिकल्पना स्थान सीमित होता है। यह उन अवलोकनों के साथ संरेखित है कि Batch Normalization और Dropout फीचर स्पेस के आंतरिक आयाम को अप्रत्यक्ष रूप से कम करके मॉडलों को नियमित करते हैं।
इसके अलावा, प्रशिक्षण के दौरान ग्रेडिएंट गतिशीलता का आंतरिक आयाम अंतिम सामान्यीकरण अंतर की भविष्यवाणी कर सकता है। अध्ययनों ने दिखाया है कि छोटे प्रभावी आंतरिक आयाम के साथ प्रशिक्षित नेटवर्क बेहतर सामान्यीकरण करते हैं, यह खोज Curriculum Learning और अन्य प्रशिक्षण रणनीतियों में अनुसंधान को प्रेरित करती है जो धीरे-धीरे डेटा जटिलता बढ़ाती हैं।
सीमाएँ और खुले प्रश्न
आंतरिक आयाम का अनुमान शोर, नमूना आकार और मीट्रिक की पसंद के प्रति संवेदनशील बना हुआ है। विरल नमूने वाले उच्च-आयामी डेटा के लिए, स्थानीय अनुमानक पक्षपाती हो सकते हैं। कोई सार्वभौमिक रूप से स्वीकृत परिभाषा नहीं है, और विभिन्न अनुमानक एक ही डेटासेट के लिए अलग-अलग मान दे सकते हैं। Generative AI और Large language model के संदर्भ में, सीखी गई प्रस्तुति स्थान का आंतरिक आयाम अभी भी पूरी तरह से समझा नहीं गया है, जिसमें यह मॉडल स्केल, प्रशिक्षण डेटा विविधता और आकस्मिक क्षमताओं से कैसे संबंधित है, इस पर चल रहे शोध हैं।
भविष्य का कार्य मजबूत अनुमानकों को विकसित करने पर केंद्रित हो सकता है जो अरबों मापदंडों तक स्केल करते हैं, और Artificial intelligence सुरक्षा और व्याख्यात्मकता में सैद्धांतिक गारंटी के लिए आंतरिक आयाम को जोड़ने पर।