गणित और मशीन लर्निंग में, सदिशों का एक समुच्चय या एक प्रायिकता वितरण समदैशिक स्थिति (isotropic position) में कहा जाता है यदि उसका सहप्रसरण मैट्रिक्स तत्समक मैट्रिक्स (identity matrix) हो (एक अदिश गुणक तक)। इसका अर्थ है कि डेटा में हर दिशा में समान प्रसरण है, बिना किसी पसंदीदा अभिविन्यास के। शब्द "समदैशिक" भौतिकी से आया है, जिसका अर्थ है सभी दिशाओं में समान। परिमित बिंदुओं के समुच्चय के लिए, समदैशिक स्थिति का तात्पर्य है कि किसी भी इकाई सदिश पर वर्ग प्रक्षेपणों का औसत स्थिर है, और केंद्रक मूल बिंदु पर है। यह गुण अक्सर एक रैखिक परिवर्तन के माध्यम से प्राप्त किया जाता है जिसे व्हाइटनिंग (whitening) या स्फेरिंग (sphering) कहा जाता है, जो विशेषताओं को असंबद्ध करता है और उनके प्रसरणों को सामान्य करता है।
यह अवधारणा कई क्षेत्रों में मौलिक है। अनुकूलन (optimization) में, समदैशिक स्थिति समस्याओं की स्थिति (conditioning) में सुधार करती है, जिससे ग्रेडिएंट-आधारित विधियों का अभिसरण तेज होता है। सांख्यिकी में, यह सहसंबंधों को हटाकर विश्लेषण को सरल बनाता है। मशीन लर्निंग में, इसका उपयोग फीचर प्रीप्रोसेसिंग, प्रारंभिकरण, और स्टोकेस्टिक ग्रेडिएंट डिसेंट जैसे एल्गोरिदम के सैद्धांतिक विश्लेषण में किया जाता है। यह धारणा उत्तल ज्यामिति (convex geometry) में भी दिखाई देती है, जहाँ यह उत्तल पिंडों और उनके आयतन वितरण के अध्ययन से संबंधित है।
ऐतिहासिक पृष्ठभूमि
समदैशिक स्थिति का विचार शास्त्रीय सांख्यिकी में निहित है, जहाँ प्रमुख घटक विश्लेषण (PCA) और व्हाइटनिंग परिवर्तनों का उपयोग 20वीं सदी की शुरुआत से किया जा रहा है। "समदैशिक स्थिति" शब्द ने उत्तल ज्यामिति में 1980 और 1990 के दशक में बेला बोलोबास (Béla Bollobás) और अन्य गणितज्ञों के कार्य के माध्यम से प्रमुखता प्राप्त की। उन्होंने समदैशिक स्थिरांक (isotropic constant) का अध्ययन किया, जो मापता है कि एक उत्तल पिंड समदैशिक होने से कितना दूर है। मशीन लर्निंग में, यह अवधारणा गहन शिक्षण के उदय के साथ अधिक प्रासंगिक हो गई, जहाँ गहरे नेटवर्क को प्रशिक्षित करने के लिए उचित प्रारंभिकरण और सामान्यीकरण महत्वपूर्ण हैं।
गणितीय परिभाषा
औपचारिक रूप से, \( \mathbb{R}^d \) पर घनत्व फलन \( p(x) \) वाला एक प्रायिकता वितरण समदैशिक स्थिति में है यदि उसका माध्य शून्य है और उसका सहप्रसरण मैट्रिक्स तत्समक है: \( \mathbb{E}[x x^T] = I_d \)। परिमित बिंदुओं \( \{x_1, \dots, x_n\} \) के समुच्चय के लिए, इसका अर्थ है कि \( \frac{1}{n} \sum_{i=1}^n x_i = 0 \) और \( \frac{1}{n} \sum_{i=1}^n x_i x_i^T = I_d \)। यदि सहप्रसरण तत्समक का एक अदिश गुणक है, तो समुच्चय को स्केलिंग तक समदैशिक स्थिति में कहा जाता है। इसे प्राप्त करने के लिए परिवर्तन \( y = \Sigma^{-1/2} (x - \mu) \) द्वारा दिया जाता है, जहाँ \( \mu \) माध्य है और \( \Sigma \) सहप्रसरण मैट्रिक्स है। इसे व्हाइटनिंग या महालनोबिस व्हाइटनिंग (Mahalanobis whitening) के रूप में जाना जाता है।
अनुकूलन में अनुप्रयोग
अनुकूलन में, किसी समस्या की स्थिति संख्या (condition number), जो हेसियन के सबसे बड़े से सबसे छोटे eigenvalue के अनुपात को मापती है, सीधे ग्रेडिएंट-आधारित विधियों की अभिसरण दर को प्रभावित करती है। समदैशिक स्थिति स्थिति संख्या को घटाकर एक कर देती है, जिससे तेज अभिसरण होता है। उदाहरण के लिए, Machine learning में, Neural network को प्रशिक्षित करते समय, इनपुट डेटा को समदैशिक स्थिति में प्रीप्रोसेस करने से प्रशिक्षण तेज हो सकता है। यह Batch Normalization और Layer Normalization जैसी तकनीकों से संबंधित है, जिनका उद्देश्य सक्रियताओं को शून्य माध्य और इकाई प्रसरण में सामान्य करना है, हालाँकि पूर्ण समदैशिकता आवश्यक नहीं है। सैद्धांतिक परिणाम दिखाते हैं कि जब डेटा समदैशिक स्थिति में होता है, तो स्टोकेस्टिक ग्रेडिएंट डिसेंट तेजी से अभिसरण करता है, क्योंकि ग्रेडिएंट कम तिरछे होते हैं।
मशीन लर्निंग में भूमिका
Deep learning में, समदैशिक स्थिति का उपयोग अक्सर अनुकूलन एल्गोरिदम के सैद्धांतिक विश्लेषण में किया जाता है। उदाहरण के लिए, Stochastic Gradient Descent Variants का अभिसरण उन धारणाओं के तहत अध्ययन किया जाता है कि डेटा समदैशिक है। यह प्रारंभिकरण योजनाओं के डिजाइन में भी दिखाई देता है, जैसे Weight Initialization, जहाँ उचित प्रसरण वाले वितरणों से भार खींचना परतों में समदैशिकता बनाए रखने में मदद करता है। इसके अतिरिक्त, Data Augmentation तकनीकें कभी-कभी सभी दिशाओं को कवर करने वाले नमूने उत्पन्न करके डेटा को अधिक समदैशिक बनाने का लक्ष्य रखती हैं। Generative AI में, समदैशिक गाऊसी पूर्व (isotropic Gaussian priors) अव्यक्त चर मॉडल में आम हैं, जहाँ अव्यक्त स्थान को नमूनाकरण और अनुमान को सरल बनाने के लिए समदैशिक माना जाता है।
उत्तल ज्यामिति से संबंध
उत्तल ज्यामिति में, \( \mathbb{R}^d \) में एक उत्तल पिंड \( K \) समदैशिक स्थिति में है यदि उसका आयतन 1 है, उसका केंद्रक मूल बिंदु पर है, और उसका जड़त्व मैट्रिक्स तत्समक का एक अदिश गुणक है। समदैशिक स्थिरांक \( L_K \) जड़त्व मैट्रिक्स के मानक और आयतन के अनुपात को मापता है। एक प्रसिद्ध खुली समस्या, स्लाइसिंग समस्या (slicing problem), पूछती है कि क्या सभी उत्तल पिंडों के लिए \( L_K \) पर एक सार्वभौमिक सीमा है। इस समस्या का कार्यात्मक विश्लेषण और प्रायिकता से संबंध है। यह अवधारणा माप की सांद्रता (concentration of measure) के बारे में परिणाम साबित करने के लिए उपयोग की गई है, जो उच्च-आयामी सांख्यिकी और Large language model प्रशिक्षण के लिए प्रासंगिक है, जहाँ डेटा अक्सर उच्च-आयामी स्थानों में होता है।
व्यावहारिक विचार
व्यवहार में, सटीक समदैशिक स्थिति प्राप्त करना कंप्यूटेशनल रूप से महंगा हो सकता है, विशेष रूप से उच्च-आयामी डेटा के लिए। अनुमानित विधियाँ, जैसे नमूना सहप्रसरण मैट्रिक्स का उपयोग, आम हैं। ऑनलाइन लर्निंग में, समय के साथ समदैशिकता बनाए रखना चुनौतीपूर्ण हो सकता है, लेकिन Gradient Clipping और अनुकूली सीखने की दरें (जैसे Adam (Optimizer)) समस्या की ज्यामिति के अनुकूल होकर अप्रत्यक्ष रूप से इसे संबोधित करती हैं। Transformer (architecture) मॉडल के लिए, स्थितीय एन्कोडिंग कभी-कभी स्थिर प्रशिक्षण सुनिश्चित करने के लिए समदैशिक गुणों के साथ डिज़ाइन की जाती हैं। कुल मिलाकर, समदैशिक स्थिति एक सैद्धांतिक आदर्श के रूप में कार्य करती है जो व्यावहारिक एल्गोरिदम को सूचित करती है, भले ही इसे पूरी तरह से प्राप्त न किया गया हो।
यह भी देखें
- Batch Normalization
- Weight Initialization
- Stochastic Gradient Descent Variants
- convex geometry (सूची में नहीं है, लेकिन Machine learning से लिंक करें)
नोट: दिए गए आंतरिक लिंक सूची से हैं। चूँकि "convex geometry" सूची में नहीं है, मैंने केवल सूचीबद्ध slugs का उपयोग किया।