सामान्यीकरण एक सांख्यिकीय तकनीक है जिसका उपयोग विभिन्न पैमानों पर मापे गए मानों को एक काल्पनिक सामान्य पैमाने पर समायोजित करने के लिए किया जाता है, अक्सर औसत या तुलना से पहले। अपने सरलतम रूप में, सामान्यीकरण डेटा को पुनः-स्केल करता है, जबकि अधिक परिष्कृत समायोजनों का उद्देश्य संपूर्ण संभाव्यता वितरणों को संरेखित करना होता है। यह शब्द शैक्षिक मूल्यांकन जैसे क्षेत्रों में दिखाई देता है, जहाँ स्कोर वितरण को सामान्य वितरण के साथ संरेखित किया जा सकता है, और मशीन-लर्निंग में, जहाँ यह मॉडलों के प्रशिक्षण को स्थिर और तेज करने में मदद करता है।
सांख्यिकी में, सामान्यीकरण ढाँचों में मानक स्कोर (या Z-स्कोर) शामिल हैं, जो डेटा को स्थानांतरित और स्केल करते हैं ताकि माध्य शून्य और मानक विचलन एक हो। ये सामान्यीकृत मान स्थान और प्रसार के प्रभावों को हटाकर डेटासेट के बीच तुलना की अनुमति देते हैं। कुछ सामान्यीकरण, जैसे प्रतिशतक, वितरणों के बीच क्वांटाइल को संरेखित करते हैं। इन अनुपातों के लिए आवश्यक है कि माप अनुपात पैमाने पर हों, जिसका अर्थ है कि मापों के अनुपात सार्थक हैं।
इतिहास
सामान्यीकरण की अवधारणा 18वीं से 19वीं शताब्दी तक अब्राहम डी मोइवर, पियरे-साइमन लाप्लास और कार्ल फ्रेडरिक गॉस जैसे गणितज्ञों द्वारा सामान्य वितरण के अध्ययन के साथ उभरी। मानक सामान्य वितरण (माध्य शून्य, मानक विचलन एक) के लिए मानकीकरण सामान्यीकरण के रूप में जाना जाने लगा।
Z-स्कोर, जिसे नमूना मान और जनसंख्या माध्य के बीच के अंतर को जनसंख्या मानक विचलन से विभाजित करके परिभाषित किया जाता है, 20वीं शताब्दी की शुरुआत में कार्ल पियर्सन और रोनाल्ड फिशर जैसे सांख्यिकीविदों द्वारा औपचारिक रूप दिया गया था। सांख्यिकीय अनुमान और परिकल्पना परीक्षण पर उनके कार्य ने इस दृष्टिकोण को लोकप्रिय बनाया।
विलियम सीली गोसेट ने, गिनीज़ ब्रूअरी में काम करते हुए, छोटे-नमूना सन्निकटन को संबोधित किया - छोटे डेटासेट के लिए सामान्य वितरण में एक समायोजन जो लंबा और संकरा दोनों दिखाई देता था। 1908 में छद्म नाम "स्टूडेंट" के तहत प्रकाशित, उनका कार्य स्टूडेंट का t-वितरण बन गया, जिसे बाद में फिशर ने विस्तारित किया। यह छोटे नमूना आकारों के लिए एक प्रारंभिक सामान्यीकरण तकनीक थी।
फीचर स्केलिंग और बैच सामान्यीकरण
20वीं शताब्दी के मध्य में बहुचर सांख्यिकी और कंप्यूटरों के उदय के साथ, विभिन्न इकाइयों वाले बड़े डेटासेट को सामान्य करने के तरीके उभरे, जैसे कि मिन-मैक्स स्केलिंग और रोबस्ट स्केलिंग। ये तकनीकें, जिन्हें सामूहिक रूप से फीचर स्केलिंग के रूप में जाना जाता है, 20वीं शताब्दी के अंत में पैटर्न पहचान और तंत्रिका नेटवर्क जैसे क्षेत्रों में महत्वपूर्ण बन गईं।
2015 में, सर्गेई इओफ़े और क्रिश्चियन सेगेडी ने बैच सामान्यीकरण का प्रस्ताव रखा, एक तकनीक जो गहरे तंत्रिका नेटवर्क के प्रशिक्षण को स्थिर और तेज करने के लिए डिज़ाइन की गई है। यह विधि प्रशिक्षण के दौरान नेटवर्क के भीतर एक परत के इनपुट को सामान्य करती है, जिससे उच्च सीखने की दर और आरंभीकरण के प्रति कम संवेदनशीलता की अनुमति मिलती है, और यह कई गहन-शिक्षण आर्किटेक्चर में एक मानक घटक बन गई है।
सामान्यीकरण के प्रकार
सामान्यीकरण के कई सामान्य प्रकार मौजूद हैं, जिनमें से प्रत्येक की विशिष्ट विशेषताएँ हैं:
- Z-स्कोर (मानक स्कोर): माध्य और मानक विचलन के आधार पर पुनः-स्केल करता है, जिसके परिणामस्वरूप एक आयामहीन मात्रा प्राप्त होती है जो इंगित करती है कि एक मान माध्य से कितने मानक विचलन दूर है।
- मिन-मैक्स स्केलिंग: न्यूनतम घटाकर और सीमा से विभाजित करके डेटा को एक निश्चित सीमा, आमतौर पर [0, 1] में पुनः-स्केल करता है। यह आउटलायर्स के प्रति संवेदनशील है।
- रोबस्ट स्केलिंग: माध्यिका और अंतरचतुर्थक सीमा का उपयोग करता है, जिससे यह मिन-मैक्स स्केलिंग अनुमान की तुलना में आउटलायर्स के प्रति कम संवेदनशील होता है।
- प्रतिशतक सामान्यीकरण: प्रत्येक मान को उसका प्रतिशतक रैंक प्रदान करता है, वितरण को शून्य से 100 तक संरेखित करता है। यह मानकीकृत परीक्षण में आम है।
- क्वांटाइल सामान्यीकरण: विभिन्न वितरणों के क्वांटाइल को संरेखित करता है, यह सुनिश्चित करता है कि कई डेटासेट के सांख्यिकीय गुण समान हों।
ये विधियाँ आयामहीन हैं, जिसका अर्थ है कि वे अधिकांश मामलों में स्केल-अपरिवर्तनीय (बिना इकाइयों के) हैं, हालाँकि कुछ अनुपात जैसे विचरण-से-माध्य (σ²/μ) में इकाइयाँ होती हैं और स्केल-अपरिवर्तनीय नहीं होते हैं।
मशीन लर्निंग में अनुप्रयोग
सामान्यीकरण कृत्रिम-बुद्धिमत्ता मॉडलों के प्रशिक्षण के लिए व्यावहारिक है। फीचर स्केलिंग सुनिश्चित करती है कि विभिन्न इकाइयों वाले इनपुट चर (जैसे, सेंटीमीटर में ऊँचाई और किलोग्राम में वजन) मॉडल में समान रूप से योगदान करते हैं, जिससे बड़े चरों को दूरी गणना या ग्रेडिएंट अपडेट पर हावी होने से रोका जा सके। तंत्रिका-नेटवर्क प्रशिक्षण में, सामान्यीकृत इनपुट लुप्त या विस्फोटक ग्रेडिएंट के जोखिम को कम करते हैं, जिससे स्थिर अभिसरण सक्षम होता है।
यह अवधारणा कच्चे इनपुट से परे फैली हुई है; बैच सामान्यीकरण नेटवर्क के अंदर काम करता है, प्रत्येक परत की सक्रियताओं को सामान्य करता है। यह मानकीकरण और गहरे नेटवर्क में मदद करता है, और आधुनिक बड़े-भाषा और कंप्यूटर दृष्टि प्रणालियों में व्यापक रूप से अपनाया गया है।
विचार और संबंधित अवधारणाएँ
सामान्यीकरण का उपयोग उस स्थिति से अलग है जब डेटा स्वाभाविक रूप से बाध्य होता है; अति-सामान्यीकरण सापेक्ष अंतरों को कम कर सकता है। मशीन-लर्निंग अभ्यास में, विद्वान अक्सर इस बात पर जोर देते हैं कि डेटा विभाजन के बाद फीचर स्केलिंग लागू की जानी चाहिए ताकि डेटा लीकेज से बचा जा सके, और कुछ एल्गोरिदम (जैसे, वृक्ष-आधारित विधियाँ) मोनोटोनिक परिवर्तनों के प्रति अपरिवर्तनीय हैं, जिससे स्केलिंग कम आवश्यक हो जाती है।
सामान्यीकरण सैद्धांतिक सांख्यिकी में एक धुरी मात्रा की व्यापक धारणा से भी संबंधित है। एक धुरी मात्रा एक फलन है जिसका नमूनाकरण वितरण उन मापदंडों पर निर्भर नहीं करता है जिनके मान आप देखते हैं, और जब इसे अज्ञात के बिना गणना की जा सकती है, तो यह एक सहायक सांख्यिकी है। मानकीकरण अक्सर ऐसी धुरी मात्राओं की ओर ले जाता है, जिनका उपयोग परिकल्पना परीक्षण में किया जाता है।