रेगुलराइज़ेशन उन तकनीकों के एक व्यापक परिवार को संदर्भित करता है जिनका उपयोग मशीन-लर्निंग में ओवरफिटिंग को कम करने के लिए किया जाता है, ताकि मॉडल को प्रशिक्षण डेटा पर बहुत सटीक रूप से फिट होने से रोका जा सके, जिससे वह नए डेटा पर बेहतर सामान्यीकरण कर सके। अधिकांश रेगुलराइज़ेशन विधियाँ यह नहीं बदलतीं कि मॉडल क्या सीखने की कोशिश कर रहा है, बल्कि वे बदलती हैं कि उसे सीखने की अनुमति कैसे है - या तो जटिलता को सीधे दंडित करके, प्रशिक्षण के दौरान नियंत्रित शोर इंजेक्ट करके, या मॉडल को प्रशिक्षण सेट की विशिष्टताओं को याद करने का मौका मिलने से पहले प्रशिक्षण रोककर।
भार-आधारित विधियाँ
सबसे पुराना और सबसे सीधा दृष्टिकोण मॉडल के भार के आकार के आधार पर लॉस-फंक्शन में एक दंड पद जोड़ता है, जो ऑप्टिमाइज़र को छोटे, सरल भार मानों को प्राथमिकता देने के लिए प्रोत्साहित करता है, जब तक कि डेटा बड़े मानों को दृढ़ता से उचित न ठहराए। L2 रेगुलराइज़ेशन, जिसे वेट डेके या रिज रेगुलराइज़ेशन भी कहा जाता है, वर्गित भारों के योग को दंडित करता है और सभी भारों को शून्य की ओर सुचारू रूप से सिकोड़ता है। L1 रेगुलराइज़ेशन निरपेक्ष भार मानों के योग को दंडित करता है और कुछ भारों को ठीक शून्य पर धकेल देता है, जिससे प्रभावी रूप से फीचर चयन होता है। आधुनिक डीप लर्निंग में, वेट डेके आमतौर पर सीधे ऑप्टिमाइज़र के अंदर लागू किया जाता है, उदाहरण के लिए Adam के संशोधन के रूप में जिसे AdamW कहा जाता है, न कि लॉस में जोड़े गए स्पष्ट पद के रूप में।
संरचनात्मक और स्टोकेस्टिक विधियाँ
ड्रॉपआउट, जिसे जेफ्री हिंटन के समूह ने लगभग 2012 में पेश किया और 2014 के व्यापक रूप से उद्धृत पेपर में औपचारिक रूप दिया, प्रत्येक प्रशिक्षण चरण के दौरान न्यूरल नेटवर्क की इकाइयों के एक अंश को बेतरतीब ढंग से अक्षम कर देता है, जिससे नेटवर्क को किसी एक इकाई या इकाइयों के निश्चित संयोजन पर अत्यधिक निर्भर रहने से रोका जाता है और प्रभावी रूप से साझा भार वाले सबनेटवर्कों के एक अंतर्निहित समूह को प्रशिक्षित किया जाता है। बैच नॉर्मलाइज़ेशन और इसके उत्तराधिकारी, हालांकि मुख्य रूप से प्रशिक्षण को स्थिर और तेज करने के लिए पेश किए गए थे, प्रशिक्षण के दौरान प्रत्येक परत के इनपुट में शोर जोड़कर एक रेगुलराइज़िंग दुष्प्रभाव भी रखते हैं। डेटा ऑग्मेंटेशन, जो प्रशिक्षण उदाहरणों की संशोधित प्रतियाँ बनाता है, जैसे घुमाए गए या क्रॉप किए गए चित्र, या पैराफ्रेज़ किया गया पाठ, प्रशिक्षण-डेटा की प्रभावी विविधता को कृत्रिम रूप से बढ़ाता है और मॉडल के सतही, गैर-सामान्यीकरणीय पैटर्न को पकड़ने की संभावना को कम करता है।
अर्ली स्टॉपिंग और मॉडल चयन
अर्ली स्टॉपिंग प्रशिक्षण को तब रोक देती है जब एक अलग रखे गए वैलिडेशन सेट पर प्रदर्शन में सुधार होना बंद हो जाता है, भले ही प्रशिक्षण लॉस गिरता रहे, जो सीधे प्रशिक्षण और वैलिडेशन प्रदर्शन के बीच के अंतर को लक्षित करता है जो ओवरफिटिंग को परिभाषित करता है। इसके लिए प्रशिक्षण के दौरान केवल अंत में नहीं, बल्कि पूरे समय वैलिडेशन लॉस की निगरानी करना आवश्यक है, और यह सबसे सरल और सबसे व्यापक रूप से उपयोग की जाने वाली रेगुलराइज़ेशन तकनीकों में से एक है, क्योंकि इसमें मॉडल या लॉस फंक्शन में कोई बदलाव नहीं करना पड़ता, केवल एक रोकने का नियम चाहिए।
बड़े मॉडलों में रेगुलराइज़ेशन
कुछ हद तक प्रति-सहज रूप से, सबसे बड़े लार्ज-लैंग्वेज-मॉडल और डीप-लर्निंग सिस्टम अक्सर छोटे मॉडलों की तुलना में हल्का स्पष्ट रेगुलराइज़ेशन उपयोग करते हैं, क्योंकि सीमित संख्या में पास के साथ विशाल, विविध प्रशिक्षण-डेटा पर प्रशिक्षण रेगुलराइज़ेशन का एक प्राकृतिक रूप प्रदान करता है: मॉडल शायद ही कभी, यदि कभी, एक ही उदाहरण को दो बार देखता है, जिससे उसे याद करने का बहुत कम अवसर मिलता है। ड्रॉपआउट विशेष रूप से बड़े पैमाने के ट्रांसफॉर्मर प्रीट्रेनिंग में अक्सर कम या पूरी तरह से हटा दिया जाता है, हालांकि यह छोटे पैमाने के फाइन-ट्यूनिंग चरणों के दौरान आम बना रहता है, जहाँ एक संकीर्ण डेटासेट पर ओवरफिटिंग एक अधिक वास्तविक जोखिम है।