डबल डिसेंट मशीन लर्निंग में देखी जाने वाली एक घटना है, जहाँ मॉडल की सामान्यीकरण त्रुटि मॉडल जटिलता या पैरामीटर संख्या बढ़ने पर एक गैर-मोनोटोनिक पैटर्न का अनुसरण करती है। शास्त्रीय दृष्टिकोण में, परीक्षण त्रुटि जटिलता के साथ एक बिंदु तक घटती है, फिर अति-अनुकूलन के कारण बढ़ती है। डबल डिसेंट एक दूसरे चरण का वर्णन करता है: प्रारंभिक वृद्धि के बाद, त्रुटि फिर से घटती है जब मॉडल अत्यधिक अति-पैरामीटरयुक्त हो जाता है, अक्सर पहले के न्यूनतम के बराबर या उससे बेहतर स्तर तक पहुँचती है। यह व्यवहार पारंपरिक सांख्यिकीय शिक्षण सिद्धांत को चुनौती देता है और यह समझने के लिए महत्वपूर्ण निहितार्थ रखता है कि बड़े तंत्रिका नेटवर्क अच्छी तरह से सामान्यीकरण क्यों करते हैं।
यह अवधारणा 2010 के दशक के अंत में अनुभवजन्य अध्ययनों और सैद्धांतिक विश्लेषणों के माध्यम से प्रमुखता प्राप्त कर गई। शोधकर्ताओं ने देखा कि आधुनिक गहन शिक्षण मॉडल, जिनमें अक्सर प्रशिक्षण नमूनों से अधिक पैरामीटर होते हैं, अपेक्षित विनाशकारी अति-अनुकूलन से ग्रस्त नहीं होते। इसके बजाय, वे एक "डबल डिसेंट" वक्र प्रदर्शित करते हैं, जिसमें इंटरपोलेशन थ्रेशोल्ड - वह बिंदु जहाँ मॉडल मुश्किल से प्रशिक्षण डेटा को फिट करता है - पर त्रुटि में एक शिखर होता है, उसके बाद अति-पैरामीटरयुक्त क्षेत्र में गिरावट होती है। इस खोज ने मॉडल क्षमता, नियमितीकरण और Machine learning में प्रेरक पूर्वाग्रहों की भूमिका के बारे में बहस को नया रूप दिया है।
ऐतिहासिक संदर्भ
शास्त्रीय पूर्वाग्रह-विचरण समझौता, सांख्यिकीय शिक्षण की आधारशिला, यह मानता है कि मॉडल त्रुटि पूर्वाग्रह (सरलीकरण धारणाओं से त्रुटि) और विचरण (प्रशिक्षण डेटा के प्रति संवेदनशीलता से त्रुटि) का योग है। जैसे-जैसे जटिलता बढ़ती है, पूर्वाग्रह घटता है लेकिन विचरण बढ़ता है, जिससे यू-आकार का परीक्षण त्रुटि वक्र बनता है। यह दृष्टिकोण दशकों तक हावी रहा, जिसने फीचर चयन और नियमितीकरण जैसी प्रथाओं को प्रभावित किया। हालाँकि, यह मानता था कि मॉडल डेटा के सापेक्ष अति-पैरामीटरयुक्त हैं, एक ऐसी स्थिति जो आधुनिक गहन शिक्षण में अब मौजूद नहीं है।
गैर-शास्त्रीय व्यवहार के शुरुआती संकेत 1990 के दशक में तंत्रिका नेटवर्क और निर्णय वृक्षों के अध्ययनों में दिखाई दिए, लेकिन इन्हें बड़े पैमाने पर अनदेखा किया गया। "डबल डिसेंट" शब्द को 2018-2019 के आसपास mikhail belkin और peter bartlett सहित शोधकर्ताओं द्वारा लोकप्रिय बनाया गया, जिन्होंने रैखिक प्रतिगमन से लेकर गहन नेटवर्क तक विभिन्न मॉडलों में अनुभवजन्य साक्ष्य प्रदान किए। उनके काम ने दिखाया कि त्रुटि में शिखर इंटरपोलेशन थ्रेशोल्ड के पास होता है, और इस बिंदु से परे पैरामीटर जोड़ने से सामान्यीकरण में सुधार हो सकता है, जो शास्त्रीय अंतर्ज्ञान के विपरीत है।
सैद्धांतिक व्याख्याएँ
डबल डिसेंट को समझाने के लिए कई सिद्धांत प्रस्तावित किए गए हैं। एक प्रमुख व्याख्या में "सौम्य अति-अनुकूलन" की अवधारणा शामिल है, जहाँ मॉडल नए डेटा पर सामान्यीकरण को नुकसान पहुँचाए बिना प्रशिक्षण डेटा में शोर को फिट कर सकते हैं। उच्च-आयामी सेटिंग्स में, कुछ पैरामीटर विन्यास शून्य प्रशिक्षण त्रुटि प्राप्त करते हैं जबकि कम परीक्षण त्रुटि बनाए रखते हैं, प्रभावी रूप से शोर को औसत करते हैं। यह तंत्रिका नेटवर्क के "कर्नेल क्षेत्र" से संबंधित है, जहाँ अति-पैरामीटरयुक्त मॉडल अनुकूल गुणों वाले कर्नेल विधियों की तरह व्यवहार करते हैं।
काम की एक और पंक्ति अनुकूलन परिदृश्य पर केंद्रित है। अति-पैरामीटरयुक्त मॉडलों में, ग्रेडिएंट डिसेंट ऐसे समाधान खोजता है जो न केवल कम-त्रुटि वाले होते हैं बल्कि कुछ अंतर्निहित पूर्वाग्रह भी रखते हैं, जैसे न्यूनतम मानक या सपाट न्यूनतम। ये पूर्वाग्रह शास्त्रीय सिद्धांत द्वारा भविष्यवाणी से बेहतर सामान्यीकरण की ओर ले जा सकते हैं। इसके अतिरिक्त, इंटरपोलेशन थ्रेशोल्ड पर शिखर को एक चरण संक्रमण के रूप में देखा जा सकता है, जहाँ मॉडल अति-अनुकूलन से अति-अनुकूलन में संक्रमण करता है, लेकिन फिर एक ऐसे क्षेत्र में प्रवेश करता है जहाँ अतिरिक्त क्षमता चिकनी समाधानों की अनुमति देती है।
Aleksander Madry और अन्य द्वारा शोध ने इस संदर्भ में प्रतिकूल मजबूती की जाँच की है, यह पाते हुए कि डबल डिसेंट मजबूती मेट्रिक्स में भी दिखाई दे सकता है। सैद्धांतिक कार्य अक्सर सटीक परिणाम प्राप्त करने के लिए सरलीकृत सेटिंग्स पर निर्भर करता है, जैसे यादृच्छिक सुविधाओं वाले रैखिक मॉडल। इन विश्लेषणों ने दिखाया है कि वक्र का आकार सिग्नल-से-शोर अनुपात, डेटा के वितरण और उपयोग किए गए विशिष्ट अनुकूलन एल्गोरिदम जैसे कारकों पर निर्भर करता है।
अनुभवजन्य अवलोकन
डबल डिसेंट को मॉडल और कार्यों की एक विस्तृत श्रृंखला में देखा गया है। Deep learning में Neural network आर्किटेक्चर के साथ, शोधकर्ताओं ने छवि वर्गीकरण, प्राकृतिक भाषा प्रसंस्करण और अन्य डोमेन में इस घटना का दस्तावेजीकरण किया है। उदाहरण के लिए, तंत्रिका नेटवर्क की चौड़ाई (प्रति परत इकाइयों की संख्या) बढ़ाने से अक्सर एक डबल डिसेंट वक्र उत्पन्न होता है, जिसमें एक निश्चित चौड़ाई पर सत्यापन त्रुटि में शिखर होता है, उसके बाद चौड़ाई और बढ़ने पर सुधार होता है। इसी तरह, प्रशिक्षण युगों की संख्या बढ़ाने से एक संबंधित प्रभाव प्रदर्शित हो सकता है, जिसे कभी-कभी "युग-वार डबल डिसेंट" कहा जाता है।
यह घटना तंत्रिका नेटवर्क तक सीमित नहीं है। इसे रैंडम फॉरेस्ट, सपोर्ट वेक्टर मशीन और यहाँ तक कि बहुपद सुविधाओं वाले सरल रैखिक मॉडल में भी देखा गया है। सभी मामलों में, कुंजी यह है कि मॉडल में प्रशिक्षण डेटा को इंटरपोलेट करने की पर्याप्त क्षमता होती है, और शिखर उस बिंदु पर होता है जहाँ इंटरपोलेशन पहली बार संभव होता है। इस बिंदु से परे, मॉडल ऐसे समाधान पा सकता है जो इंटरपोलेटिंग और चिकनी दोनों होते हैं, जिससे कम परीक्षण त्रुटि होती है।
व्यावहारिक निहितार्थों में मॉडल चयन के लिए मार्गदर्शन शामिल है। हमेशा सरल मॉडल पसंद करने के बजाय, चिकित्सकों को बहुत बड़े मॉडल का उपयोग करने से लाभ हो सकता है, बशर्ते उन्हें उचित रूप से प्रशिक्षित किया जाए। इसने Large language model जैसे बड़े पैमाने के मॉडल के विकास को प्रभावित किया है, जो अक्सर बड़े पैमाने पर अति-पैरामीटरयुक्त होते हैं फिर भी अच्छी तरह से सामान्यीकरण करते हैं। Dropout, Batch Normalization और Weight Initialization जैसी तकनीकें शिखर के स्थान को स्थानांतरित कर सकती हैं, लेकिन मूल डबल डिसेंट व्यवहार बना रहता है।
आधुनिक एआई से संबंध
डबल डिसेंट आधुनिक Artificial intelligence प्रणालियों की सफलता को समझने के लिए केंद्रीय है। Transformer (architecture) जैसे मॉडल, जो Generative AI में उपयोग किए जाते हैं और OpenAI, Anthropic और Google DeepMind जैसे संगठनों द्वारा विकसित किए गए हैं, अक्सर अरबों पैरामीटर होते हैं और विशाल डेटासेट पर प्रशिक्षित होते हैं। अत्यधिक अति-पैरामीटरकरण के बावजूद सामान्यीकरण करने की उनकी क्षमता डबल डिसेंट की प्रत्यक्ष अभिव्यक्ति है। यह घटना इन मॉडलों में देखे गए स्केलिंग कानूनों से भी संबंधित है, जहाँ प्रदर्शन अधिक पैरामीटर और डेटा के साथ पूर्वानुमानित रूप से सुधरता है।
Deep learning फ्रेमवर्क और हार्डवेयर के संदर्भ में, डबल डिसेंट AWS Trainium और Google Cloud TPU जैसे विशेष एक्सेलेरेटर के उपयोग को प्रेरित करता है, जो बहुत बड़े मॉडल के प्रशिक्षण को सक्षम करते हैं। यह Model Pruning और Data Augmentation पर शोध को भी सूचित करता है, क्योंकि ये तकनीकें इंटरपोलेशन थ्रेशोल्ड और त्रुटि वक्र के आकार को प्रभावित कर सकती हैं। डबल डिसेंट को समझने से शोधकर्ताओं को आर्किटेक्चर और प्रशिक्षण प्रक्रियाओं को डिजाइन करने में मदद मिलती है जो अति-पैरामीटरकरण के लाभों का दोहन करते हैं जबकि शिखर से बचते हैं।
खुले प्रश्न और भविष्य की दिशाएँ
महत्वपूर्ण प्रगति के बावजूद, डबल डिसेंट के कई पहलू अनसुलझे हैं। दूसरे डिसेंट की घटना की सटीक स्थितियाँ पूरी तरह से विशेषता नहीं हैं, और सैद्धांतिक परिणाम अक्सर उन धारणाओं पर निर्भर करते हैं जो व्यवहार में सही नहीं हो सकती हैं। इस बात पर चल रही बहस है कि क्या डबल डिसेंट एक सार्वभौमिक घटना है या विशिष्ट डेटा वितरण और मॉडल वर्गों के लिए विशिष्ट है। शोधकर्ता अन्य घटनाओं से संबंधों की भी खोज कर रहे हैं, जैसे लॉटरी टिकट परिकल्पना और Curriculum Learning की भूमिका।
भविष्य के काम का उद्देश्य एकीकृत सिद्धांतों को विकसित करना है जो शास्त्रीय और आधुनिक दोनों व्यवहारों की व्याख्या करते हैं, संभावित रूप से मॉडल डिजाइन के लिए नए सिद्धांतों की ओर ले जाते हैं। 2020 के दशक के मध्य तक, डबल डिसेंट शोध का एक सक्रिय क्षेत्र बना हुआ है, जिसमें सांख्यिकीय शिक्षण सिद्धांत, अनुकूलन और एआई प्रणालियों के व्यावहारिक परिनियोजन के लिए निहितार्थ हैं। यह घटना इस धारणा को चुनौती देती है कि सरल मॉडल हमेशा बेहतर होते हैं, यह सुझाव देते हुए कि जटिलता और सामान्यीकरण के बीच संबंध पहले की तुलना में अधिक सूक्ष्म है।