मशीन लर्निंग में, हाइपरपैरामीटर एक ऐसा पैरामीटर है जिसे मॉडल की सीखने की प्रक्रिया के किसी भी कॉन्फ़िगर करने योग्य भाग को परिभाषित करने के लिए सेट किया जा सकता है। हाइपरपैरामीटर को या तो मॉडल हाइपरपैरामीटर के रूप में वर्गीकृत किया जाता है, जैसे कि तंत्रिका नेटवर्क की टोपोलॉजी और आकार, या एल्गोरिथम हाइपरपैरामीटर, जैसे कि सीखने की दर और ऑप्टिमाइज़र का बैच आकार। उन्हें पैरामीटर के विपरीत हाइपरपैरामीटर नाम दिया गया है, जो ऐसी विशेषताएं हैं जो मॉडल प्रशिक्षण के दौरान डेटा से सीखता है।
हाइपरपैरामीटर हर मॉडल या एल्गोरिथम के लिए आवश्यक नहीं होते हैं। कुछ सरल एल्गोरिदम, जैसे साधारण न्यूनतम वर्ग प्रतिगमन, को किसी की आवश्यकता नहीं होती है। हालाँकि, LASSO एल्गोरिथ्म, उदाहरण के लिए, साधारण न्यूनतम वर्गों में एक नियमितीकरण हाइपरपैरामीटर जोड़ता है जिसे प्रशिक्षण से पहले सेट किया जाना चाहिए। यहां तक कि मॉडल और एल्गोरिदम जिन्हें हाइपरपैरामीटर परिभाषित करने की सख्त आवश्यकता नहीं है, यदि ये सावधानी से नहीं चुने गए हैं तो सार्थक परिणाम नहीं दे सकते हैं। हाइपरपैरामीटर के लिए इष्टतम मानों की भविष्यवाणी करना हमेशा आसान नहीं होता है; कुछ हाइपरपैरामीटर का कोई सार्थक प्रभाव नहीं हो सकता है, या एक महत्वपूर्ण चर दूसरे के मान पर सशर्त हो सकता है। डेटा और कार्य के लिए उपयुक्त संयोजन खोजने के लिए अक्सर हाइपरपैरामीटर ट्यूनिंग की एक अलग प्रक्रिया की आवश्यकता होती है। मॉडल के प्रदर्शन में सुधार के साथ-साथ, शोधकर्ता अपने काम में मजबूती और प्रतिलिपि प्रस्तुत करने की क्षमता लाने के लिए हाइपरपैरामीटर का उपयोग कर सकते हैं, खासकर यदि यह उन मॉडलों का उपयोग करता है जिनमें यादृच्छिक संख्या पीढ़ी शामिल है।
विचार
मॉडल को प्रशिक्षित करने और परीक्षण करने में लगने वाला समय उसके हाइपरपैरामीटर की पसंद पर निर्भर हो सकता है। एक हाइपरपैरामीटर आमतौर पर सतत या पूर्णांक प्रकार का होता है, जिससे मिश्रित-प्रकार की अनुकूलन समस्याएं उत्पन्न होती हैं। कुछ हाइपरपैरामीटर का अस्तित्व दूसरों के मूल्य पर सशर्त होता है, उदाहरण के लिए, तंत्रिका नेटवर्क में प्रत्येक छिपी परत का आकार परतों की संख्या पर सशर्त हो सकता है। नतीजतन, हाइपरपैरामीटर पदानुक्रमित या सशर्त कॉन्फ़िगरेशन स्थान बना सकते हैं, जहां एक डिज़ाइन विकल्प यह निर्धारित करता है कि आगे कौन से हाइपरपैरामीटर प्रासंगिक हैं।
कठिन-सीखने योग्य पैरामीटर
उद्देश्य फलन आमतौर पर हाइपरपैरामीटर के संबंध में गैर-अवकलनीय होता है। परिणामस्वरूप, अधिकांश मामलों में, हाइपरपैरामीटर को ग्रेडिएंट डिसेंट जैसे ग्रेडिएंट-आधारित अनुकूलन विधियों का उपयोग करके नहीं सीखा जा सकता है, जो आमतौर पर मॉडल पैरामीटर सीखने के लिए नियोजित होते हैं। ये हाइपरपैरामीटर एक मॉडल प्रतिनिधित्व का वर्णन करते हैं जिसे सामान्य अनुकूलन विधियों द्वारा नहीं सीखा जा सकता है, लेकिन फिर भी हानि फलन को प्रभावित करते हैं। एक उदाहरण सपोर्ट वेक्टर मशीनों में त्रुटियों के लिए सहिष्णुता हाइपरपैरामीटर है।
अप्रशिक्षणीय पैरामीटर
कभी-कभी हाइपरपैरामीटर प्रशिक्षण डेटा से नहीं सीखे जा सकते क्योंकि वे आक्रामक रूप से मॉडल की क्षमता बढ़ाते हैं और हानि फलन को अवांछित न्यूनतम तक धकेल सकते हैं, जिससे डेटा में संरचना की समृद्धि को सही ढंग से मैप करने के बजाय डेटा के लिए ओवरफिटिंग होती है। उदाहरण के लिए, यदि एक प्रतिगमन मॉडल को फिट करने वाले बहुपद समीकरण की डिग्री को एक प्रशिक्षण योग्य पैरामीटर के रूप में माना जाता है, तो डिग्री तब तक बढ़ेगी जब तक कि मॉडल डेटा को पूरी तरह से फिट नहीं कर देता, जिससे कम प्रशिक्षण त्रुटि लेकिन खराब सामान्यीकरण प्रदर्शन होता है।
ट्यूनबिलिटी
अधिकांश प्रदर्शन भिन्नता का श्रेय केवल कुछ हाइपरपैरामीटर को दिया जा सकता है। किसी एल्गोरिथ्म, हाइपरपैरामीटर या इंटरैक्टिंग हाइपरपैरामीटर की ट्यूनबिलिटी इस बात का माप है कि इसे ट्यून करके कितना प्रदर्शन प्राप्त किया जा सकता है। LSTM के लिए, जबकि सीखने की दर और उसके बाद नेटवर्क का आकार इसके सबसे महत्वपूर्ण हाइपरपैरामीटर हैं, बैचिंग और गति का इसके प्रदर्शन पर कोई महत्वपूर्ण प्रभाव नहीं पड़ता है। हालांकि कुछ शोधों ने हजारों में मिनी-बैच आकार के उपयोग की वकालत की है, अन्य कार्यों ने 2 से 32 के बीच मिनी-बैच आकार के साथ सर्वश्रेष्ठ प्रदर्शन पाया है।
मजबूती
सीखने में एक अंतर्निहित स्टोकैस्टिकिटी सीधे तौर पर यह दर्शाती है कि अनुभवजन्य हाइपरपैरामीटर प्रदर्शन आवश्यक रूप से इसका वास्तविक प्रदर्शन नहीं है। जो विधियां हाइपरपैरामीटर, यादृच्छिक बीज, या यहां तक कि एक ही एल्गोरिथ्म के विभिन्न कार्यान्वयन में सरल परिवर्तनों के प्रति मजबूत नहीं हैं, उन्हें महत्वपूर्ण सरलीकरण और सुदृढ़ीकरण के बिना मिशन-महत्वपूर्ण नियंत्रण प्रणालियों में एकीकृत नहीं किया जा सकता है। बदले में, हाइपरपैरामीटर विकल्प न केवल भविष्य कहनेवाला प्रदर्शन को प्रभावित कर सकते हैं, बल्कि बदली या शोर इनपुट स्थितियों के तहत मॉडल के आउटपुट की मजबूती और स्थिरता को भी प्रभावित कर सकते हैं। विशेष रूप से, सुदृढीकरण सीखने वाले एल्गोरिदम को बड़ी संख्या में यादृच्छिक बीजों पर अपने प्रदर्शन को मापने और हाइपरपैरामीटर की पसंद के प्रति उनकी संवेदनशीलता को मापने की आवश्यकता होती है। कम संख्या में यादृच्छिक बीजों के साथ उनका मूल्यांकन उच्च विचरण के कारण प्रदर्शन को पर्याप्त रूप से कैप्चर नहीं करता है। कुछ सुदृढीकरण सीखने के तरीके, जैसे DDPG (डीप डेटर्मिनिस्टिक पॉलिसी ग्रेडिएंट), हाइपरपैरामीटर विकल्पों के प्रति दूसरों की तुलना में अधिक संवेदनशील होते हैं।
अनुकूलन
हाइपरपैरामीटर अनुकूलन हाइपरपैरामीटर का एक टपल ढूंढता है जो एक इष्टतम मॉडल प्रदान करता है जो दिए गए परीक्षण डेटा पर पूर्वनिर्धारित हानि फलन को कम करता है। उद्देश्य फलन हाइपरपैरामीटर का एक टपल लेता है और संबंधित हानि लौटाता है। आमतौर पर ये विधियां ग्रेडिएंट आधारित नहीं होती हैं और इसके बजाय व्युत्पन्न-मुक्त अनुकूलन या ब्लैक बॉक्स अनुकूलन से अवधारणाओं को लागू करती हैं। सामान्य तकनीकों में ग्रिड खोज, यादृच्छिक खोज और बायेसियन अनुकूलन शामिल हैं, हालांकि स्रोत इन विवरणों को निर्दिष्ट नहीं करता है।
प्रतिलिपि प्रस्तुत करने की क्षमता
हाइपरपैरामीटर ट्यूनिंग के अलावा, मशीन लर्निंग में मापदंडों और परिणामों को संग्रहीत करना और व्यवस्थित करना, और यह सुनिश्चित करना शामिल है कि वे प्रतिलिपि प्रस्तुत करने योग्य हैं। इस उद्देश्य के लिए एक मजबूत बुनियादी ढांचे की अनुपस्थिति में, शोध कोड अक्सर तेजी से विकसित होता है और बहीखाता और प्रतिलिपि प्रस्तुत करने की क्षमता जैसे आवश्यक पहलुओं से समझौता करता है। मशीन लर्निंग के लिए ऑनलाइन सहयोग प्लेटफॉर्म वैज्ञानिकों को प्रयोगों, डेटा और एल्गोरिदम को स्वचालित रूप से साझा करने, व्यवस्थित करने और चर्चा करने की अनुमति देकर और भी आगे बढ़ते हैं। डीप लर्निंग मॉडल के लिए प्रतिलिपि प्रस्तुत करने की क्षमता विशेष रूप से कठिन हो सकती है। उदाहरण के लिए, शोध से पता चला है कि डीप लर्निंग मॉडल यादृच्छिक संख्या जनरेटर के यादृच्छिक बीज चयन पर भी बहुत अधिक निर्भर करते हैं।
यह भी देखें
- हाइपर-ह्यूरिस्टिक
- प्रतिकृति संकट