मशीन लर्निंग में, हाइपरपैरामीटर ट्यूनिंग, जिसे हाइपरपैरामीटर ऑप्टिमाइज़ेशन भी कहा जाता है, एक सीखने के एल्गोरिदम के लिए इष्टतम हाइपरपैरामीटर का एक सेट चुनने की समस्या है। हाइपरपैरामीटर एक ऐसा पैरामीटर है जिसका मान सीखने की प्रक्रिया को नियंत्रित करता है और प्रशिक्षण शुरू होने से पहले इसे कॉन्फ़िगर किया जाना चाहिए, मॉडल पैरामीटर के विपरीत जो प्रशिक्षण के दौरान सीखे जाते हैं। लक्ष्य हाइपरपैरामीटर का वह सेट निर्धारित करना है जो एक इष्टतम मॉडल उत्पन्न करता है, किसी दिए गए डेटासेट पर पूर्व-परिभाषित लॉस फ़ंक्शन को कम करता है। उद्देश्य फ़ंक्शन हाइपरपैरामीटर का एक सेट लेता है और संबंधित लॉस लौटाता है, और सामान्यीकरण प्रदर्शन का अनुमान लगाने और चयन प्रक्रिया को निर्देशित करने के लिए अक्सर क्रॉस-वैलिडेशन का उपयोग किया जाता है।
हाइपरपैरामीटर ट्यूनिंग मॉडल प्रशिक्षण से अलग है। जबकि प्रशिक्षण Stochastic Gradient Descent Variants या Adam (Optimizer) जैसे ऑप्टिमाइज़ेशन एल्गोरिदम का उपयोग करके आंतरिक वज़न को समायोजित करता है, ट्यूनिंग उच्च स्तर पर काम करती है, जो Learning Rate Scheduling जैसे तत्वों, Neural network में परतों की संख्या, या Dropout की ताकत के लिए मान निर्धारित करती है। अच्छे प्रदर्शन को प्राप्त करने के लिए प्रभावी ट्यूनिंग आवश्यक है, क्योंकि खराब चुने गए हाइपरपैरामीटर प्रशिक्षण डेटा की गुणवत्ता या मॉडल आर्किटेक्चर की परिष्कारता की परवाह किए बिना अंडरफिटिंग या ओवरफिटिंग का कारण बन सकते हैं।
ग्रिड सर्च
हाइपरपैरामीटर ऑप्टिमाइज़ेशन के लिए पारंपरिक तरीका ग्रिड सर्च है, या एक पैरामीटर स्वीप, जो हाइपरपैरामीटर स्पेस के मैन्युअल रूप से निर्दिष्ट उपसमुच्चय के माध्यम से व्यापक रूप से खोज करता है। एक ग्रिड सर्च एल्गोरिदम एक प्रदर्शन मीट्रिक द्वारा निर्देशित होता है, जिसे आमतौर पर प्रशिक्षण सेट पर क्रॉस-वैलिडेशन या होल्ड-आउट वैलिडेशन सेट पर मूल्यांकन द्वारा मापा जाता है। चूंकि पैरामीटर स्पेस में वास्तविक-मूल्यवान या असीमित मान शामिल हो सकते हैं, मैन्युअल सीमाएं और असततकरण अक्सर आवश्यक होते हैं।
उदाहरण के लिए, एक विशिष्ट सॉफ्ट-मार्जिन सपोर्ट वेक्टर मशीन जिसमें RBF कर्नेल है, में कम से कम दो हाइपरपैरामीटर होते हैं: एक नियमितीकरण स्थिरांक C और एक कर्नेल हाइपरपैरामीटर γ। दोनों सतत हैं, इसलिए ग्रिड सर्च प्रत्येक के लिए मानों का एक परिमित सेट चुनता है, जैसे C ∈ {10, 100, 1000} और γ ∈ {0.1, 0.2, 0.5, 1.0}। यह फिर कार्टेशियन उत्पाद में प्रत्येक जोड़ी (C, γ) के साथ एक SVM को प्रशिक्षित करता है और प्रदर्शन का मूल्यांकन करता है। ग्रिड सर्च आयामीता के अभिशाप से ग्रस्त है, लेकिन यह अक्सर शर्मनाक रूप से समानांतर होता है क्योंकि हाइपरपैरामीटर सेटिंग्स स्वतंत्र होती हैं।
रैंडम सर्च
रैंडम सर्च हाइपरपैरामीटर संयोजनों को बेतरतीब ढंग से चुनकर व्यापक गणना को प्रतिस्थापित करता है। इसे असतत, सतत और मिश्रित स्थानों पर लागू किया जा सकता है। ग्रिड सर्च पर एक लाभ यह है कि रैंडम सर्च सतत हाइपरपैरामीटर के लिए कई अधिक मानों का पता लगा सकता है। यह ग्रिड सर्च से बेहतर प्रदर्शन कर सकता है, खासकर जब केवल कुछ ही हाइपरपैरामीटर अंतिम प्रदर्शन को महत्वपूर्ण रूप से प्रभावित करते हैं, एक स्थिति जिसे कम आंतरिक आयामीता के रूप में जाना जाता है। रैंडम सर्च भी शर्मनाक रूप से समानांतर है और नमूनाकरण वितरण निर्दिष्ट करके पूर्व ज्ञान को शामिल करने की अनुमति देता है। अपनी सरलता के बावजूद, यह नए हाइपरपैरामीटर ऑप्टिमाइज़ेशन विधियों की तुलना करने के लिए एक महत्वपूर्ण आधार रेखा बनी हुई है।
बायेसियन ऑप्टिमाइज़ेशन
बायेसियन ऑप्टिमाइज़ेशन शोर वाले ब्लैक-बॉक्स फ़ंक्शनों के लिए एक वैश्विक ऑप्टिमाइज़ेशन विधि है। हाइपरपैरामीटर ट्यूनिंग पर लागू, यह हाइपरपैरामीटर मानों को वैलिडेशन सेट पर मूल्यांकित उद्देश्य से मैप करने वाले फ़ंक्शन का एक संभाव्य मॉडल बनाता है। वर्तमान मॉडल के आधार पर आशाजनक कॉन्फ़िगरेशन का पुनरावृत्त रूप से मूल्यांकन करके और इसे अपडेट करके, बायेसियन ऑप्टिमाइज़ेशन का उद्देश्य ऐसे अवलोकन एकत्र करना है जो फ़ंक्शन और इसके इष्टतम के स्थान के बारे में जानकारी प्रकट करते हैं। यह अन्वेषण (अनिश्चित परिणामों वाले हाइपरपैरामीटर) और दोहन (इष्टतम के पास अपेक्षित हाइपरपैरामीटर) को संतुलित करता है। व्यवहार में, बायेसियन ऑप्टिमाइज़ेशन अक्सर प्रयोगों को चलाने से पहले उनकी गुणवत्ता के बारे में तर्क करने की क्षमता के कारण ग्रिड सर्च या रैंडम सर्च की तुलना में कम मूल्यांकन में बेहतर परिणाम प्राप्त करता है।
ग्रेडिएंट-आधारित ऑप्टिमाइज़ेशन
विशिष्ट सीखने के एल्गोरिदम के लिए, हाइपरपैरामीटर के संबंध में ग्रेडिएंट की गणना करना और ग्रेडिएंट डिसेंट का उपयोग करके उन्हें ऑप्टिमाइज़ करना संभव है। इन तकनीकों का पहला उपयोग न्यूरल नेटवर्क पर केंद्रित था, और विधियों को तब से सपोर्ट वेक्टर मशीन और लॉजिस्टिक रिग्रेशन जैसे मॉडलों तक बढ़ाया गया है। एक दृष्टिकोण स्वचालित विभेदन का उपयोग करके एक पुनरावृत्त ऑप्टिमाइज़ेशन एल्गोरिदम के चरणों को विभेदित करता है। हाल के काम में हाइपरग्रेडिएंट्स की गणना करने के लिए इम्प्लिसिट फ़ंक्शन प्रमेय का उपयोग किया जाता है और इनवर्स हेसियन का एक स्थिर सन्निकटन प्रस्तावित किया जाता है, जो स्थिर मेमोरी के साथ लाखों हाइपरपैरामीटर तक स्केलिंग करता है।
एक अन्य दृष्टिकोण सर्वोत्तम प्रतिक्रिया फ़ंक्शन का अनुमान लगाने के लिए एक हाइपरनेटवर्क को प्रशिक्षित करता है, जो असतत हाइपरपैरामीटर को संभाल सकता है। सेल्फ-ट्यूनिंग नेटवर्क हाइपरनेटवर्क के लिए एक कॉम्पैक्ट प्रतिनिधित्व चुनकर एक मेमोरी-कुशल संस्करण प्रदान करते हैं। हाल ही में, Δ-STN ने प्रशिक्षण को गति देने और सर्वोत्तम-प्रतिक्रिया जैकोबियन का बेहतर सन्निकटन देने के लिए हाइपरनेटवर्क को पुनः-पैरामीटराइज़ करके इसमें सुधार किया। ग्रेडिएंट-आधारित विधियां एक सतत विश्राम को अपनाकर असतत हाइपरपैरामीटर को भी ऑप्टिमाइज़ कर सकती हैं, जैसा कि न्यूरल आर्किटेक्चर सर्च में व्यापक रूप से उपयोग किया जाता है।
विकासवादी ऑप्टिमाइज़ेशन
विकासवादी ऑप्टिमाइज़ेशन शोर वाले ब्लैक-बॉक्स फ़ंक्शनों के वैश्विक ऑप्टिमाइज़ेशन के लिए एक पद्धति है, जो हाइपरपैरामीटर स्पेस की खोज के लिए विकासवादी एल्गोरिदम का उपयोग करती है। यह जैविक विकास से प्रेरित एक प्रक्रिया का पालन करता है: यादृच्छिक समाधानों की एक प्रारंभिक आबादी बनाएं (आमतौर पर 100+ हाइपरपैरामीटर टुपल्स), उनकी फिटनेस का मूल्यांकन करें (जैसे, 10-फोल्ड क्रॉस-वैलिडेशन सटीकता), उन्हें फिटनेस द्वारा रैंक करें, और फिर चयन, क्रॉसओवर और उत्परिवर्तन के माध्यम से एक नई आबादी उत्पन्न करें। यह पुनरावृत्त प्रक्रिया तब तक जारी रहती है जब तक एक रोक मानदंड पूरा नहीं हो जाता। विकासवादी विधियां मजबूत हैं और जटिल, गैर-विभेदनीय खोज स्थानों को संभाल सकती हैं, जिससे वे विविध Machine learning मॉडलों में हाइपरपैरामीटर ट्यूनिंग के लिए उपयुक्त हैं, जिनमें Deep learning और बड़े भाषा मॉडल में उपयोग किए जाने वाले शामिल हैं।
व्यावहारिक विचार
हाइपरपैरामीटर ट्यूनिंग Artificial intelligence प्रणालियों के विकास में एक महत्वपूर्ण कदम है। विधि का चुनाव कम्प्यूटेशनल बजट, हाइपरपैरामीटर स्पेस की आयामीता और मॉडल की प्रकृति पर निर्भर करता है। महंगे मॉडलों के लिए, जैसे कि Generative AI में उपयोग किए जाने वाले ट्रांसफॉर्मर, नमूना दक्षता के कारण बायेसियन ऑप्टिमाइज़ेशन को अक्सर प्राथमिकता दी जाती है। सरल मॉडलों के लिए या जब समानांतर संसाधन प्रचुर मात्रा में हों, रैंडम सर्च या ग्रिड सर्च पर्याप्त हो सकता है। ट्यूनिंग के लिए उपकरण और फ्रेमवर्क व्यापक रूप से उपलब्ध हैं, और अनुसंधान अधिक कुशल तरीकों में जारी है, जिनमें Batch Normalization और अन्य प्रशिक्षण तकनीकों के साथ एकीकृत होने वाले शामिल हैं।