अंग्रेज़ी से अनुवादित

क्रॉस-एंट्रॉपी विधि (CEM) एक पुनरावृत्तीय स्टोकेस्टिक अनुकूलन तकनीक है, जिसका उपयोग दुर्लभ-घटना अनुमान और संयोजनात्मक या सतत अनुकूलन के लिए किया जाता है, जो महत्व नमूनाकरण और उत्कृष्ट नमूनों पर आधारित पैरामीटर अद्यतन का उपयोग करती है।

क्रॉस-एन्ट्रॉपी विधि (CEM) कठिन अनुकूलन और दुर्लभ-घटना अनुमान समस्याओं को हल करने के लिए एक सामान्य-उद्देश्य मोंटे कार्लो तकनीक है। इसे 1997 में रेउवेन रुबिनस्टीन द्वारा दुर्लभ घटनाओं की संभावनाओं का अनुमान लगाने की एक विधि के रूप में प्रस्तुत किया गया था, और जल्द ही इसे संयोजनात्मक और सतत अनुकूलन तक विस्तारित किया गया। यह विधि एक पैरामीट्रीकृत प्रायिकता वितरण से यादृच्छिक नमूने उत्पन्न करती है, उनका मूल्यांकन करती है, और सर्वोत्तम प्रदर्शन करने वाले नमूनों, जिन्हें एलीट सेट कहा जाता है, पर ध्यान केंद्रित करने के लिए वितरण मापदंडों को अद्यतन करती है। यह दृष्टिकोण उन समस्याओं के लिए विशेष रूप से प्रभावी है जहाँ उद्देश्य फलन शोरगुल वाला, अवकलनीय नहीं, या कई स्थानीय इष्टतम वाला होता है।

CEM का मूल विचार नमूनाकरण वितरण और एक आदर्श वितरण के बीच क्रॉस-एन्ट्रॉपी को न्यूनतम करना है, जो सभी प्रायिकता द्रव्यमान को इष्टतम समाधान पर रखता है। व्यवहार में, यह दो चरणों को बार-बार करके प्राप्त किया जाता है: वर्तमान वितरण से नमूनाकरण, और एलीट नमूनों के अधिकतम संभावना अनुमान का उपयोग करके वितरण को अद्यतन करना। यह विधि लागू करने में सरल है, कुछ हाइपरपैरामीटर की आवश्यकता होती है, और अक्सर तेजी से अभिसरण करती है, जिससे यह सुदृढीकरण सीखने, रोबोटिक्स, और संचालन अनुसंधान जैसे क्षेत्रों में एक लोकप्रिय विकल्प बन जाती है।

एल्गोरिथमिक ढांचा

क्रॉस-एन्ट्रॉपी विधि एक पुनरावृत्त लूप में काम करती है। प्रारंभ में, समाधान स्थान पर एक प्रायिकता वितरण (अक्सर एक बहुचर गाऊसी या एक श्रेणीबद्ध वितरण) परिभाषित किया जाता है। प्रत्येक पुनरावृत्ति पर, उम्मीदवार समाधानों का एक बैच इस वितरण से खींचा जाता है। प्रत्येक उम्मीदवार का मूल्यांकन एक स्कोरिंग फलन का उपयोग करके किया जाता है, और शीर्ष-प्रदर्शन अंश (आमतौर पर 10% से 20%) को एलीट सेट के रूप में चुना जाता है। फिर वितरण मापदंडों को इन एलीट नमूनों में फिट करने के लिए अद्यतन किया जाता है, आमतौर पर गाऊसी वितरण के लिए नमूना माध्य और प्रसरण की गणना करके या श्रेणीबद्ध वितरण के लिए अनुभवजन्य आवृत्तियों की गणना करके।

समय से पहले अभिसरण को रोकने के लिए, एक स्मूथिंग पैरामीटर अक्सर पेश किया जाता है, जो नए मापदंडों को पिछले वाले के साथ मिश्रित करता है। यह स्मूथिंग अन्वेषण को बनाए रखने में मदद करता है और स्थानीय इष्टतम में फंसने से बचाता है। यह प्रक्रिया तब तक दोहराई जाती है जब तक कि एक रोक मानदंड पूरा नहीं होता, जैसे कि पुनरावृत्तियों की अधिकतम संख्या या सर्वोत्तम स्कोर में नगण्य परिवर्तन।

मशीन लर्निंग में अनुप्रयोग

मशीन लर्निंग में, CEM का उपयोग हाइपरपैरामीटर अनुकूलन, तंत्रिका वास्तुकला खोज, और सुदृढीकरण सीखने के संदर्भों में नीतियों को प्रशिक्षित करने के लिए किया गया है। उदाहरण के लिए, गहन सीखने में, CEM बैकप्रोपेगेशन के बिना एक छोटे तंत्रिका नेटवर्क के वजन को अनुकूलित कर सकता है, जो तब उपयोगी होता है जब ग्रेडिएंट उपलब्ध नहीं होते या महंगे होते हैं। इसे बड़े भाषा मॉडल फाइन-ट्यूनिंग के लिए असतत प्रॉम्प्ट अनुकूलन में भी लागू किया गया है, जहाँ खोज स्थान संयोजनात्मक होता है।

कृत्रिम बुद्धिमत्ता अनुसंधान में, CEM की तुलना अक्सर विकासवादी रणनीतियों और एसजीडी प्रकारों से की जाती है। ग्रेडिएंट-आधारित विधियों के विपरीत, CEM को उद्देश्य के अवकलनीय होने की आवश्यकता नहीं होती, जिससे यह ब्लैक-बॉक्स अनुकूलन के लिए उपयुक्त होता है। इसे रोबोटिक्स में प्रक्षेपवक्र अनुकूलन के लिए और स्वायत्त-ड्राइविंग प्रणालियों में पैरामीटर ट्यूनिंग के लिए उपयोग किया गया है।

दुर्लभ-घटना अनुमान से संबंध

CEM का मूल प्रेरणा दुर्लभ घटनाओं की संभावना का अनुमान लगाना था, जैसे कि प्रणाली विफलताएँ या चरम वित्तीय नुकसान। इस संदर्भ में, विधि प्रसरण को कम करने के लिए महत्व नमूनाकरण का उपयोग करती है। एल्गोरिथम अनुकूली रूप से एक नमूनाकरण वितरण का निर्माण करता है जो रुचि के क्षेत्र पर जोर देता है, जिससे निष्कपट मोंटे कार्लो की तुलना में बहुत कम नमूनों के साथ सटीक अनुमान की अनुमति मिलती है। यह दोहरा उपयोग - अनुकूलन और अनुमान - एक ही गणितीय आधार से उत्पन्न होता है: नमूनाकरण वितरण और एक इष्टतम महत्व नमूनाकरण वितरण के बीच कुल्बैक-लाइब्लर विचलन को न्यूनतम करना।

विस्तार और प्रकार

CEM के कई विस्तार विकसित किए गए हैं। सतत संस्करण गाऊसी या गाऊसी-मिश्रण वितरण का उपयोग करता है, जबकि असतत संस्करण यात्रा विक्रेता समस्या जैसी संयोजनात्मक समस्याओं को संभालता है। एक उल्लेखनीय प्रकार बेहतर क्रॉस-एन्ट्रॉपी विधि है, जो अद्यतनों को स्थिर करने के लिए पिछले एलीट नमूनों की स्मृति को शामिल करती है। एक और विस्तार मॉडल-आधारित सुदृढीकरण सीखने में CEM का उपयोग है, जहाँ यह एक सीखे गए विश्व मॉडल पर अनुक्रम को अनुकूलित करके क्रियाओं की योजना बनाता है। यह दृष्टिकोण हाल के गहन सुदृढीकरण सीखने एल्गोरिथमों में लोकप्रिय बनाया गया है, जैसे कि मॉडल-आधारित नीति अनुकूलन (MBPO) ढांचा।

CEM को पाठ्यक्रम सीखने के साथ भी जोड़ा गया है, जहाँ नमूनों की कठिनाई धीरे-धीरे बढ़ाई जाती है, और डेटा संवर्धन के साथ मजबूत अनुकूलन के लिए। बायेसियन अनुकूलन में, CEM एक अधिग्रहण फलन अनुकूलक के रूप में काम कर सकता है।

व्यावहारिक विचार

CEM लागू करते समय, वितरण परिवार का चयन और एलीट अंश महत्वपूर्ण होते हैं। बहुत छोटा एलीट अंश समय से पहले अभिसरण का कारण बन सकता है, जबकि बहुत बड़ा अंश प्रगति को धीमा कर देता है। स्मूथिंग पैरामीटर, जो अक्सर 0.5 और 0.9 के बीच सेट होता है, अन्वेषण और दोहन को संतुलित करता है। उच्च-आयामी समस्याओं के लिए, प्रति पुनरावृत्ति नमूनों की संख्या तदनुसार बढ़नी चाहिए, जो कम्प्यूटेशनल रूप से महंगा हो सकता है। इन चुनौतियों के बावजूद, CEM की सरलता और मजबूती ने इसे अनुकूलन टूलबॉक्स में एक प्रमुख बना दिया है।

व्यवहार में, CEM अक्सर शोध पत्रों में एक आधार रेखा के रूप में उपयोग किया जाता है, और कई बेंचमार्क समस्याओं पर इसका प्रदर्शन बायेसियन अनुकूलन जैसी अधिक जटिल विधियों के बराबर होता है। इसे कई ओपन-सोर्स पुस्तकालयों में लागू किया गया है, जिसमें पायथन के लिए cma पैकेज शामिल है, हालाँकि क्लासिक CEM CMA-ES (सहप्रसरण मैट्रिक्स अनुकूलन विकासवादी रणनीति) से अलग है, जो एक संबंधित लेकिन अलग एल्गोरिथम है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:optimization·monte-carlo·stochastic-search·machine-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 14 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास