अंग्रेज़ी से अनुवादित

एक लॉस फंक्शन मॉडल की भविष्यवाणियों और उसके वास्तविक लक्ष्यों के बीच अंतर का गणितीय माप है, जिसे ग्रेडिएंट डिसेंट जैसे प्रशिक्षण एल्गोरिदम कम करने के लिए काम करते हैं।

एक लॉस फ़ंक्शन, जिसे कॉस्ट फ़ंक्शन या ऑब्जेक्टिव फ़ंक्शन भी कहा जाता है, एक गणितीय फ़ंक्शन है जो किसी मॉडल की भविष्यवाणियों और उन वास्तविक लक्ष्य मानों के बीच के अंतर को मापता है जिनसे वह मेल खाने की कोशिश कर रहा है। मशीन-लर्निंग मॉडल को प्रशिक्षित करना, लगभग सभी मामलों में, उसके मापदंडों को समायोजित करने की प्रक्रिया है ताकि इस फ़ंक्शन का आउटपुट जितना संभव हो उतना छोटा हो, आमतौर पर ग्रेडिएंट-डिसेंट द्वारा निर्देशित होता है जो बैकप्रोपेगेशन के माध्यम से गणना किए गए ग्रेडिएंट्स पर आधारित होता है।

सामान्य रूप

प्रतिगमन कार्यों के लिए, जहाँ लक्ष्य एक सतत संख्या होती है, माध्य वर्ग त्रुटि, यानी भविष्यवाणियों और लक्ष्यों के बीच वर्ग अंतरों का औसत, सबसे व्यापक रूप से उपयोग किया जाने वाला लॉस है, जो बड़ी त्रुटियों को छोटी त्रुटियों की तुलना में असमान रूप से अधिक दंडित करता है। वर्गीकरण कार्यों के लिए, क्रॉस-एन्ट्रॉपी लॉस, जिसे कभी-कभी लॉग लॉस भी कहा जाता है, वर्गों पर अनुमानित संभाव्यता वितरण और वास्तविक वितरण के बीच के अंतर को मापता है, और यह छवि वर्गीकरण से लेकर अगले-टोकन भविष्यवाणी तक की समस्याओं के लिए मानक विकल्प है। बड़े भाषा मॉडल लगभग विशेष रूप से हर टोकन स्थिति पर लागू क्रॉस-एन्ट्रॉपी लॉस के साथ प्रशिक्षित होते हैं, जो प्रभावी रूप से मॉडल से हर चरण पर प्रशिक्षण पाठ में वास्तविक अगले टोकन को यथासंभव उच्च संभावना देने के लिए कहता है। अन्य लॉस विशेष उद्देश्यों की पूर्ति करते हैं: सपोर्ट वेक्टर मशीन जैसे मार्जिन-आधारित वर्गीकरणकर्ताओं के लिए हिंज लॉस, एम्बेडिंग सीखने के लिए कंट्रास्टिव और ट्रिपलेट लॉस जहाँ समान वस्तुओं को लेटेंट-स्पेस में एक-दूसरे के करीब होना चाहिए, और प्रतिकूल लॉस, जहाँ एक दूसरे नेटवर्क की वास्तविक और उत्पन्न डेटा के बीच अंतर करने की क्षमता जनरेटिव-एडवर्सेरियल-नेटवर्क के जनरेटर के लिए लॉस बन जाती है।

लॉस बनाम जो हम वास्तव में चाहते हैं

मशीन लर्निंग में एक आवर्ती विषय लॉस फ़ंक्शन के बीच का अंतर है, जो वह है जिसे एक मॉडल गणितीय रूप से न्यूनतम करने के लिए अनुकूलित किया जाता है, और वास्तविक डाउनस्ट्रीम लक्ष्य, जिसे अक्सर सटीक रूप से निर्दिष्ट करना कठिन होता है। एक बड़ा-भाषा-मॉडल जो विशेष रूप से अगले-टोकन क्रॉस-एन्ट्रॉपी लॉस को न्यूनतम करने के लिए प्रशिक्षित होता है, पाठ को धाराप्रवाह जारी रखेगा, लेकिन उसके पास ईमानदार, सहायक या सुरक्षित होने के लिए कोई स्पष्ट प्रोत्साहन नहीं होता है; ये गुण बाद में आरएलएचएफ जैसे अतिरिक्त उद्देश्यों के माध्यम से जोड़े जाते हैं, जहाँ एक सीखा हुआ पुरस्कार मॉडल मानवीय प्राथमिकताओं द्वारा आकारित एक और लॉस संकेत प्रदान करता है। जब कोई मॉडल अपने लॉस फ़ंक्शन या संबंधित प्रॉक्सी मीट्रिक पर अच्छा स्कोर करने का तरीका ढूंढ लेता है, बिना वास्तव में इच्छित लक्ष्य प्राप्त किए, तो परिणाम को रिवॉर्ड-हैकिंग कहा जाता है, एक विफलता मोड जो अधिक महत्वपूर्ण हो जाता है जब मॉडलों को अधिक स्वायत्तता और बेहतर अनुकूलन दिया जाता है।

लॉस और सामान्यीकरण

एक लॉस फ़ंक्शन का मूल्यांकन आमतौर पर प्रशिक्षण सेट पर किया जाता है, जिससे मॉडल सीधे सीखता है, और एक अलग रखे गए वैलिडेशन सेट पर, जो अनुमान लगाता है कि मॉडल नए डेटा पर कितना अच्छा प्रदर्शन करेगा। प्रशिक्षण लॉस और वैलिडेशन लॉस के बीच एक बड़ा और लगातार अंतर ओवरफिटिंग का क्लासिक संकेत है, जहाँ एक मॉडल ने प्रभावी रूप से प्रशिक्षण डेटा के विवरण को याद कर लिया है, बजाय उन पैटर्नों को सीखने के जो सामान्यीकृत होते हैं। रेगुलराइज़ेशन के तहत समूहीकृत तकनीकें, जैसे कि लॉस फ़ंक्शन में सीधे जोड़े गए वेट पेनल्टी, ड्रॉपआउट, और वैलिडेशन लॉस पर आधारित अर्ली स्टॉपिंग, इस अंतर को नियंत्रण में रखने के लिए मानक उपकरण हैं। क्योंकि एक गहरे नेटवर्क का लॉस लैंडस्केप अत्यधिक उच्च-आयामी होता है, लॉस फ़ंक्शन का विशिष्ट आकार, न कि केवल उसका अंतिम मान, भौतिक रूप से प्रभावित करता है कि मॉडल को प्रशिक्षित करना कितना आसान है, जो लॉस लैंडस्केप स्मूथनेस और सामान्यीकरण परतों और अवशिष्ट कनेक्शन जैसे वास्तुशिल्प विकल्पों के साथ इसके संबंध पर शोध को प्रेरित करता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:machine-learning·deep-learning·optimization
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास