एक लॉस फ़ंक्शन, जिसे कॉस्ट फ़ंक्शन या ऑब्जेक्टिव फ़ंक्शन भी कहा जाता है, एक गणितीय फ़ंक्शन है जो किसी मॉडल की भविष्यवाणियों और उन वास्तविक लक्ष्य मानों के बीच के अंतर को मापता है जिनसे वह मेल खाने की कोशिश कर रहा है। मशीन-लर्निंग मॉडल को प्रशिक्षित करना, लगभग सभी मामलों में, उसके मापदंडों को समायोजित करने की प्रक्रिया है ताकि इस फ़ंक्शन का आउटपुट जितना संभव हो उतना छोटा हो, आमतौर पर ग्रेडिएंट-डिसेंट द्वारा निर्देशित होता है जो बैकप्रोपेगेशन के माध्यम से गणना किए गए ग्रेडिएंट्स पर आधारित होता है।
सामान्य रूप
प्रतिगमन कार्यों के लिए, जहाँ लक्ष्य एक सतत संख्या होती है, माध्य वर्ग त्रुटि, यानी भविष्यवाणियों और लक्ष्यों के बीच वर्ग अंतरों का औसत, सबसे व्यापक रूप से उपयोग किया जाने वाला लॉस है, जो बड़ी त्रुटियों को छोटी त्रुटियों की तुलना में असमान रूप से अधिक दंडित करता है। वर्गीकरण कार्यों के लिए, क्रॉस-एन्ट्रॉपी लॉस, जिसे कभी-कभी लॉग लॉस भी कहा जाता है, वर्गों पर अनुमानित संभाव्यता वितरण और वास्तविक वितरण के बीच के अंतर को मापता है, और यह छवि वर्गीकरण से लेकर अगले-टोकन भविष्यवाणी तक की समस्याओं के लिए मानक विकल्प है। बड़े भाषा मॉडल लगभग विशेष रूप से हर टोकन स्थिति पर लागू क्रॉस-एन्ट्रॉपी लॉस के साथ प्रशिक्षित होते हैं, जो प्रभावी रूप से मॉडल से हर चरण पर प्रशिक्षण पाठ में वास्तविक अगले टोकन को यथासंभव उच्च संभावना देने के लिए कहता है। अन्य लॉस विशेष उद्देश्यों की पूर्ति करते हैं: सपोर्ट वेक्टर मशीन जैसे मार्जिन-आधारित वर्गीकरणकर्ताओं के लिए हिंज लॉस, एम्बेडिंग सीखने के लिए कंट्रास्टिव और ट्रिपलेट लॉस जहाँ समान वस्तुओं को लेटेंट-स्पेस में एक-दूसरे के करीब होना चाहिए, और प्रतिकूल लॉस, जहाँ एक दूसरे नेटवर्क की वास्तविक और उत्पन्न डेटा के बीच अंतर करने की क्षमता जनरेटिव-एडवर्सेरियल-नेटवर्क के जनरेटर के लिए लॉस बन जाती है।
लॉस बनाम जो हम वास्तव में चाहते हैं
मशीन लर्निंग में एक आवर्ती विषय लॉस फ़ंक्शन के बीच का अंतर है, जो वह है जिसे एक मॉडल गणितीय रूप से न्यूनतम करने के लिए अनुकूलित किया जाता है, और वास्तविक डाउनस्ट्रीम लक्ष्य, जिसे अक्सर सटीक रूप से निर्दिष्ट करना कठिन होता है। एक बड़ा-भाषा-मॉडल जो विशेष रूप से अगले-टोकन क्रॉस-एन्ट्रॉपी लॉस को न्यूनतम करने के लिए प्रशिक्षित होता है, पाठ को धाराप्रवाह जारी रखेगा, लेकिन उसके पास ईमानदार, सहायक या सुरक्षित होने के लिए कोई स्पष्ट प्रोत्साहन नहीं होता है; ये गुण बाद में आरएलएचएफ जैसे अतिरिक्त उद्देश्यों के माध्यम से जोड़े जाते हैं, जहाँ एक सीखा हुआ पुरस्कार मॉडल मानवीय प्राथमिकताओं द्वारा आकारित एक और लॉस संकेत प्रदान करता है। जब कोई मॉडल अपने लॉस फ़ंक्शन या संबंधित प्रॉक्सी मीट्रिक पर अच्छा स्कोर करने का तरीका ढूंढ लेता है, बिना वास्तव में इच्छित लक्ष्य प्राप्त किए, तो परिणाम को रिवॉर्ड-हैकिंग कहा जाता है, एक विफलता मोड जो अधिक महत्वपूर्ण हो जाता है जब मॉडलों को अधिक स्वायत्तता और बेहतर अनुकूलन दिया जाता है।
लॉस और सामान्यीकरण
एक लॉस फ़ंक्शन का मूल्यांकन आमतौर पर प्रशिक्षण सेट पर किया जाता है, जिससे मॉडल सीधे सीखता है, और एक अलग रखे गए वैलिडेशन सेट पर, जो अनुमान लगाता है कि मॉडल नए डेटा पर कितना अच्छा प्रदर्शन करेगा। प्रशिक्षण लॉस और वैलिडेशन लॉस के बीच एक बड़ा और लगातार अंतर ओवरफिटिंग का क्लासिक संकेत है, जहाँ एक मॉडल ने प्रभावी रूप से प्रशिक्षण डेटा के विवरण को याद कर लिया है, बजाय उन पैटर्नों को सीखने के जो सामान्यीकृत होते हैं। रेगुलराइज़ेशन के तहत समूहीकृत तकनीकें, जैसे कि लॉस फ़ंक्शन में सीधे जोड़े गए वेट पेनल्टी, ड्रॉपआउट, और वैलिडेशन लॉस पर आधारित अर्ली स्टॉपिंग, इस अंतर को नियंत्रण में रखने के लिए मानक उपकरण हैं। क्योंकि एक गहरे नेटवर्क का लॉस लैंडस्केप अत्यधिक उच्च-आयामी होता है, लॉस फ़ंक्शन का विशिष्ट आकार, न कि केवल उसका अंतिम मान, भौतिक रूप से प्रभावित करता है कि मॉडल को प्रशिक्षित करना कितना आसान है, जो लॉस लैंडस्केप स्मूथनेस और सामान्यीकरण परतों और अवशिष्ट कनेक्शन जैसे वास्तुशिल्प विकल्पों के साथ इसके संबंध पर शोध को प्रेरित करता है।