लॉग लॉस, जिसे क्रॉस-एन्ट्रॉपी लॉस के रूप में भी जाना जाता है, एक लॉस फ़ंक्शन है जिसका उपयोग प्रायिकता-आधारित वर्गीकरण कार्यों में किया जाता है। यह अनुमानित प्रायिकता वितरण और लेबल के वास्तविक वितरण के बीच असमानता को मापता है। मशीन लर्निंग में, मॉडल कैलिब्रेशन और सटीकता में सुधार के लिए प्रशिक्षण के दौरान लॉग लॉस को न्यूनतम किया जाता है। यह फ़ंक्शन उन भविष्यवाणियों को उच्च दंड देता है जो आत्मविश्वासपूर्ण लेकिन गलत हैं, जिससे यह उन कार्यों के लिए विशेष रूप से प्रभावी होता है जहाँ प्रायिकता-आधारित आउटपुट की आवश्यकता होती है, जैसे कि Neural network क्लासिफायर और Large language model में।
गणितीय रूप से, वास्तविक लेबल \(y \in \{0,1\}\) और अनुमानित प्रायिकता \(p \in [0,1]\) वाले एकल उदाहरण के लिए, लॉग लॉस को \(- [y \log(p) + (1-y) \log(1-p)]\) के रूप में परिभाषित किया गया है। बहु-वर्गीय समस्याओं के लिए, यह \(- \sum_{c=1}^{C} y_c \log(p_c)\) के रूप में सामान्यीकृत होता है, जहाँ \(C\) वर्गों की संख्या है। लॉजिस्टिक रिग्रेशन के लिए फ़ंक्शन उत्तल है, यह सुनिश्चित करता है कि Adam (Optimizer) और Stochastic Gradient Descent Variants जैसी ग्रेडिएंट-आधारित अनुकूलन विधियाँ वैश्विक न्यूनतम पर अभिसरित होती हैं।
उत्पत्ति और सैद्धांतिक आधार
लॉग लॉस की अवधारणा सूचना सिद्धांत में निहित है, विशेष रूप से 1940 के दशक में क्लॉड शैनन द्वारा प्रस्तुत क्रॉस-एन्ट्रॉपी की धारणा में। क्रॉस-एन्ट्रॉपी एक वितरण से घटनाओं को मॉडल वितरण का उपयोग करके एन्कोड करने के लिए आवश्यक बिट्स की औसत संख्या को मापती है। सांख्यिकीय शिक्षण में, लॉग लॉस को न्यूनतम करना एक प्रायिकता मॉडल के तहत देखे गए डेटा की संभावना को अधिकतम करने के बराबर है। यह संबंध 1950 और 1960 के दशक में Bernard Widrow जैसे सांख्यिकीविदों और अन्य लोगों द्वारा औपचारिक रूप से स्थापित किया गया था, जिन्होंने इसे प्रारंभिक पैटर्न पहचान प्रणालियों पर लागू किया था।
Machine learning के संदर्भ में, लॉग लॉस लॉजिस्टिक रिग्रेशन और बाद में Deep learning के उदय के साथ वर्गीकरण के लिए एक मानक लॉस फ़ंक्शन बन गया। Neural network के प्रशिक्षण में इसका उपयोग 1980 और 1990 के दशक में लोकप्रिय हुआ, विशेष रूप से बैकप्रोपेगेशन एल्गोरिदम के साथ। आज, लॉग लॉस आधुनिक AI प्रणालियों में उपयोग किए जाने वाले कई Loss Functions का एक मूलभूत घटक है।
आधुनिक AI में अनुप्रयोग
लॉग लॉस विभिन्न डोमेन में पर्यवेक्षित वर्गीकरण कार्यों में सर्वव्यापी है। Natural language processing और Large language model में, जैसे कि OpenAI और Google DeepMind द्वारा विकसित, लॉग लॉस का उपयोग प्रीट्रेनिंग के दौरान अनुक्रम में अगले टोकन की भविष्यवाणी करने के लिए किया जाता है। उदाहरण के लिए, ट्रांसफार्मर-आधारित मॉडल में, आउटपुट परत शब्दावली पर प्रायिकता वितरण उत्पन्न करने के लिए सॉफ्टमैक्स लागू करती है, और प्रशिक्षण उद्देश्य इन भविष्यवाणियों और वास्तविक अगले टोकन के बीच लॉग लॉस को न्यूनतम करना है।
कंप्यूटर विज़न में, लॉग लॉस का उपयोग छवि वर्गीकरण और वस्तु पहचान में किया जाता है। उदाहरण के लिए, Residual Network (ResNet) आर्किटेक्चर अक्सर वर्गीकरण हेड के लिए लॉग लॉस का उपयोग करते हैं। इसके अतिरिक्त, चिकित्सा इमेजिंग में, लॉग लॉस के साथ प्रशिक्षित मॉडल स्कैन से बीमारियों के निदान में मदद करते हैं, जहाँ निर्णय लेने के लिए कैलिब्रेटेड प्रायिकताएँ महत्वपूर्ण होती हैं।
पारंपरिक वर्गीकरण से परे, लॉग लॉस का उपयोग रैंकिंग और अनुशंसा प्रणालियों में भी किया जाता है, जहाँ यह क्लिक-थ्रू दरों को अनुकूलित करने में मदद करता है। Reinforcement learning के Reinforcement Learning from AI Feedback (RLAIF) जैसे वेरिएंट में, लॉग लॉस का उपयोग मानव प्राथमिकताओं के साथ मॉडल आउटपुट को संरेखित करने के लिए किया जा सकता है।
गुण और लाभ
लॉग लॉस में कई वांछनीय गुण हैं जो इसे वर्ग त्रुटि जैसे अन्य लॉस फ़ंक्शनों पर पसंदीदा विकल्प बनाते हैं। पहला, यह सख्ती से उचित है, जिसका अर्थ है कि इष्टतम भविष्यवाणी वास्तविक वर्ग प्रायिकता है, जो अच्छी तरह से कैलिब्रेटेड मॉडल को प्रोत्साहित करती है। दूसरा, यह एक सुचारू ग्रेडिएंट प्रदान करता है, जो ग्रेडिएंट डिसेंट के माध्यम से कुशल अनुकूलन की सुविधा देता है। तीसरा, यह आत्मविश्वासपूर्ण गलत भविष्यवाणियों को भारी दंड देता है, जो सुरक्षा-महत्वपूर्ण अनुप्रयोगों में फायदेमंद हो सकता है।
हालाँकि, लॉग लॉस आउटलायर्स के प्रति संवेदनशील है और गलत लेबल वाले उदाहरणों द्वारा हावी हो सकता है। इसे कम करने के लिए, फोकल लॉस जैसे वेरिएंट प्रस्तावित किए गए हैं, जो आसान उदाहरणों को कम महत्व देते हैं। व्यवहार में, अत्यधिक आत्मविश्वास को रोकने के लिए Label Smoothing जैसी तकनीकों का उपयोग किया जाता है।
अन्य लॉस फ़ंक्शनों के साथ तुलना
लॉग लॉस की तुलना अक्सर सपोर्ट वेक्टर मशीनों में उपयोग किए जाने वाले हिंज लॉस से की जाती है। जबकि हिंज लॉस मार्जिन को अधिकतम करने पर केंद्रित है, लॉग लॉस प्रायिकता-आधारित व्याख्याएँ प्रदान करता है और उन कार्यों के लिए अधिक उपयुक्त है जिनमें आत्मविश्वास स्कोर की आवश्यकता होती है। रिग्रेशन कार्यों में, माध्य वर्ग त्रुटि सामान्य है, लेकिन लॉग लॉस सीधे लागू नहीं होता है जब तक कि समस्या को वर्गीकरण के रूप में तैयार न किया जाए।
बहु-वर्गीय सेटिंग्स में, लॉग लॉस श्रेणीबद्ध क्रॉस-एन्ट्रॉपी के बराबर है। यह कुलबैक-लीब्लर विचलन से भी संबंधित है, जो दो प्रायिकता वितरणों के बीच अंतर को मापता है। लॉग लॉस को न्यूनतम करना वास्तविक और अनुमानित वितरणों के बीच KL विचलन को न्यूनतम करने के बराबर है।
कार्यान्वयन और व्यावहारिक विचार
व्यवहार में, लॉग लॉस अधिकांश डीप लर्निंग फ्रेमवर्क, जैसे TensorFlow और PyTorch में लागू किया गया है। इसे अक्सर सॉफ्टमैक्स सक्रियण फ़ंक्शन के साथ जोड़ा जाता है ताकि यह सुनिश्चित किया जा सके कि अनुमानित प्रायिकताएँ एक का योग करें। संख्यात्मक स्थिरता लॉग-सम-एक्सप ट्रिक का उपयोग करके प्राप्त की जाती है ताकि अंडरफ्लो या ओवरफ्लो से बचा जा सके।
प्रशिक्षण के दौरान, लॉग लॉस को आमतौर पर मिनी-बैच ग्रेडिएंट डिसेंट का उपयोग करके न्यूनतम किया जाता है। Learning Rate Scheduling का चुनाव अभिसरण को महत्वपूर्ण रूप से प्रभावित कर सकता है। लॉग लॉस को अनुकूलित करते समय ओवरफिटिंग को रोकने के लिए Dropout और Batch Normalization जैसी नियमितीकरण तकनीकों का अक्सर उपयोग किया जाता है।
द्विआधारी वर्गीकरण के लिए, लॉग लॉस को बर्नौली वितरण की नकारात्मक लॉग-संभावना के रूप में व्याख्या किया जा सकता है। बहु-वर्गीय के लिए, यह श्रेणीबद्ध वितरण की नकारात्मक लॉग-संभावना है। यह प्रायिकता-आधारित नींव इसे उन मॉडलों के लिए एक स्वाभाविक विकल्प बनाती है जो प्रायिकताएँ आउटपुट करते हैं।
भविष्य की दिशाएँ
जैसे-जैसे AI मॉडल अधिक जटिल होते जा रहे हैं, लॉग लॉस प्रशिक्षण उद्देश्यों का एक आधारशिला बना हुआ है। हालाँकि, शोध अनिश्चितता को बेहतर ढंग से पकड़ने या शोर लेबल के प्रति अधिक मजबूत होने वाले वैकल्पिक लॉस फ़ंक्शनों की खोज कर रहा है। उदाहरण के लिए, Generative AI में, लॉग लॉस का उपयोग डिस्क्रिमिनेटर और जनरेटर के प्रशिक्षण में किया जाता है, लेकिन वासेरस्टीन लॉस जैसे नए उद्देश्यों की भी जाँच की जा रही है।
Artificial intelligence सुरक्षा के संदर्भ में, यह सुनिश्चित करना कि मॉडल अच्छी तरह से कैलिब्रेटेड हैं, महत्वपूर्ण है। लॉग लॉस सीधे कैलिब्रेशन को संबोधित करता है, जिससे यह विश्वसनीय AI प्रणालियों को विकसित करने के लिए एक आवश्यक उपकरण बन जाता है। 2025 तक, लॉग लॉस शिक्षा और उद्योग दोनों में अधिकांश वर्गीकरण कार्यों के लिए डिफ़ॉल्ट विकल्प बना हुआ है।