लागत-संवेदनशील मशीन लर्निंग Machine learning के भीतर एक दृष्टिकोण है जो पूर्वानुमान त्रुटियों से जुड़ी वित्तीय, सामाजिक, या परिचालन लागतों को स्पष्ट रूप से ध्यान में रखता है। मानक वर्गीकरण विधियों के विपरीत जो आमतौर पर त्रुटि दर को कम करती हैं, लागत-संवेदनशील विधियाँ विभिन्न प्रकार की गलतियों (जैसे, गलत सकारात्मक बनाम गलत नकारात्मक) के लिए अलग-अलग दंड निर्धारित करती हैं और कुल अपेक्षित लागत को कम करने के लिए मॉडल को अनुकूलित करती हैं। यह उन क्षेत्रों में विशेष रूप से महत्वपूर्ण है जहाँ त्रुटियों के परिणाम असममित होते हैं, जैसे चिकित्सा निदान, धोखाधड़ी का पता लगाना, और क्रेडिट स्कोरिंग।
यह क्षेत्र निर्णय सिद्धांत और सांख्यिकीय शिक्षण से उभरा, जिसमें 1980 और 1990 के दशक में क्रिस बिशप और माइकल जॉर्डन जैसे शोधकर्ताओं द्वारा प्रारंभिक कार्य किया गया, जिन्होंने लागत-संवेदनशील हानि फलनों को औपचारिक रूप दिया। आधुनिक अनुप्रयोग Artificial intelligence प्रणालियों में फैले हुए हैं, जिनमें Deep learning मॉडल शामिल हैं, जहाँ लागत-संवेदनशील प्रशिक्षण को Loss Functions और तंत्रिका नेटवर्क वास्तुकलाओं में एकीकृत किया जा सकता है।
लागत मैट्रिक्स और असममित हानि
एक केंद्रीय अवधारणा लागत मैट्रिक्स है, जो सत्य और पूर्वानुमानित वर्गों के प्रत्येक संयोजन के लिए दंड निर्दिष्ट करती है। द्विआधारी वर्गीकरण के लिए, एक विशिष्ट मैट्रिक्स में सत्य सकारात्मक (अक्सर शून्य), सत्य नकारात्मक (शून्य), गलत सकारात्मक, और गलत नकारात्मक के लिए लागतें शामिल होती हैं। जब ये लागतें असमान होती हैं, तो इष्टतम निर्णय सीमा 0.5 से दूर स्थानांतरित हो जाती है। उदाहरण के लिए, चिकित्सा जांच में, एक गलत नकारात्मक (बीमारी को अनदेखा करना) गलत सकारात्मक की तुलना में कहीं अधिक महंगा हो सकता है, इसलिए मॉडल को सकारात्मक पूर्वानुमानों की ओर झुकाव रखना चाहिए।
लागत-संवेदनशील शिक्षण को हानि फलन को संशोधित करके लागू किया जा सकता है, जैसे भारित क्रॉस-एन्ट्रॉपी का उपयोग करना, या प्रशिक्षण के बाद निर्णय सीमा को समायोजित करना। Deep learning में, सामान्य हानियों जैसे द्विआधारी क्रॉस-एन्ट्रॉपी के लागत-संवेदनशील संस्करणों का उपयोग किया जाता है, और Gradient Clipping और सीखने की दर अनुसूची जैसी तकनीकों को लागत-भारित ग्रेडिएंट्स को संभालने के लिए अनुकूलित किया जा सकता है।
विधियाँ और एल्गोरिदम
लागत-संवेदनशील शिक्षण के लिए कई एल्गोरिदमिक रणनीतियाँ मौजूद हैं। सबसे सीधा तरीका लागत-संवेदनशील पुनर्नमूनाकरण है, जहाँ प्रशिक्षण उदाहरणों को उनकी गलत वर्गीकरण लागतों के अनुसार अधिक-नमूना या कम-नमूना किया जाता है। एक अन्य दृष्टिकोण लागत-संवेदनशील बूस्टिंग है, जो त्रुटियों को लागत द्वारा भारित करने के लिए बूस्टिंग एल्गोरिदम को संशोधित करता है। तंत्रिका नेटवर्क के लिए, लागत-संवेदनशील शिक्षण को हानि फलन में एक लागत पद शामिल करके और एडम या एसजीडी वेरिएंट जैसे मानक अनुकूलकों का उपयोग करके प्राप्त किया जा सकता है।
थ्रेशोल्ड-मूविंग एक सरल पोस्ट-प्रोसेसिंग विधि है: एक संभाव्य वर्गीकरणकर्ता को प्रशिक्षित करने के बाद, निर्णय सीमा को अपेक्षित लागत को कम करने के लिए चुना जाता है, अक्सर एक सत्यापन सेट का उपयोग करके। यह विशेष रूप से प्रभावी होता है जब मॉडल की संभावना अनुमान अच्छी तरह से कैलिब्रेटेड होते हैं। व्यवहार में, कई चिकित्सक मजबूत प्रदर्शन प्राप्त करने के लिए पुनर्नमूनाकरण को थ्रेशोल्ड समायोजन के साथ जोड़ते हैं।
उच्च-दांव वाले क्षेत्रों में अनुप्रयोग
लागत-संवेदनशील शिक्षण उन क्षेत्रों में व्यापक रूप से लागू होता है जहाँ त्रुटि लागत असममित होती है। स्वास्थ्य देखभाल में, रोग का पता लगाने के लिए मॉडल को छूटे हुए निदान की लागत को कम करने के लिए प्रशिक्षित किया जाता है, अक्सर उपचार लागत और रोगी परिणामों से प्राप्त लागत मैट्रिक्स का उपयोग करके। वित्त में, क्रेडिट स्कोरिंग मॉडल एक खराब ऋण को मंजूरी देने की लागत को एक अच्छे आवेदक को अस्वीकार करने के खिलाफ तौलते हैं। धोखाधड़ी का पता लगाने वाली प्रणालियाँ धोखाधड़ी वाले लेनदेन को पकड़ने को प्राथमिकता देती हैं, भले ही अधिक गलत अलार्म की कीमत पर।
Generative AI और बड़े भाषा मॉडल में, लागत-संवेदनशील सिद्धांत मानव प्रतिक्रिया से सुदृढीकरण शिक्षण (आरएलएचएफ) में दिखाई देते हैं, जहाँ विभिन्न प्रकार की त्रुटियों (जैसे, हानिकारक बनाम अनुपयोगी प्रतिक्रियाएँ) को अलग-अलग लागतें सौंपी जाती हैं। इसी तरह, Model Pruning और Data Augmentation को महत्वपूर्ण वर्गों पर प्रदर्शन बनाए रखने के लिए लागत विचारों द्वारा निर्देशित किया जा सकता है।
मूल्यांकन और मेट्रिक्स
सटीकता जैसे पारंपरिक मेट्रिक्स लागत-संवेदनशील समस्याओं के लिए अपर्याप्त हैं। इसके बजाय, चिकित्सक लागत-आधारित मेट्रिक्स जैसे अपेक्षित लागत, लागत वक्र, और सटीकता और पुनर्प्राप्ति के लागत-संवेदनशील संस्करणों का उपयोग करते हैं। कुल लागत की गणना प्रत्येक त्रुटि गणना और उसकी संबद्ध लागत के उत्पाद को जोड़कर की जाती है। लागत वक्र, जो 2000 के दशक की शुरुआत में पेश किए गए थे, लागत अनुपात के कार्य के रूप में गलत सकारात्मक और गलत नकारात्मक दरों के बीच व्यापार-बंद को दर्शाते हैं।
मॉडल की तुलना करते समय, कोई व्यक्ति लागत-संवेदनशील आरओसी वक्र (एयूसी) के अंतर्गत क्षेत्र या लागत-संवेदनशील एफ-माप का उपयोग कर सकता है। ये मेट्रिक्स व्यवसाय या नैदानिक उद्देश्यों के साथ संरेखित मॉडल चुनने में मदद करते हैं। अनुसंधान में, बेंचमार्क अक्सर लागत-संवेदनशील दृष्टिकोणों के लाभों को उजागर करने के लिए सटीकता और लागत दोनों की रिपोर्ट करते हैं।
चुनौतियाँ और भविष्य की दिशाएँ
एक प्रमुख चुनौती लागत मैट्रिक्स का सटीक अनुमान लगाना है, क्योंकि लागतें अक्सर डोमेन-विशिष्ट होती हैं और मात्रात्मक रूप से निर्धारित करना कठिन हो सकता है। कुछ अनुप्रयोगों में, लागतें निश्चित नहीं होती हैं बल्कि संदर्भ के साथ भिन्न होती हैं, जिसके लिए गतिशील लागत-संवेदनशील शिक्षण की आवश्यकता होती है। एक और चुनौती यह है कि लागत-संवेदनशील विधियाँ मॉडल जटिलता और प्रशिक्षण समय को बढ़ा सकती हैं, विशेष रूप से जब बड़े Deep learning प्रणालियों में एकीकृत किया जाता है।
भविष्य का शोध ट्रांसफार्मर-आधारित मॉडल और मल्टी-हेड अटेंशन वास्तुकलाओं में लागत-संवेदनशील शिक्षण की खोज करता है, जहाँ लागत जानकारी को अटेंशन तंत्रों में इंजेक्ट किया जा सकता है। लागत-संवेदनशील शिक्षण को Curriculum Learning और बैच सामान्यीकरण के साथ जोड़ने में भी रुचि है ताकि प्रशिक्षण स्थिरता में सुधार हो सके। जैसे-जैसे Artificial intelligence प्रणालियाँ अधिक महत्वपूर्ण क्षेत्रों में तैनात की जाती हैं, लागत-संवेदनशील मशीन लर्निंग वास्तविक दुनिया की प्राथमिकताओं के साथ मॉडल व्यवहार को संरेखित करने के लिए एक महत्वपूर्ण उपकरण बना रहेगा।