निष्पक्षता मेट्रिक्स मात्रात्मक माप हैं जिनका उपयोग यह मूल्यांकन करने के लिए किया जाता है कि क्या किसी मशीन लर्निंग मॉडल की भविष्यवाणियाँ या निर्णय व्यक्तियों या समूहों के साथ न्यायसंगत व्यवहार करते हैं। ये मेट्रिक्स मशीन लर्निंग में निष्पक्षता के क्षेत्र के केंद्र में हैं, जिसका उद्देश्य स्वचालित निर्णय प्रक्रियाओं में एल्गोरिथमिक पूर्वाग्रह को ठीक करना है। ऐसे मॉडलों द्वारा लिए गए निर्णय अनुचित माने जा सकते हैं यदि वे संवेदनशील माने जाने वाले चरों पर आधारित हों, जैसे कि लिंग, जातीयता, यौन अभिविन्यास, या विकलांगता। कई नैतिक अवधारणाओं की तरह, निष्पक्षता और पूर्वाग्रह की परिभाषाएँ विवादास्पद हो सकती हैं, और निष्पक्षता मेट्रिक्स एक औपचारिक, परिचालनात्मक तरीका प्रदान करते हैं जो लोगों के जीवन को प्रभावित करने वाली प्रणालियों में समानता की प्रतिस्पर्धी धारणाओं का आकलन करने के लिए होता है, जैसे कि भर्ती, ऋण, आपराधिक न्याय, और सामग्री वितरण।
निष्पक्षता मेट्रिक्स का विकास मशीन लर्निंग में एक अपेक्षाकृत हालिया फोकस है, जिसमें 2016 के बाद से अनुसंधान में तेज वृद्धि हुई है। यह उछाल आंशिक रूप से 2016 की एक प्रभावशाली प्रो पब्लिका रिपोर्ट से प्रेरित था, जिसमें दावा किया गया था कि COMPAS, जो अमेरिकी अदालतों में पुनरावृत्ति की भविष्यवाणी करने के लिए व्यापक रूप से उपयोग किया जाने वाला सॉफ्टवेयर है, नस्लीय रूप से पक्षपाती था। रिपोर्ट ने उजागर किया कि काले प्रतिवादियों को सफेद प्रतिवादियों की तुलना में लगभग दोगुना गलत तरीके से उच्च जोखिम के रूप में लेबल किए जाने की संभावना थी, जबकि सफेद प्रतिवादियों के लिए विपरीत त्रुटि हुई। COMPAS के निर्माता नॉर्थपॉइंट इंक ने निष्कर्षों पर विवाद किया, लेकिन विवाद ने निष्पक्षता की स्पष्ट, मापने योग्य परिभाषाओं की आवश्यकता को रेखांकित किया। निर्णय लेने में निष्पक्षता की मात्रात्मक चर्चा मशीन लर्निंग युग से पहले की है, जो 1964 के अमेरिकी नागरिक अधिकार अधिनियम के बाद 1960 के दशक के मध्य और 1970 के दशक में फली-फूली, हालांकि निष्पक्षता की प्रतिस्पर्धी धारणाओं के कारण 1970 के दशक के अंत तक बहस काफी हद तक गायब हो गई।
सांख्यिकीय निष्पक्षता मानदंड
निष्पक्षता मेट्रिक्स को अक्सर उनके द्वारा एन्कोड किए गए निष्पक्षता के सांख्यिकीय सिद्धांत द्वारा वर्गीकृत किया जाता है। एक सामान्य समूह समूह निष्पक्षता है, जिसके लिए आवश्यक है कि संरक्षित समूहों में परिणाम समान हों। जनसांख्यिकीय समानता, जिसे सांख्यिकीय समानता के रूप में भी जाना जाता है, मांग करती है कि सकारात्मक भविष्यवाणी की संभावना सभी समूहों में समान हो। समानीकृत बाधाएँ आवश्यक हैं कि सही सकारात्मक दर और गलत सकारात्मक दर सभी समूहों में समान हों, जिसका अर्थ है कि मॉडल सभी समूहों के लिए समान रूप से अच्छा प्रदर्शन करता है। समान अवसर एक शिथिल संस्करण है जो केवल समान सही सकारात्मक दरों पर केंद्रित है। अंशांकन-आधारित मेट्रिक्स, जैसे कि समूह द्वारा अंशांकन, आवश्यक हैं कि जिन व्यक्तियों के लिए किसी परिणाम की एक निश्चित संभावना की भविष्यवाणी की जाती है, उनके लिए वास्तविक परिणाम आवृत्ति सभी समूहों में समान हो। ये मानदंड अक्सर परस्पर असंगत होते हैं; एक को संतुष्ट करना दूसरे का उल्लंघन कर सकता है, जिससे अधिकांश वास्तविक दुनिया की सेटिंग्स में सभी को एक साथ प्राप्त करना असंभव हो जाता है।
व्यक्तिगत और प्रति-तथ्यात्मक निष्पक्षता
समूह-स्तरीय मेट्रिक्स से परे, निष्पक्षता का मूल्यांकन व्यक्तिगत स्तर पर किया जा सकता है। व्यक्तिगत निष्पक्षता, जिसे कार्नेगी मेलन विश्वविद्यालय के विद्वानों सहित शोधकर्ताओं द्वारा प्रस्तावित किया गया है, आवश्यक है कि समान व्यक्तियों को समान भविष्यवाणियाँ प्राप्त हों। यह आमतौर पर एक दूरी मीट्रिक का उपयोग करके औपचारिक रूप से परिभाषित किया जाता है जो प्रासंगिक विशेषताओं को पकड़ता है, यह सुनिश्चित करता है कि दो लोग जो सभी गैर-संवेदनशील पहलुओं में समान हैं, उनके साथ समान व्यवहार किया जाए। प्रति-तथ्यात्मक निष्पक्षता इस विचार का विस्तार करती है कि क्या भविष्यवाणी बदल जाएगी यदि एक संवेदनशील विशेषता, जैसे कि नस्ल या लिंग, अलग होती जबकि बाकी सब स्थिर रहता। यदि परिणाम भिन्न होता, तो मॉडल को अनुचित माना जाता है। ये दृष्टिकोण अधिक सूक्ष्म हैं लेकिन समानता और कारण संबंधों के सावधानीपूर्वक विनिर्देश की आवश्यकता होती है, जो व्यवहार में चुनौतीपूर्ण हो सकता है।
मॉडलों में पूर्वाग्रह के स्रोत
निष्पक्षता मेट्रिक्स का उपयोग उस पूर्वाग्रह का पता लगाने के लिए किया जाता है जो विभिन्न स्रोतों से उत्पन्न होता है। भाषा पूर्वाग्रह एक प्रकार का सांख्यिकीय नमूनाकरण पूर्वाग्रह है जो किसी क्वेरी की भाषा से जुड़ा होता है, जिससे सूचना के नमूने में व्यवस्थित विचलन होता है जो किसी भंडार में विषयों और विचारों का सटीक प्रतिनिधित्व रोकता है। लुओ एट अल। का शोध दिखाता है कि वर्तमान बड़े भाषा मॉडल, मुख्य रूप से अंग्रेजी-भाषा डेटा पर प्रशिक्षित, अक्सर एंग्लो-अमेरिकी विचारों को सत्य के रूप में प्रस्तुत करते हैं जबकि गैर-अंग्रेजी दृष्टिकोणों को कम महत्व देते हैं। उदाहरण के लिए, जब उदारवाद जैसी राजनीतिक विचारधाराओं के बारे में पूछा जाता है, तो एक मॉडल एंग्लो-अमेरिकी दृष्टिकोण से मानव अधिकारों और समानता पर जोर दे सकता है जबकि वियतनामी दृष्टिकोण से "व्यक्तिगत और आर्थिक जीवन में राज्य के हस्तक्षेप का विरोध" या चीनी दृष्टिकोण से "सरकारी शक्ति की सीमा" जैसे पहलुओं को छोड़ सकता है। लिंग पूर्वाग्रह एक और आम मुद्दा है, जहां मॉडल पारंपरिक लिंग मानदंडों के आधार पर भूमिकाएं और विशेषताएं निर्दिष्ट करते हैं, जैसे कि नर्सों या सचिवों को महिलाओं के साथ और इंजीनियरों या सीईओ को पुरुषों के साथ जोड़ना। राजनीतिक पूर्वाग्रह भी उभरता है जब प्रशिक्षण डेटा में विचारों की एक विस्तृत श्रृंखला होती है, जिससे मॉडल प्रचलन के आधार पर विशेष विचारधाराओं की ओर झुकते हैं।
व्यवहार में पूर्वाग्रह मापना
निष्पक्षता मेट्रिक्स लागू करने के लिए, चिकित्सक आमतौर पर संरक्षित विशेषताओं (जैसे, नस्ल, लिंग, आयु) को परिभाषित करते हैं, एक उपयुक्त मीट्रिक (जैसे, समानीकृत बाधाएँ) का चयन करते हैं, और एक सत्यापन डेटासेट पर मीट्रिक की गणना करते हैं। बाइनरी वर्गीकरण के लिए, भ्रम मैट्रिक्स का उपयोग प्रत्येक समूह के लिए गलत सकारात्मक और गलत नकारात्मक जैसी दरें प्राप्त करने के लिए किया जाता है। असमान प्रभाव, एक सामान्य मीट्रिक, वंचित और लाभप्रद समूहों के बीच सकारात्मक भविष्यवाणी दरों के अनुपात के रूप में गणना की जाती है; 0.8 से नीचे का अनुपात अक्सर एक लाल झंडा माना जाता है, जो अमेरिकी समान रोजगार अवसर आयोग दिशानिर्देशों का पालन करता है। इस प्रक्रिया को सुविधाजनक बनाने के लिए उपकरण विकसित किए गए हैं। आईबीएम ने पायथन और आर के लिए ओपन-सोर्स टूलकिट जारी किए हैं जिनमें पूर्वाग्रह को कम करने और निष्पक्षता बढ़ाने के लिए एल्गोरिदम हैं। गूगल ने मशीन लर्निंग में पूर्वाग्रह का अध्ययन और मुकाबला करने के लिए दिशानिर्देश और उपकरण प्रकाशित किए हैं। फेसबुक ने अपने एआई में पूर्वाग्रह का पता लगाने के लिए फेयरनेस फ्लो नामक एक उपकरण का उपयोग करने की सूचना दी, हालांकि आलोचकों का तर्क है कि कंपनी के प्रयास अपर्याप्त हैं, कर्मचारियों द्वारा कम उपयोग का हवाला देते हुए क्योंकि इसे सभी कार्यक्रमों पर लागू नहीं किया जा सकता है और इसका उपयोग वैकल्पिक है।
केस स्टडीज और विवाद
कानूनी प्रणाली में एल्गोरिथमिक निर्णय लेने का उपयोग जांच का एक उल्लेखनीय क्षेत्र रहा है। 2014 में, अमेरिकी अटॉर्नी जनरल एरिक होल्डर ने चिंता जताई कि जोखिम मूल्यांकन विधियां प्रतिवादी के नियंत्रण से बाहर के कारकों, जैसे शिक्षा स्तर या सामाजिक-आर्थिक पृष्ठभूमि पर अनुचित ध्यान केंद्रित कर सकती हैं। COMPAS पर 2016 की प्रो पब्लिका रिपोर्ट ने व्यापक बहस का नेतृत्व किया कि कौन सा निष्पक्षता मीट्रिक उपयुक्त है; प्रो पब्लिका ने गलत सकारात्मक दरों से संबंधित एक मीट्रिक का उपयोग किया, जबकि नॉर्थपॉइंट ने अंशांकन-आधारित निष्पक्षता के लिए तर्क दिया। यह मामला विभिन्न निष्पक्षता परिभाषाओं के बीच मौलिक तनाव को दर्शाता है। आपराधिक न्याय से परे, छवि पहचान में पूर्वाग्रह का दस्तावेजीकरण किया गया है। 2015 में, गूगल ने माफी मांगी जब गूगल फोटोज ने गलती से एक काले जोड़े को गोरिल्ला के रूप में लेबल किया। फ्लिकर के ऑटो-टैग सुविधा ने कुछ काले लोगों को "वानर" और "जानवर" के रूप में लेबल किया। 2016 की एक अंतरराष्ट्रीय सौंदर्य प्रतियोगिता जिसे एआई एल्गोरिदम द्वारा आंका गया था, ने हल्की त्वचा वाले व्यक्तियों का पक्ष लिया, संभवतः प्रशिक्षण डेटा पूर्वाग्रह के कारण। तीन वाणिज्यिक लिंग वर्गीकरण एल्गोरिदम के 2018 के एक अध्ययन में पाया गया कि वे हल्की त्वचा वाले पुरुषों के लिए सबसे सटीक थे और गहरी त्वचा वाली महिलाओं के लिए सबसे खराब। 2020 में, एक ट्विटर छवि क्रॉपिंग उपकरण को हल्की त्वचा वाले चेहरों को पसंद करते दिखाया गया था। 2022 में, टेक्स्ट-टू-इमेज मॉडल DALL-E 2 के निर्माताओं ने स्वीकार किया कि उत्पन्न छवियां काफी हद तक रूढ़िबद्ध थीं।
सीमाएं और चल रहे अनुसंधान
निष्पक्षता मेट्रिक्स एक रामबाण नहीं हैं। निष्पक्षता की कोई सार्वभौमिक परिभाषा नहीं है, और विभिन्न मेट्रिक्स एक दूसरे का खंडन कर सकते हैं, जिससे मॉडलों का न्याय करना मुश्किल हो जाता है। एक मीट्रिक चुनना स्वाभाविक रूप से मूल्य निर्णय शामिल करता है कि किसी दिए गए संदर्भ में निष्पक्षता क्या है। इसके अलावा, मेट्रिक्स केवल सांख्यिकीय पैटर्न को मापते हैं; वे पूर्वाग्रह के मूल कारणों, जैसे पक्षपाती डेटा संग्रह या सामाजिक असमानताओं को संबोधित नहीं करते हैं। अनुसंधान पूर्वाग्रह की उत्पत्ति, पूर्वाग्रह के प्रकार और इसे कम करने के तरीकों पर जारी है। डेटा संवर्धन, पुनर्वजन, और प्रतिकूल डिबायसिंग जैसी तकनीकों का उपयोग निष्पक्षता स्कोर में सुधार के लिए किया जाता है, लेकिन वे मॉडल सटीकता के साथ व्यापार-बंद कर सकते हैं। 2020 के दशक के मध्य तक, यह क्षेत्र सक्रिय बना हुआ है, जिसमें कारण निष्पक्षता और अंतर-खंडीय निष्पक्षता जैसे क्षेत्रों में चल रहे काम शामिल हैं, जो एक साथ कई संरक्षित विशेषताओं पर विचार करता है। तकनीकी कंपनियां और शैक्षणिक संस्थान, जिनमें स्टैनफोर्ड एआई लैब और बर्कले एआई अनुसंधान शामिल हैं, इस विकसित अनुशासन में योगदान देना जारी रखते हैं।
तैनाती के लिए व्यावहारिक विचार
उच्च-दांव वाले डोमेन में मशीन लर्निंग सिस्टम तैनात करते समय, संगठनों को कानूनी और नैतिक आवश्यकताओं के साथ संरेखित निष्पक्षता मेट्रिक्स का सावधानीपूर्वक चयन करना चाहिए। उदाहरण के लिए, भर्ती में, समान अवसर को प्राथमिकता दी जा सकती है ताकि यह सुनिश्चित हो सके कि सभी समूहों के योग्य उम्मीदवारों की अनदेखी न हो। क्रेडिट ऋण में, अंशांकन पर जोर दिया जा सकता है ताकि यह सुनिश्चित हो सके कि जोखिम स्कोर सभी जनसांख्यिकी के लिए सटीक हैं। समय के साथ निष्पक्षता की निगरानी करना भी महत्वपूर्ण है, क्योंकि मॉडल बह सकते हैं और नए पूर्वाग्रह उभर सकते हैं। दस्तावेज़ीकरण और पारदर्शिता महत्वपूर्ण हैं; कई संगठन अब मॉडल कार्ड प्रकाशित करते हैं जो समूहों में निष्पक्षता मेट्रिक्स की रिपोर्ट करते हैं। हालांकि, जैसा कि COMPAS मामला दिखाता है, यहां तक कि अच्छी तरह से प्रलेखित मॉडल भी विवादों का सामना कर सकते हैं कि कौन सा मीट्रिक सही है। अंततः, निष्पक्षता मेट्रिक्स जवाबदेही के लिए एक उपकरण हैं, लेकिन उन्हें व्याख्या और कार्रवाई के लिए मानवीय निर्णय की आवश्यकता होती है। व्यापक लक्ष्य ऐसी प्रणालियों का निर्माण करना है जो न केवल समग्र मेट्रिक्स पर अच्छा प्रदर्शन करें बल्कि व्यक्तिगत गरिमा का सम्मान करें और सामाजिक समानता को बढ़ावा दें।
भविष्य की दिशाएं
निष्पक्षता मेट्रिक्स में भविष्य के अनुसंधान से कई चुनौतियों का समाधान होने की संभावना है। एक अल्पसंख्यक समूहों के लिए छोटे नमूना आकारों के लिए मजबूत मेट्रिक्स विकसित करना है, जहां सांख्यिकीय अनुमान शोरगुल वाले होते हैं। दूसरा जटिल आउटपुट के लिए मेट्रिक्स बनाना है, जैसे कि जनरेटिव मॉडल जो पाठ या छवियां उत्पन्न करते हैं, जहां पारंपरिक वर्गीकरण मेट्रिक्स लागू नहीं होते हैं। उदाहरण के लिए, जनरेटिव एआई में निष्पक्षता का मूल्यांकन करने के लिए रूढ़िबद्ध या पक्षपाती सामग्री का पता लगाने के लिए नए दृष्टिकोण की आवश्यकता होती है। सहभागी दृष्टिकोणों में भी बढ़ती रुचि है, जहां प्रभावित समुदाय यह परिभाषित करने में मदद करते हैं कि उनके संदर्भ में निष्पक्षता का क्या अर्थ है। जैसे-जैसे मशीन लर्निंग अधिक व्यापक होती जा रही है, एआई प्रणालियों से लेकर स्वास्थ्य देखभाल में स्वायत्त वाहनों तक, कठोर, संदर्भ-संवेदनशील निष्पक्षता मेट्रिक्स की मांग केवल बढ़ेगी। यह क्षेत्र अंतःविषय है, कंप्यूटर विज्ञान, सांख्यिकी, कानून और दर्शन पर आधारित है, और यह शैक्षणिक अनुसंधान और उद्योग अभ्यास दोनों का एक सक्रिय क्षेत्र बना हुआ है।