श्रेणी उपयोगिता एक संख्यात्मक माप है जिसका उपयोग अवधारणात्मक क्लस्टरिंग और मशीन लर्निंग में वस्तुओं के समूहों में वर्गीकरण या वर्गीकरण की गुणवत्ता का मूल्यांकन करने के लिए किया जाता है। यह किसी वस्तु के गुणों की भविष्यवाणी करने की क्षमता में वृद्धि को मापता है जब उसकी श्रेणी ज्ञात होती है, उस स्थिति की तुलना में जब वह ज्ञात नहीं होती। यह मीट्रिक 1985 में मार्क ए. ग्लक और जेम्स ई. कॉर्टर द्वारा पेश किया गया था, जिसका उद्देश्य उन श्रेणियों के निर्माण का मार्गदर्शन करना था जो सूचना लाभ या भविष्यवाणी शक्ति को अधिकतम करें। तब से यह अप्रशिक्षित लर्निंग कार्यों में एक मानक उद्देश्य बन गया है, विशेष रूप से उन प्रणालियों में जो वर्गीकरण या पदानुक्रमित वर्गीकरण उत्पन्न करती हैं।
मूल विचार यह है कि एक अच्छी श्रेणी वह है जहाँ यह जानना कि कोई वस्तु उससे संबंधित है, उसकी विशेषताओं को अधिक पूर्वानुमानित बनाता है। श्रेणी उपयोगिता दो सहज मानदंडों को जोड़ती है: श्रेणी-आंतरिक समानता, जहाँ एक ही श्रेणी की वस्तुओं में कई सामान्य गुण होने चाहिए, और श्रेणी-बाह्य असमानता, जहाँ विभिन्न श्रेणियों की वस्तुएँ भिन्न होनी चाहिए। यह मीट्रिक इन मानदंडों को एक संभाव्य ढांचे में औपचारिक रूप देता है, जिससे यह शोर या अधूरे डेटा पर लागू होता है। सरल सटीकता या शुद्धता मापों के विपरीत, श्रेणी उपयोगिता गुण भविष्यवाणी में अनिश्चितता को ध्यान में रखती है, उन श्रेणियों को पुरस्कृत करती है जो एन्ट्रॉपी को कम करती हैं।
औपचारिक परिभाषा और गणना
श्रेणी उपयोगिता की गणना प्रत्येक श्रेणी की संभावना और श्रेणी दिए जाने पर गुण मानों की सशर्त संभावनाओं के आधार पर की जाती है। बाइनरी या नाममात्र गुणों द्वारा वर्णित वस्तुओं के समूह के लिए, मीट्रिक को श्रेणी ज्ञात होने पर किसी गुण मान की सही भविष्यवाणी की संभावना में अपेक्षित वृद्धि के रूप में परिभाषित किया जाता है, श्रेणी जानकारी के बिना आधारभूत भविष्यवाणी संभावना को घटाकर। इसे सभी गुणों पर जोड़ा जाता है और श्रेणी की पूर्व संभावना से भारित किया जाता है।
व्यवहार में, दो-श्रेणी मामले के लिए, श्रेणी उपयोगिता प्रत्येक श्रेणी के भीतर साझा विशेषताओं की संख्या और श्रेणियों के बीच साझा विशेषताओं की संख्या के बीच एक समझौते को सरल बनाती है। सूत्र अक्सर इस प्रकार व्यक्त किया जाता है: CU = (1/n) श्रेणियों पर योग P(C) [गुणों पर योग मानों पर योग (P(A=a|C)^2 - P(A=a)^2)], जहाँ n गुणों की संख्या है। संभावनाओं का वर्गीकरण इस संभावना को दर्शाता है कि श्रेणी से यादृच्छिक रूप से निकाली गई दो वस्तुएँ गुण मान साझा करती हैं, जो संज्ञानात्मक मनोविज्ञान में बुनियादी-स्तर श्रेणियों पर ग्लक और कॉर्टर के काम से एक प्रमुख अंतर्दृष्टि है।
अवधारणात्मक क्लस्टरिंग में उपयोग
श्रेणी उपयोगिता कई अवधारणात्मक क्लस्टरिंग एल्गोरिदम में मूल मूल्यांकन फ़ंक्शन के रूप में कार्य करती है, विशेष रूप से 1987 में University of Toronto में डगलस फिशर द्वारा विकसित COBWEB प्रणाली में। COBWEB वृद्धिशील रूप से श्रेणियों का एक निर्णय वृक्ष या पदानुक्रम बनाता है, श्रेणी उपयोगिता का उपयोग यह तय करने के लिए करता है कि प्रत्येक नई वस्तु को कहाँ रखा जाए, मौजूदा श्रेणियों को विलय या विभाजित करना है, या एक नई श्रेणी बनाना है। श्रेणी उपयोगिता को अधिकतम करने वाले विभाजनों के लिए एल्गोरिदम की लालची खोज इसे श्रेणियों की संख्या के पूर्व ज्ञान के बिना व्याख्या योग्य, संभाव्य अवधारणा पदानुक्रम उत्पन्न करने में सक्षम बनाती है।
उपयोगिता फ़ंक्शन ने अन्य क्लस्टरिंग विधियों को भी प्रभावित किया है और डेटा माइनिंग और पैटर्न पहचान जैसे क्षेत्रों में अपनाया गया है। उदाहरण के लिए, इसका उपयोग उच्च-आयामी डेटा के क्लस्टरिंग में किया जाता है जहाँ पारंपरिक दूरी मीट्रिक विफल हो सकते हैं। मीट्रिक की संभाव्य नींव इसे लापता मानों को संभालने के लिए विशेष रूप से उपयुक्त बनाती है, क्योंकि यह केवल देखे गए गुणों पर अपेक्षाओं की गणना करता है।
सूचना सिद्धांत और मनोविज्ञान से संबंध
श्रेणी उपयोगिता की अवधारणा का सूचना सिद्धांत से गहरा संबंध है। इसे श्रेणी चर और गुण चर के बीच पारस्परिक सूचना के रूप में व्याख्या किया जा सकता है, एक स्थिरांक द्वारा स्केल किया गया। वास्तव में, ग्लक और कॉर्टर ने इसे श्रेणी "सुसंगतता" के माप से प्राप्त किया जिसे उन्होंने "श्रेणी" माप कहा, जो G-सूचकांक से निकटता से संबंधित है। यह सैद्धांतिक संबंध सुविधा चयन और क्लस्टरिंग समाधानों के मूल्यांकन के लिए एक मानदंड के रूप में इसके उपयोग को उचित ठहराने में मदद करता है, क्योंकि यह सीधे मापता है कि एक वर्गीकरण वस्तु के गुणों के बारे में अनिश्चितता को कितना कम करता है।
श्रेणी उपयोगिता मूल रूप से बुनियादी-स्तर श्रेणियों - अमूर्तता का स्तर जो मनुष्यों को सबसे स्वाभाविक लगता है (जैसे, "कुत्ता" बनाम "जानवर" या "बीगल") में संज्ञानात्मक विज्ञान अनुसंधान से प्रेरित थी। ग्लक और कॉर्टर के प्रयोगों ने दिखाया कि बुनियादी स्तर उच्चतम श्रेणी उपयोगिता वाली श्रेणियों से मेल खाता है, यह सुझाव देते हुए कि माप एक मनोवैज्ञानिक रूप से प्रासंगिक सिद्धांत को पकड़ता है। यह संबंध Artificial intelligence और Machine learning में शोधकर्ताओं के लिए रुचि का रहा है जो मानव-जैसी अवधारणा सीखने का अध्ययन करते हैं, जिनमें MIT CSAIL और Stanford AI Lab जैसे संस्थान शामिल हैं।
विस्तार और सुधार
इसकी शुरुआत के बाद से, श्रेणी उपयोगिता के कई विस्तार सीमाओं को संबोधित करने या इसे विशिष्ट डोमेन के अनुकूल बनाने के लिए प्रस्तावित किए गए हैं। एक विस्तार संभाव्यता घनत्व अनुमानों का उपयोग करके निरंतर गुणों को संभालता है, अक्सर सामान्य वितरण मानता है जिन्हें आने वाले डेटा के साथ अद्यतन किया जाता है। एक और संशोधन गुण भार को शामिल करता है, जिससे कुछ विशेषताएँ उपयोगिता गणना में दूसरों की तुलना में अधिक योगदान कर सकती हैं, जो तब उपयोगी होता है जब डोमेन ज्ञान इंगित करता है कि कुछ गुण अधिक महत्वपूर्ण हैं।
Deep learning और आधुनिक Artificial intelligence के संदर्भ में, श्रेणी उपयोगिता को अप्रशिक्षित प्रतिनिधित्व सीखने के लिए एक वैकल्पिक उद्देश्य के रूप में माना गया है - अव्यक्त विशेषताओं को व्याख्या योग्य क्लस्टर में व्यवस्थित करना। हालाँकि, इसका उपयोग बड़े पैमाने पर दृष्टिकोणों जैसे Generative AI और Transformer (architecture)-आधारित मॉडलों द्वारा काफी हद तक प्रतिस्थापित किया गया है जो असतत श्रेणियों के बजाय वितरित प्रतिनिधित्व सीखते हैं। फिर भी, व्याख्या योग्य समूहों की आवश्यकता वाले कार्यों के लिए, जैसे Figure AI में रोबोटिक्स या Commure में चिकित्सा डेटा विश्लेषण, श्रेणी उपयोगिता अभी भी ब्लैक-बॉक्स क्लस्टरिंग के लिए एक सैद्धांतिक और पारदर्शी विकल्प प्रदान करती है।
सीमाएँ और आलोचनाएँ
श्रेणी उपयोगिता अपनी कमियों के बिना नहीं है। यह मानता है कि गुण श्रेणी दिए जाने पर स्वतंत्र हैं, एक मजबूत धारणा जो अक्सर वास्तविक दुनिया के डेटा में उल्लंघन होती है जहाँ विशेषताएँ सहसंबद्ध होती हैं। मीट्रिक लगभग समान आकार की श्रेणियों का भी पक्ष लेता है, क्योंकि यह श्रेणी पूर्व संभावना से भारित होता है, जो असंतुलित डेटासेट में वांछनीय नहीं हो सकता है। इसके अलावा, संभावनाओं का वर्गीकरण गुण मान आवृत्तियों के प्रति संवेदनशील हो सकता है, जिससे कुछ स्थितियों में दुर्लभ मानों के प्रति पूर्वाग्रह हो सकता है।
इन मुद्दों के बावजूद, श्रेणी उपयोगिता एक ऐतिहासिक रूप से महत्वपूर्ण मीट्रिक बनी हुई है जिसने क्लस्टरिंग और अवधारणा सीखने में कई बाद के विकासों की नींव रखी। केवल समानता के बजाय भविष्यवाणी उपयोगिता पर इसका जोर Machine learning और Artificial intelligence में व्यापक लक्ष्यों के साथ संरेखित होता है: सार्थक अमूर्तता के माध्यम से अनदेखे डेटा को सामान्यीकृत करने वाले मॉडल बनाना। आज तक, यह अभी भी संज्ञानात्मक मॉडलिंग और अप्रशिक्षित लर्निंग पर कई स्नातक पाठ्यक्रमों में पढ़ाया जाता है, जिससे इसका निरंतर प्रभाव सुनिश्चित होता है। भविष्य का काम मीट्रिक को फिर से देख सकता है क्योंकि क्षेत्र अधिक व्याख्या योग्य और संभाव्य वर्गीकरण दृष्टिकोण चाहता है, संभावित रूप से BAIR (Berkeley AI Research) या Xerox PARC जैसी अनुसंधान प्रयोगशालाओं में जहाँ मौलिक एल्गोरिदम का अक्सर पुनर्मूल्यांकन किया जाता है।