One-hot encoding मशीन लर्निंग में श्रेणीबद्ध चरों को बाइनरी वैक्टर के रूप में प्रस्तुत करने की एक विधि है। इस प्रस्तुति में, प्रत्येक विशिष्ट श्रेणी को श्रेणियों की संख्या के बराबर लंबाई वाला एक अद्वितीय वेक्टर सौंपा जाता है, जहाँ सभी तत्व 0 होते हैं, सिवाय उस श्रेणी के अनुरूप स्थिति पर एक 1 के। उदाहरण के लिए, यदि किसी विशेषता में तीन श्रेणियाँ हैं - लाल, हरा, नीला - तो उन्हें क्रमशः [1,0,0], [0,1,0], और [0,0,1] के रूप में एन्कोड किया जा सकता है। यह परिवर्तन उन एल्गोरिदम को, जो संख्यात्मक डेटा पर काम करते हैं, जैसे कि Machine learning और Deep learning में उपयोग होने वाले, श्रेणीबद्ध इनपुट को श्रेणियों के बीच कोई क्रमिक संबंध निहित किए बिना संसाधित करने की अनुमति देता है।
यह तकनीक विभिन्न अनुप्रयोगों के लिए डेटा प्रीप्रोसेसिंग पाइपलाइनों में व्यापक रूप से उपयोग की जाती है, जिसमें प्राकृतिक भाषा प्रसंस्करण, कंप्यूटर विज़न, और सारणीबद्ध डेटा विश्लेषण शामिल हैं। यह पारंपरिक मशीन लर्निंग मॉडलों जैसे कि रैखिक प्रतिगमन, लॉजिस्टिक प्रतिगमन, और सपोर्ट वेक्टर मशीनों में विशेष रूप से आम है, जिन्हें संख्यात्मक इनपुट विशेषताओं की आवश्यकता होती है। इसके विपरीत, पेड़-आधारित मॉडल जैसे कि निर्णय वृक्ष और रैंडम फ़ॉरेस्ट अक्सर श्रेणीबद्ध चरों को सीधे संभाल सकते हैं, हालाँकि स्थिरता और अन्य मॉडल प्रकारों के साथ संगतता के लिए one-hot encoding अभी भी अक्सर लागू किया जाता है।
ऐतिहासिक विकास
श्रेणीबद्ध डेटा को बाइनरी संकेतक चरों के साथ प्रस्तुत करने की अवधारणा की जड़ें सांख्यिकी और प्रयोगात्मक डिज़ाइन में हैं, जो 20वीं सदी के मध्य तक जाती हैं। सांख्यिकीविदों ने प्रतिगमन विश्लेषण में श्रेणीबद्ध भविष्यवक्ताओं को एन्कोड करने के लिए डमी चरों का उपयोग किया, जो "one-hot encoding" शब्द से पहले की प्रथा है। विशिष्ट नाम "one-hot" ने 1990 और 2000 के दशक में डिजिटल सर्किट डिज़ाइन समुदाय के भीतर प्रमुखता प्राप्त की, जहाँ यह परिमित-अवस्था मशीनों में एक राज्य एन्कोडिंग योजना को संदर्भित करता था जिसमें किसी भी समय ठीक एक बिट उच्च (1) होता है। यह शब्दावली बाद में मशीन लर्निंग समुदाय द्वारा अपनाई गई, विशेष रूप से 2010 के दशक में Neural network अनुसंधान के विस्तार के साथ।
Artificial intelligence के संदर्भ में, one-hot encoding श्रेणीबद्ध डेटा को तंत्रिका नेटवर्क में खिलाने के लिए एक मानक प्रीप्रोसेसिंग चरण बन गया। प्रारंभिक अनुप्रयोगों में भाषा मॉडलों के लिए शब्दों को एन्कोड करना शामिल था, जहाँ शब्दावली में प्रत्येक शब्द को एक one-hot वेक्टर के रूप में प्रस्तुत किया जाता था। यह दृष्टिकोण word2vec जैसे मौलिक मॉडलों में उपयोग किया गया था, जिसे 2013 में Google के शोधकर्ताओं द्वारा विकसित किया गया था, जो one-hot इनपुट वैक्टर से घने एम्बेडिंग सीखते थे। यह तकनीक आधुनिक Large language model आर्किटेक्चर में प्रासंगिक बनी हुई है, हालाँकि ये मॉडल दक्षता के लिए आमतौर पर कच्चे one-hot वैक्टर के बजाय सीखी गई एम्बेडिंग का उपयोग करते हैं।
मशीन लर्निंग में अनुप्रयोग
One-hot encoding विविध डोमेन में लागू किया जाता है। प्राकृतिक भाषा प्रसंस्करण में, यह एम्बेडिंग परतों द्वारा अधिक संक्षिप्त प्रस्तुतियाँ सीखने से पहले शब्दों या वर्णों को प्रस्तुत करने के लिए एक आधार रेखा के रूप में कार्य करता है। कंप्यूटर विज़न में, इसका उपयोग वर्गीकरण कार्यों के लिए वर्ग लेबलों को एन्कोड करने के लिए किया जाता है, जैसे कि छवि पहचान डेटासेट में जहाँ प्रत्येक छवि कई श्रेणियों में से एक से संबंधित होती है। उदाहरण के लिए, ImageNet डेटासेट में, कन्वोल्यूशनल तंत्रिका नेटवर्कों को प्रशिक्षित करने के लिए वर्ग लेबल अक्सर one-hot एन्कोड किए जाते हैं।
सारणीबद्ध डेटा विश्लेषण में, देश, उत्पाद प्रकार, या ग्राहक खंड जैसी श्रेणीबद्ध विशेषताओं को संभालने के लिए one-hot encoding मानक है। pandas और scikit-learn जैसी डेटा विज्ञान लाइब्रेरी इस परिवर्तन के लिए अंतर्निहित फ़ंक्शन प्रदान करती हैं, जिससे यह चिकित्सकों के लिए सुलभ हो जाता है। यह तकनीक अनुशंसा प्रणालियों में भी उपयोग की जाती है, जहाँ उपयोगकर्ता और आइटम श्रेणीबद्ध आईडी को सहयोगी फ़िल्टरिंग मॉडलों में पारित करने से पहले एन्कोड किया जाता है।
लाभ और सीमाएँ
One-hot encoding का प्राथमिक लाभ इसकी सरलता और क्रम की कमी है। लेबल एन्कोडिंग के विपरीत, जो पूर्णांक मान (जैसे, 0, 1, 2) निर्दिष्ट करता है और एक गलत क्रमिक संबंध निहित कर सकता है, one-hot encoding सभी श्रेणियों को समान रूप से दूर मानता है। यह गुण उन मॉडलों के लिए महत्वपूर्ण है जो दूरी मीट्रिक पर निर्भर करते हैं, जैसे कि k-निकटतम पड़ोसी या कर्नेल फ़ंक्शन वाले सपोर्ट वेक्टर मशीनें।
हालाँकि, one-hot encoding की उल्लेखनीय सीमाएँ हैं। यह उच्च-आयामी और विरल फीचर स्थानों को जन्म दे सकता है, विशेष रूप से जब एक श्रेणीबद्ध चर में कई अद्वितीय मान होते हैं। उदाहरण के लिए, 100,000 शब्दों की शब्दावली को एन्कोड करने से 100,000-आयामी वैक्टर उत्पन्न होते हैं, जो कम्प्यूटेशनल रूप से महंगा और मेमोरी-गहन है। इस समस्या को अक्सर आयामीता कम करने की तकनीकों या सीखी गई एम्बेडिंग का उपयोग करके संबोधित किया जाता है, जैसा कि Transformer (architecture) मॉडलों में देखा गया है। इसके अतिरिक्त, one-hot encoding श्रेणियों के बीच संबंधों को नहीं पकड़ता है, जैसे कि समानता या पदानुक्रम, जो कुछ अनुप्रयोगों में एक कमी हो सकती है।
एम्बेडिंग से संबंध
आधुनिक डीप लर्निंग में, one-hot encoding अक्सर एम्बेडिंग परतों से पहले एक मध्यवर्ती चरण के रूप में उपयोग किया जाता है। एक एम्बेडिंग परत अनिवार्य रूप से एक रैखिक परिवर्तन है जो एक one-hot वेक्टर को एक घने, निचले-आयामी वेक्टर में मैप करता है। यह दृष्टिकोण मॉडलों को प्रशिक्षण के दौरान श्रेणियों के सार्थक प्रस्तुतियाँ सीखने की अनुमति देता है। उदाहरण के लिए, प्राकृतिक भाषा प्रसंस्करण के लिए Neural network आर्किटेक्चर में, इनपुट टोकन को पहले one-hot वैक्टर में परिवर्तित किया जाता है और फिर एक एम्बेडिंग मैट्रिक्स के माध्यम से पारित किया जाता है, जिसे बैकप्रोपेगेशन के माध्यम से अद्यतन किया जाता है।
यह संबंध विशेष रूप से Transformer (architecture) मॉडलों में स्पष्ट है, जो कई समकालीन Large language model प्रणालियों को रेखांकित करते हैं। जबकि ये मॉडल दक्षता कारणों से सीधे one-hot वैक्टर का उपयोग नहीं करते हैं, अवधारणा मौलिक बनी हुई है। Stanford AI Lab और MIT CSAIL जैसे संस्थानों के शोधकर्ताओं ने one-hot encoding के सैद्धांतिक गुणों और प्रस्तुति सीखने में इसकी भूमिका का अध्ययन किया है, जो कृत्रिम बुद्धिमत्ता प्रणालियों में श्रेणीबद्ध जानकारी को कैसे संसाधित किया जाता है, की गहरी समझ में योगदान देता है।
व्यावहारिक विचार
One-hot encoding लागू करते समय, चिकित्सकों को अदृश्य श्रेणियों को संभालना चाहिए जो परीक्षण डेटा में दिखाई दे सकती हैं लेकिन प्रशिक्षण के दौरान मौजूद नहीं थीं। सामान्य रणनीतियों में एक "अज्ञात" श्रेणी जोड़ना या एक फ़ॉलबैक एन्कोडिंग का उपयोग करना शामिल है। एक और विचार one-hot encoding और बाइनरी एन्कोडिंग या ऑर्डिनल एन्कोडिंग जैसी अन्य योजनाओं के बीच चयन है, जो अभिव्यक्ति के लिए आयामीता का व्यापार करती हैं। उच्च-कार्डिनैलिटी परिदृश्यों में, फीचर हैशिंग या लक्ष्य एन्कोडिंग जैसी तकनीकों को प्राथमिकता दी जा सकती है।
अधिक परिष्कृत एम्बेडिंग विधियों के उदय के बावजूद, one-hot encoding मशीन लर्निंग टूलकिट में एक मौलिक उपकरण बना हुआ है। इसकी सरलता, व्याख्यात्मकता, और एल्गोरिदम की एक विस्तृत श्रृंखला के साथ संगतता शैक्षणिक अनुसंधान और उद्योग अनुप्रयोगों दोनों में इसके निरंतर उपयोग को सुनिश्चित करती है, Amazon Web Services क्लाउड-आधारित ML पाइपलाइनों से लेकर Google Cloud डेटा प्रोसेसिंग सेवाओं तक।