TF-IDF (शब्द आवृत्ति-व्युत्क्रम दस्तावेज़ आवृत्ति) एक संख्यात्मक सांख्यिकी है जिसका उद्देश्य यह दर्शाना है कि किसी संग्रह या कोष में किसी दस्तावेज़ के लिए एक शब्द कितना महत्वपूर्ण है। यह दो घटकों का गुणनफल है: शब्द आवृत्ति (TF), जो मापती है कि कोई शब्द किसी दस्तावेज़ में कितनी बार आता है, और व्युत्क्रम दस्तावेज़ आवृत्ति (IDF), जो उन शब्दों को कम महत्व देती है जो कई दस्तावेज़ों में बार-बार आते हैं। यह तकनीक 1970 के दशक में विकसित की गई थी और मशीन लर्निंग और तंत्रिका नेटवर्क आधारित दृष्टिकोणों के उदय से पहले सूचना पुनर्प्राप्ति, पाठ वर्गीकरण और खोज इंजन रैंकिंग में एक आधारभूत विधि बन गई।
TF-IDF के पीछे मूल अंतर्ज्ञान यह है कि एक शब्द जो किसी एक दस्तावेज़ में अक्सर आता है लेकिन शेष कोष में शायद ही कभी आता है, उस दस्तावेज़ की सामग्री का अत्यधिक वर्णनात्मक होने की संभावना है। इसके विपरीत, सामान्य शब्द जैसे "और" या "का" लगभग हर दस्तावेज़ में आते हैं और इस प्रकार उनमें बहुत कम विभेदक शक्ति होती है। स्थानीय आवृत्ति को वैश्विक दुर्लभता के साथ जोड़कर, TF-IDF प्रत्येक शब्द-दस्तावेज़ जोड़े को एक भार प्रदान करता है जिसका उपयोग दस्तावेज़ों को उच्च-आयामी स्थान में सदिश के रूप में प्रस्तुत करने के लिए किया जा सकता है, जिससे समानता गणना और क्लस्टरिंग संभव होती है।
ऐतिहासिक विकास
शब्दों को उनकी दस्तावेज़ आवृत्ति द्वारा भारित करने की अवधारणा की जड़ें 1950 और 1960 के दशक में हैं, जिसमें ज़ेरॉक्स पार्क में हंस पीटर लुहान और अन्य लोगों का प्रारंभिक कार्य शामिल है। TF-IDF का आधुनिक सूत्रीकरण अक्सर कैरेन स्पार्क जोन्स को श्रेय दिया जाता है, जिन्होंने 1972 में "ए स्टैटिस्टिकल इंटरप्रिटेशन ऑफ टर्म स्पेसिफिसिटी एंड इट्स एप्लीकेशन इन रिट्रीवल" शीर्षक से एक महत्वपूर्ण शोधपत्र प्रकाशित किया। उनके कार्य ने व्युत्क्रम दस्तावेज़ आवृत्ति घटक को एक लघुगणकीय स्केलिंग कारक के रूप में स्थापित किया। कॉर्नेल विश्वविद्यालय में जेरार्ड साल्टन और उनके सहयोगियों द्वारा बाद के परिशोधनों ने TF-IDF को SMART सूचना पुनर्प्राप्ति प्रणाली में एकीकृत किया, जो एक मानक अनुसंधान मंच बन गया।
गणितीय सूत्रीकरण
दस्तावेज़ \( d \) में शब्द \( t \) के लिए, शब्द आवृत्ति \( tf(t,d) \) आमतौर पर घटनाओं की कच्ची गिनती होती है, हालांकि विविधताओं में लघुगणकीय स्केलिंग या द्विआधारी उपस्थिति का उपयोग किया जाता है। व्युत्क्रम दस्तावेज़ आवृत्ति को इस प्रकार परिभाषित किया गया है:
\[ idf(t) = \log \frac{N}{df(t)} \]
जहाँ \( N \) कोष में दस्तावेज़ों की कुल संख्या है और \( df(t) \) उन दस्तावेज़ों की संख्या है जिनमें शब्द शामिल है। TF-IDF भार तब है:
\[ tfidf(t,d) = tf(t,d) \times idf(t) \]
व्यवहार में, कोष से अनुपस्थित शब्दों के लिए शून्य से विभाजन से बचने के लिए अक्सर स्मूथिंग जोड़ी जाती है, और लंबाई पूर्वाग्रह को कम करने के लिए दस्तावेज़ सदिशों पर सामान्यीकरण (जैसे L2 सामान्यीकरण) लागू किया जाता है।
सूचना पुनर्प्राप्ति में अनुप्रयोग
शास्त्रीय सूचना पुनर्प्राप्ति प्रणालियों में, TF-IDF भार का उपयोग उपयोगकर्ता क्वेरी के विरुद्ध दस्तावेज़ों को रैंक करने के लिए किया जाता है। क्वेरी को TF-IDF भार के सदिश के रूप में प्रस्तुत किया जाता है, और दस्तावेज़ों को क्वेरी सदिश और प्रत्येक दस्तावेज़ सदिश के बीच कोसाइन समानता द्वारा रैंक किया जाता है। यह सदिश स्थान मॉडल, जिसे साल्टन ने लोकप्रिय बनाया, 1980 और 1990 के दशक में खोज इंजनों के लिए प्रमुख दृष्टिकोण था। TF-IDF कई पाठ खनन कार्यों को भी रेखांकित करता है, जिसमें दस्तावेज़ क्लस्टरिंग, कीवर्ड निष्कर्षण और स्वचालित सारांशीकरण शामिल हैं।
सीमाएँ और आधुनिक संदर्भ
TF-IDF की कई ज्ञात सीमाएँ हैं। यह शब्दों को स्वतंत्र मानता है, शब्दार्थ संबंधों और शब्द क्रम की उपेक्षा करता है। यह विरल शब्द अतिव्यापन के कारण छोटे दस्तावेज़ों या क्वेरी पर भी खराब प्रदर्शन करता है। बड़े भाषा मॉडल और ट्रांसफॉर्मर-आधारित वास्तुकलाओं के आगमन के साथ, सघन सदिश एम्बेडिंग ने कई कार्यों के लिए TF-IDF को काफी हद तक बदल दिया है, क्योंकि वे प्रासंगिक अर्थ को पकड़ते हैं। हालाँकि, TF-IDF अभी भी एक आधार रेखा के रूप में, पारंपरिक मशीन लर्निंग मॉडल के लिए एक विशेषता के रूप में, और सीमित कम्प्यूटेशनल संसाधनों वाले डोमेन में व्यापक रूप से उपयोग किया जाता है। यह संकर पुनर्प्राप्ति प्रणालियों में भी एक सामान्य घटक है जो विरल और सघन संकेतों को जोड़ती हैं।
विविधताएँ और विस्तार
TF-IDF की कई विविधताएँ मौजूद हैं, जिनमें BM25 (बेस्ट मैचिंग 25) शामिल है, जो शब्द आवृत्ति संतृप्ति और दस्तावेज़ लंबाई सामान्यीकरण का परिचय देता है, और अक्सर आधुनिक खोज प्रणालियों में पसंद किया जाता है। अन्य विस्तार भाषण के भाग टैगिंग को शामिल करते हैं या सबलीनियर TF स्केलिंग का उपयोग करते हैं। ओकापी BM25 रैंकिंग फ़ंक्शन, जिसे 1990 के दशक में स्टीफन रॉबर्टसन और कैरेन स्पार्क जोन्स द्वारा विकसित किया गया था, सूचना पुनर्प्राप्ति में एक मानक बना हुआ है और Elasticsearch जैसे कई ओपन-सोर्स खोज इंजनों में उपयोग किया जाता है।
यह भी देखें
- सूचना पुनर्प्राप्ति
- मशीन लर्निंग
- प्राकृतिक भाषा प्रसंस्करण
- सदिश स्थान मॉडल