स्पष्ट अर्थगत विश्लेषण (Explicit semantic analysis)

अंग्रेज़ी से अनुवादित

स्पष्ट अर्थवैज्ञानिक विश्लेषण (ESA) एक सदिश पाठ प्रतिनिधित्व तकनीक है जो एक दस्तावेज़ संग्रह, आमतौर पर विकिपीडिया, को ज्ञान आधार के रूप में उपयोग करके शब्दों और दस्तावेज़ों को अवधारणा सदिशों के रूप में प्रस्तुत करती है, ताकि अर्थवैज्ञानिक संबंधता को मापा जा सके।

स्पष्ट अर्थ विश्लेषण (ईएसए) पाठ का एक वेक्टरल प्रतिनिधित्व है जिसका उपयोग प्राकृतिक भाषा प्रसंस्करण और सूचना पुनर्प्राप्ति में किया जाता है। यह व्यक्तिगत शब्दों या संपूर्ण दस्तावेजों को एक उच्च-आयामी स्थान में वैक्टर के रूप में दर्शाता है, जहां प्रत्येक आयाम एक अवधारणा से मेल खाता है जिसे मनुष्यों द्वारा स्पष्ट रूप से परिभाषित किया गया है, जैसे कि एक विकिपीडिया लेख। यह तकनीक एवगेनी गैब्रिलोविच और शाऊल मार्कोविच द्वारा पाठ वर्गीकरण में सुधार करने और कोसाइन समानता का उपयोग करके ग्रंथों के बीच अर्थ संबंधी संबंध की गणना करने के लिए डिज़ाइन की गई थी। यह नाम अव्यक्त अर्थ विश्लेषण (एलएसए) के विपरीत है, क्योंकि ईएसए का ज्ञानकोष का उपयोग मानव-पठनीय लेबल को वेक्टर स्थान बनाने वाली अवधारणाओं को सौंपने की अनुमति देता है।

ईएसए एक दस्तावेज़ कॉर्पस को ज्ञानकोष के रूप में उपयोग करके संचालित होता है। अपने मूल रूप में, एक शब्द को कॉर्पस के टर्म फ्रीक्वेंसी-इनवर्स डॉक्यूमेंट फ्रीक्वेंसी (टीएफ-आईडीएफ) मैट्रिक्स में एक कॉलम वेक्टर के रूप में दर्शाया जाता है, और एक दस्तावेज़ को उसके घटक शब्दों के वैक्टर के केंद्रक के रूप में दर्शाया जाता है। जबकि अंग्रेजी विकिपीडिया विशिष्ट कॉर्पस है, अन्य संग्रह जैसे ओपन डायरेक्ट्री प्रोजेक्ट का भी उपयोग किया गया है।

मॉडल

मूल ईएसए संस्करण ग्रंथों के संग्रह से शुरू होता है, जैसे सभी विकिपीडिया लेख, जिनकी संख्या एन दस्तावेज़ होती है। प्रत्येक दस्तावेज़ को "शब्दों के थैले" - एक टर्म फ्रीक्वेंसी हिस्टोग्राम - में परिवर्तित किया जाता है और एक उल्टे सूचकांक में संग्रहीत किया जाता है। किसी भी दिए गए शब्द के लिए, उल्टा सूचकांक उस शब्द वाले दस्तावेजों का सेट लौटाता है, प्रत्येक दस्तावेज़ को इस आधार पर स्कोर किया जाता है कि शब्द कितनी बार प्रकट होता है, दस्तावेज़ में शब्दों की कुल संख्या से भारित। गणितीय रूप से, यह आउटपुट शब्द-दस्तावेज़ स्कोर का एक एन-आयामी वेक्टर है, जहां शब्द वाले दस्तावेज़ों को शून्य का स्कोर मिलता है।

दो शब्दों की संबद्धता की गणना करने के लिए, उनके वैक्टर यू और वी की तुलना कोसाइन समानता का उपयोग करके की जाती है: सिम (यू, वी) = (यू · वी) / (||यू|| ||वी||)। यह अर्थ संबंधी संबंध का एक संख्यात्मक अनुमान देता है। यह योजना एकल शब्दों से बहु-शब्द ग्रंथों तक फैली हुई है, जिसमें पाठ के सभी शब्दों के वैक्टर को जोड़कर एक दस्तावेज़-स्तरीय प्रतिनिधित्व तैयार किया जाता है।

विश्लेषण

ईएसए मूल रूप से इस धारणा के तहत प्रस्तावित किया गया था कि ज्ञानकोष में विषयगत रूप से ऑर्थोगोनल अवधारणाएं शामिल हैं। हालांकि, माइक एंडरका और बेनो स्टीन ने बाद में प्रदर्शित किया कि ईएसए समाचार वायर लेखों के रॉयटर्स कॉर्पस पर आधारित होने पर भी सूचना पुनर्प्राप्ति प्रदर्शन में सुधार करता है, जो ऑर्थोगोनैलिटी संपत्ति को संतुष्ट नहीं करता है। उनके प्रयोगों में, समाचार वायर कहानियों ने "अवधारणाओं" के रूप में कार्य किया। यह अवलोकन ईएसए और सामान्यीकृत वेक्टर स्पेस मॉडल के बीच लिंक के माध्यम से समझाया गया था। गैब्रिलोविच और मार्कोविच ने यह नोट करके जवाब दिया कि एंडरका और स्टीन का परिणाम पाठ समानता के लिए ईएसए के एकल अनुप्रयोग और केवल 50 समाचार दस्तावेजों के एक छोटे, सजातीय परीक्षण संग्रह का उपयोग करके प्राप्त किया गया था।

अनुप्रयोग

शब्द संबद्धता

ईएसए को इसके लेखकों द्वारा अर्थ संबंधी समानता के विपरीत, अर्थ संबंधी संबंध का एक माप माना जाता है। शब्द संबद्धता के लिए बेंचमार्क डेटासेट पर, ईएसए अन्य एल्गोरिदम से बेहतर प्रदर्शन करता है, जिसमें वर्डनेट-आधारित अर्थ संबंधी समानता उपाय और स्किप-ग्राम तंत्रिका भाषा मॉडल जैसे वर्ड2वेक शामिल हैं। यह दृष्टिकोण पाठ वर्गीकरण कार्यों में लागू किया गया है, जहां अवधारणा-आधारित प्रतिनिधित्व वर्गीकरण सटीकता में सुधार करता है।

दस्तावेज़ संबद्धता

ईएसए का उपयोग दस्तावेजों की संबद्धता की गणना के लिए वाणिज्यिक सॉफ्टवेयर पैकेजों में किया जाता है। विशेष क्षेत्रों में अधिक मजबूत दस्तावेज़ मिलान प्रदान करने के लिए कभी-कभी ईएसए मॉडल पर डोमेन-विशिष्ट प्रतिबंध लागू किए जाते हैं। व्याख्या योग्य अवधारणा वैक्टर उत्पन्न करने की तकनीक की क्षमता इसे पारदर्शी प्रतिनिधित्व की आवश्यकता वाले अनुप्रयोगों के लिए मूल्यवान बनाती है।

विस्तार

क्रॉस-भाषा स्पष्ट अर्थ विश्लेषण (सीएल-ईएसए) ईएसए का एक बहुभाषी सामान्यीकरण है। सीएल-ईएसए एक दस्तावेज़-संरेखित बहुभाषी संदर्भ संग्रह का उपयोग करता है, आमतौर पर फिर से विकिपीडिया, एक दस्तावेज़ को भाषा-स्वतंत्र अवधारणा वेक्टर के रूप में प्रस्तुत करने के लिए। विभिन्न भाषाओं में दो दस्तावेजों की संबद्धता का आकलन उनके संबंधित वेक्टर प्रतिनिधित्व के बीच कोसाइन समानता द्वारा किया जाता है। यह विस्तार क्रॉस-भाषा सूचना पुनर्प्राप्ति और भाषा सीमाओं के पार ग्रंथों की तुलना को सक्षम बनाता है।

ईएसए को Machine learning और Artificial intelligence में व्यापक विकास से भी जोड़ा गया है, विशेष रूप से Natural language processing कार्यों के संदर्भ में। इसकी स्पष्ट, व्याख्या योग्य अवधारणा स्थान इसे बाद के Deep learning दृष्टिकोणों जैसे Neural network एम्बेडिंग से अलग करता है, हालांकि दोनों का उद्देश्य पाठ में अर्थ संबंधी संबंधों को पकड़ना है। यह विधि अर्थ प्रतिनिधित्व के लिए एक मौलिक तकनीक के रूप में प्रासंगिक बनी हुई है, जो Large language model और Transformer (architecture) आर्किटेक्चर जैसे हाल के मॉडलों का पूरक है।

बाहरी लिंक

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:natural-language-processing·information-retrieval·semantic-analysis·text-representation
इस पृष्ठ को अंतिम बार संपादित किया गया 14 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास