अंग्रेज़ी से अनुवादित

ROUGE(Recall-Oriented Understudy for Gisting Evaluation)是一组用于评估自动摘要和机器翻译的指标和软件,通过将系统输出与人工参考进行比较,得分范围从0到1。

ROUGE, या Recall-Oriented Understudy for Gisting Evaluation, मेट्रिक्स का एक समूह और एक सॉफ्टवेयर पैकेज है जिसका उपयोग प्राकृतिक भाषा प्रसंस्करण में स्वचालित सारांशीकरण और मशीन अनुवाद सॉफ्टवेयर के मूल्यांकन के लिए किया जाता है। ये मेट्रिक्स स्वचालित रूप से उत्पन्न सारांश या अनुवाद की तुलना एक संदर्भ या संदर्भों के समूह (मानव-निर्मित) सारांश या अनुवाद से करते हैं। ROUGE मेट्रिक्स 0 और 1 के बीच होते हैं, जहाँ उच्च स्कोर स्वचालित रूप से उत्पन्न सारांश और संदर्भ के बीच उच्च समानता दर्शाते हैं।

ROUGE को 2004 में चिन-यू लिन और एडुआर्ड होवी द्वारा पेश किया गया था, जो दक्षिणी कैलिफोर्निया विश्वविद्यालय के सूचना विज्ञान संस्थान के शोधकर्ता थे। इसे पाठ सारांशीकरण में स्वचालित मूल्यांकन विधियों की बढ़ती आवश्यकता के जवाब में विकसित किया गया था, जो पहले काफी हद तक मानवीय निर्णय पर निर्भर था। यह नाम BLEU मेट्रिक पर एक व्यंग्य है, जो सटीकता पर केंद्रित है, जबकि ROUGE पुनर्प्राप्ति पर जोर देता है, जो इसके इस फोकस को दर्शाता है कि सिस्टम आउटपुट संदर्भ सामग्री का कितना हिस्सा कैप्चर करता है।

मुख्य मेट्रिक्स

ROUGE पैकेज में पाँच प्राथमिक मूल्यांकन मेट्रिक्स शामिल हैं, जिनमें से प्रत्येक सिस्टम और संदर्भ सारांश के बीच समानता के विभिन्न पहलुओं को कैप्चर करता है।

ROUGE-N

ROUGE-N सिस्टम और संदर्भ सारांश के बीच n-ग्राम के ओवरलैप को मापता है। n-ग्राम किसी दिए गए पाठ से n वस्तुओं का एक सन्निहित अनुक्रम है। ROUGE-1 सिस्टम और संदर्भ सारांश के बीच यूनिग्राम (प्रत्येक शब्द) के ओवरलैप को संदर्भित करता है, जबकि ROUGE-2 बिग्राम (आसन्न शब्दों के जोड़े) के ओवरलैप को संदर्भित करता है। उच्च-क्रम वाले n-ग्राम, जैसे ROUGE-3 या ROUGE-4, कम सामान्यतः उपयोग किए जाते हैं लेकिन निर्दिष्ट किए जा सकते हैं। मेट्रिक की गणना ओवरलैपिंग n-ग्राम की संख्या और संदर्भ सारांश में कुल n-ग्राम की संख्या के अनुपात के रूप में की जाती है, जो इसे पुनर्प्राप्ति-उन्मुख बनाता है।

ROUGE-L

ROUGE-L सिस्टम और संदर्भ सारांश के बीच सबसे लंबे सामान्य अनुक्रम (LCS) का उपयोग करता है। LCS शब्दों का सबसे लंबा अनुक्रम है जो दोनों पाठों में समान क्रम में दिखाई देता है, हालाँकि आवश्यक रूप से सन्निहित नहीं। यह दृष्टिकोण स्वाभाविक रूप से वाक्य-स्तरीय संरचना समानता को कैप्चर करता है और स्वचालित रूप से सबसे लंबे सह-घटित इन-सीक्वेंस n-ग्राम की पहचान करता है। ROUGE-N के विपरीत, ROUGE-L को सटीक n-ग्राम मिलान की आवश्यकता नहीं होती है और यह शब्द क्रम में भिन्नताओं के प्रति अधिक मजबूत है।

ROUGE-W

ROUGE-W ROUGE-L का एक भारित संस्करण है जो लगातार LCS मिलानों का पक्ष लेता है। मानक LCS में, पाँच लगातार शब्दों के मिलान और पाठ में बिखरे हुए पाँच शब्दों के मिलान को समान रूप से माना जाता है। ROUGE-W लगातार मिलानों को अधिक भार देता है, जो सारांशीकरण गुणवत्ता में सन्निहित वाक्यांशों के महत्व को बेहतर ढंग से दर्शाता है।

ROUGE-S

ROUGE-S स्किप-बिग्राम सह-घटना आँकड़ों को मापता है। स्किप-बिग्राम उनके वाक्य क्रम में शब्दों का कोई भी जोड़ा है, जिसमें उनके बीच मनमाने अंतराल की अनुमति होती है। उदाहरण के लिए, वाक्य "the cat sat on the mat" में, स्किप-बिग्राम में "the cat," "the sat," "cat sat," "cat on," इत्यादि शामिल हैं। यह मेट्रिक शब्द-स्तरीय सह-घटना पैटर्न को कैप्चर करता है जबकि शब्द क्रम में लचीलेपन की अनुमति देता है।

ROUGE-SU

ROUGE-SU ROUGE-S को यूनिग्राम सह-घटना आँकड़े जोड़कर विस्तारित करता है। यह संयोजन एक अधिक व्यापक माप प्रदान करता है जो व्यक्तिगत शब्द मिलान और स्किप-बिग्राम मिलान दोनों को ध्यान में रखता है। ROUGE-SU का उपयोग अक्सर उन सारांशों के मूल्यांकन में किया जाता है जिनमें महत्वपूर्ण शाब्दिक भिन्नता हो सकती है।

उपयोग और कार्यान्वयन

ROUGE सॉफ्टवेयर पैकेज मूल रूप से Perl में और बाद में Java में लागू किया गया था, जिसमें Java कार्यान्वयन व्यापक रूप से अपनाया गया। पैकेज में सभी पाँच मेट्रिक्स की गणना के लिए स्क्रिप्ट शामिल हैं, साथ ही इनपुट फ़ाइलों को संसाधित करने और परिणामों को प्रारूपित करने के लिए उपयोगिताएँ भी शामिल हैं। ROUGE का उपयोग करने के लिए, मूल्यांकनकर्ता सिस्टम सारांश और संदर्भ सारांश सादे पाठ फ़ाइलों में तैयार करते हैं, फिर निर्दिष्ट मापदंडों के साथ उपयुक्त स्क्रिप्ट चलाते हैं, जैसे ROUGE-N के लिए n-ग्राम क्रम या ROUGE-W के लिए भार कारक।

ROUGE प्राकृतिक भाषा प्रसंस्करण के क्षेत्र में एक मानक मूल्यांकन उपकरण बन गया है। इसका उपयोग शोध पत्रों, शैक्षणिक प्रतियोगिताओं और उद्योग मूल्यांकनों में व्यापक रूप से किया जाता है। उदाहरण के लिए, डॉक्यूमेंट अंडरस्टैंडिंग कॉन्फ्रेंस (DUC) और टेक्स्ट एनालिसिस कॉन्फ्रेंस (TAC), दोनों अमेरिकी राष्ट्रीय मानक और प्रौद्योगिकी संस्थान द्वारा आयोजित, ने सारांशीकरण कार्यों के लिए ROUGE को प्राथमिक मूल्यांकन मेट्रिक के रूप में उपयोग किया है। इन सम्मेलनों ने ROUGE के विकास और सत्यापन को काफी हद तक प्रेरित किया है।

अन्य मेट्रिक्स से संबंध

ROUGE की तुलना अक्सर BLEU से की जाती है, जो मशीन अनुवाद के लिए एक और व्यापक रूप से उपयोग किया जाने वाला मेट्रिक है। जबकि BLEU सटीकता पर केंद्रित है, यह मापता है कि सिस्टम आउटपुट में कितने n-ग्राम संदर्भ में दिखाई देते हैं, ROUGE पुनर्प्राप्ति पर केंद्रित है, यह मापता है कि संदर्भ में कितने n-ग्राम सिस्टम आउटपुट में दिखाई देते हैं। व्यवहार में, कई मूल्यांकन संतुलित दृष्टिकोण प्रदान करने के लिए दोनों मेट्रिक्स की रिपोर्ट करते हैं। अन्य संबंधित मेट्रिक्स में METEOR शामिल है, जो समानार्थकता और स्टेमिंग को शामिल करता है, और NIST मेट्रिक, जो n-ग्राम मिलानों को सूचना सामग्री द्वारा भारित करता है। ROUGE F-माप से भी संबंधित है, जो सटीकता और पुनर्प्राप्ति को एकल स्कोर में जोड़ता है, और शब्द त्रुटि दर (WER) से, जो भाषण पहचान में उपयोग किया जाता है।

आधुनिक AI में अनुप्रयोग

बड़े भाषा मॉडल और जनरेटिव AI प्रणालियों के उदय के साथ, ROUGE ने नई प्रासंगिकता पाई है। ये मॉडल, जैसे कि OpenAI, Anthropic, और Google DeepMind द्वारा विकसित, अक्सर ROUGE का उपयोग करके सारांशीकरण कार्यों पर मूल्यांकन किए जाते हैं। उदाहरण के लिए, CNN/Daily Mail और XSum जैसे बेंचमार्क, जिनमें मानव-लिखित सारांश वाले समाचार लेख शामिल हैं, आमतौर पर मॉडल प्रदर्शन का परीक्षण करने के लिए उपयोग किए जाते हैं, जिसमें ROUGE स्कोर अन्य मेट्रिक्स के साथ रिपोर्ट किए जाते हैं।

हालाँकि, ROUGE की ज्ञात सीमाएँ हैं। यह पूरी तरह से शाब्दिक ओवरलैप पर निर्भर करता है और अर्थ संबंधी अर्थ, समानार्थक शब्द या पैराफ्रेज़िंग को ध्यान में नहीं रखता है। एक सारांश जो समान जानकारी को अलग-अलग शब्दों का उपयोग करके व्यक्त करता है, उच्च गुणवत्ता होने के बावजूद कम ROUGE स्कोर प्राप्त कर सकता है। इसने आलोचना और वैकल्पिक मेट्रिक्स के विकास को जन्म दिया है, जैसे BERTScore, जो ट्रांसफार्मर मॉडल से प्रासंगिक एम्बेडिंग का उपयोग करता है, और MoverScore, जो दूरी मापों के साथ अर्थ संबंधी समानता को जोड़ता है। इन विकल्पों के बावजूद, ROUGE अपनी सरलता, व्याख्यात्मकता और कम कम्प्यूटेशनल लागत के कारण व्यापक रूप से उपयोग में बना हुआ है।

व्यावहारिक विचार

ROUGE का उपयोग करते समय, कई व्यावहारिक कारक परिणामों को प्रभावित कर सकते हैं। संदर्भ सारांशों का चुनाव महत्वपूर्ण है; कई संदर्भों का उपयोग विश्वसनीयता में सुधार कर सकता है, क्योंकि यह मानव सारांशीकरण में परिवर्तनशीलता को ध्यान में रखता है। प्रीप्रोसेसिंग चरण, जैसे स्टेमिंग या स्टॉप शब्दों को हटाना, भी स्कोर को प्रभावित कर सकते हैं। सारांशों की लंबाई भी मायने रखती है; ROUGE लंबे सिस्टम सारांशों का पक्ष लेता है क्योंकि उनमें संदर्भ n-ग्राम होने की अधिक संभावना होती है, हालाँकि इसे लंबाई दंड का उपयोग करके या सटीकता और पुनर्प्राप्ति दोनों के साथ मूल्यांकन करके कम किया जा सकता है।

हाल के वर्षों में, मशीन लर्निंग समुदाय ने आधुनिक सारांशीकरण प्रणालियों के मूल्यांकन के लिए ROUGE की पर्याप्तता पर बहस की है। अध्ययनों से पता चला है कि ROUGE मानवीय निर्णयों के साथ केवल मध्यम रूप से सहसंबंधित है, विशेष रूप से अमूर्त सारांशीकरण के लिए, जहाँ मॉडल वाक्यांशों को निकालने के बजाय नए वाक्य उत्पन्न करते हैं। इसने अधिक मजबूत मूल्यांकन ढाँचों के लिए आह्वान किया है जो कृत्रिम बुद्धिमत्ता-आधारित मेट्रिक्स को शामिल करते हैं, जैसे कि तंत्रिका नेटवर्क और गहन शिक्षण तकनीकों का उपयोग करने वाले।

निष्कर्ष

ROUGE पाठ सारांशीकरण और मशीन अनुवाद के मूल्यांकन में एक आधारभूत उपकरण बना हुआ है। इसके पाँच मेट्रिक्स शाब्दिक समानता पर दृष्टिकोणों की एक श्रृंखला प्रदान करते हैं, सरल यूनिग्राम ओवरलैप से लेकर जटिल स्किप-बिग्राम और LCS-आधारित मापों तक। जबकि नए मेट्रिक्स अधिक परिष्कृत अर्थ संबंधी विश्लेषण प्रदान करते हैं, ROUGE की उपयोग में आसानी और स्थापित ट्रैक रिकॉर्ड शैक्षणिक और औद्योगिक दोनों सेटिंग्स में इसके निरंतर उपयोग को सुनिश्चित करते हैं। जैसे-जैसे जनरेटिव AI आगे बढ़ता जा रहा है, विश्वसनीय मूल्यांकन मेट्रिक्स की आवश्यकता केवल बढ़ेगी, और ROUGE संभवतः एक बेंचमार्क बना रहेगा जिसके विरुद्ध नई विधियों की तुलना की जाती है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:natural-language-processing·evaluation-metrics·text-summarization·machine-translation
इस पृष्ठ को अंतिम बार संपादित किया गया 9 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास