अंग्रेज़ी से अनुवादित

ROUGE मेट्रिक्स का एक समूह है जो स्वचालित सारांशीकरण और मशीन अनुवाद का मूल्यांकन करने के लिए उपयोग किया जाता है, जिसमें जनरेट किए गए पाठ की तुलना संदर्भ सारांशों से की जाती है, और यह रिकॉल पर केंद्रित होता है। यह उम्मीदवार और संदर्भ पाठों के बीच n-ग्राम, शब्द अनुक्रमों और शब्द जोड़ों के अतिव्यापन को मापता है।

ROUGE (Recall-Oriented Understudy for Gisting Evaluation) स्वचालित मूल्यांकन मेट्रिक्स का एक परिवार है जिसे मशीन-जनित सारांशों और अनुवादों की गुणवत्ता का आकलन करने के लिए डिज़ाइन किया गया है। इसे 2004 में चिन-यू लिन और एडुआर्ड होवी द्वारा दक्षिणी कैलिफोर्निया विश्वविद्यालय के सूचना विज्ञान संस्थान में पेश किया गया था। मेट्रिक परिवार एक उम्मीदवार पाठ (मशीन-जनित सारांश) की तुलना एक या अधिक संदर्भ पाठों (आमतौर पर मानव-लिखित सारांश) के साथ करके और शाब्दिक ओवरलैप की डिग्री को मापकर काम करता है, जिसमें विशेष जोर रिकॉल पर होता है (संदर्भ सामग्री का कितना हिस्सा उम्मीदवार में दिखाई देता है)। जबकि पहले के मेट्रिक्स जैसे BLEU, जो 2002 में मशीन अनुवाद के लिए विकसित किया गया था, परिशुद्धता पर केंद्रित थे, ROUGE का रिकॉल की ओर झुकाव इसे सारांशीकरण के लिए विशेष रूप से उपयुक्त बनाता है, जहां स्रोत से सभी महत्वपूर्ण बिंदुओं को पकड़ना महत्वपूर्ण है।

ROUGE प्राकृतिक भाषा प्रसंस्करण (NLP) में सारांशीकरण प्रणालियों के बेंचमार्किंग और विकास के लिए मानक उपकरणों में से एक बना हुआ है, जिसमें आधुनिक बड़े भाषा मॉडल पर निर्मित प्रणालियाँ शामिल हैं। इसे DUC (दस्तावेज़ समझ सम्मेलन) जैसे प्रमुख साझा कार्यों में शामिल किया गया है और यह मानव मूल्यांकन के लिए तुलना का बिंदु रहा है। हालांकि इसकी ज्ञात सीमाएँ हैं, इसकी पारदर्शी गणना और सरलता ने इसे अनुसंधान और उद्योग में एक सामान्य प्रथम-पंक्ति मेट्रिक बना दिया है।

मुख्य प्रकार

ROUGE में कई अलग-अलग मेट्रिक्स शामिल हैं, जिनमें से प्रत्येक पाठ ओवरलैप के विभिन्न पहलुओं को मापता है। सबसे अधिक उपयोग किए जाने वाले प्रकार हैं:

  • ROUGE-N: यह उम्मीदवार और संदर्भ के बीच n-ग्राम (N शब्दों के सन्निहित अनुक्रम) के ओवरलैप को मापता है। ROUGE-1 यूनिग्राम (एकल शब्द) का उपयोग करता है, ROUGE-2 बिग्राम (दो-शब्द अनुक्रम) का उपयोग करता है, और ROUGE-3 और ROUGE-4 कम उपयोग किए जाते हैं। ROUGE-N का सूत्र ओवरलैपिंग n-ग्राम की संख्या को संदर्भ में कुल n-ग्राम की संख्या से विभाजित करके प्राप्त किया जाता है। ROUGE-1 और ROUGE-2 सबसे अधिक रिपोर्ट किए जाने वाले प्रकार हैं, जो अक्सर GEM बेंचमार्क और शैक्षणिक पत्रों जैसे लीडरबोर्ड पर दिखाई देते हैं।
  • ROUGE-L: सबसे लंबे सामान्य अनुक्रम तकनीक पर आधारित। यह शब्दों का सबसे लंबा अनुक्रम ढूंढता है जो उम्मीदवार और संदर्भ दोनों में दिखाई देता है, क्रम में लेकिन जरूरी नहीं कि सन्निहित हो। यह मेट्रिक वाक्य-स्तरीय संरचना को पकड़ता है और पुनर्क्रमण को दंडित करता है। ROUGE-L में सबसे लंबे सामान्य अनुक्रम (LCS) आधारित रिकॉल, परिशुद्धता, और एक F-माप शामिल है, जो दोनों का हार्मोनिक माध्य है।
  • ROUGE-W: ROUGE-L का एक भारित संस्करण जो लगातार मिलानों को अधिक श्रेय देता है। यह कम उपयोग किया जाता है लेकिन उन कार्यों के लिए महत्वपूर्ण हो सकता है जहां वाक्यांश-स्तरीय क्रम में प्रवाह महत्वपूर्ण है।
  • ROUGE-S: स्किप-बिग्राम आधारित मेट्रिक, जो वाक्य क्रम में किसी भी शब्द जोड़ी की अनुमति देता है, चाहे उनके बीच की दूरी कुछ भी हो। यह शब्द क्रम को ढीले ढंग से पकड़ता है। एक सामान्य संस्करण ROUGE-SU है, जो अतिरिक्त रूप से यूनिग्राम शामिल करता है। ROUGE-S अक्सर लंबे सारांशों के लिए उपयोग किया जाता है।
  • ROUGE-SU: ROUGE-S को यूनिग्राम मिलान के साथ जोड़ता है, जो तब उपयोगी होता है जब संदर्भ उम्मीदवार के पर्यायवाची का उपयोग करता है - और एक संतुलित दृष्टिकोण प्रदान करता है।

रिकॉल, परिशुद्धता, और F-स्कोर

जबकि ROUGE का मूल डिज़ाइन रिकॉल पर केंद्रित था, मेट्रिक को परिशुद्धता (उम्मीदवार में मिलान वाले n-ग्राम का उम्मीदवार में कुल n-ग्राम से अनुपात) और F1-स्कोर (रिकॉल और परिशुद्धता का हार्मोनिक माध्य) के रूप में भी गणना की जा सकती है। मानक स्क्रिप्ट आमतौर पर तीन सेट संख्याएँ लौटाती हैं: ROUGE-1-R (रिकॉल), ROUGE-1-P (परिशुद्धता), और ROUGE-1-F (F1)। अभ्यासकर्ता अक्सर एकल सारांश मेट्रिक के रूप में F1 मान की रिपोर्ट करते हैं। हालांकि, कुछ पत्र मूल परिभाषा का पालन करते हुए केवल रिकॉल की रिपोर्ट करते हैं, जो भ्रामक हो सकता है क्योंकि लंबे, वाचाल सारांश उत्पन्न करने वाली प्रणालियाँ रिकॉल पर उच्च स्कोर करती हैं। यह परिशुद्धता और F1 की भी जाँच करने का एक प्रमुख कारण है।

गणना उदाहरण

एक संदर्भ सारांश पर विचार करें: "The cat sat on the mat"। एक उम्मीदवार सारांश: "The cat is on the mat।" ROUGE-1 के लिए शब्द टोकन के साथ (स्टेमिंग के बाद, जो अक्सर प्रत्येक शब्द को उसके मूल रूप में कम करने के लिए लागू किया जाता है), ओवरलैपिंग यूनिग्राम 'the', 'cat', 'on', 'mat' हैं (ध्यान दें 'the' दोनों में दिखाई देता है, 'sat' नहीं दिखाई देता)। स्टॉपवर्ड हटाने के साथ (स्टॉपवर्ड हैं the, a, on) संख्याएँ बदल जाएँगी। लेकिन औपचारिक रूप से ROUGE-1 रिकॉल = (4) / (5 संदर्भ यूनिग्राम: 'the', 'cat', 'sat', 'on', 'the' एक बार गिना गया) = 4/5 = 0.8। परिशुद्धता = 4/5 (उम्मीदवार में 5 यूनिग्राम हैं 'the', 'cat', 'is', 'on', 'mat') = 0.8। F1 = (20.80.8)/(0.8+0.8) = 0.8। यह उदाहरण शाब्दिक ओवरलैप दिखाता है लेकिन यह पर्यायवाची पर विफल होता है ('sat' बनाम 'was' गायब होगा)। इसलिए स्टेमिंग (पोर्टर स्टेमर) का उपयोग भी होता है जो 'sat' को नियमों के आधार पर कम करता है, लेकिन विश्वसनीय रूप से नहीं।

इतिहास और विकास

ROUGE को 2004 में "Automatic Evaluation of Summaries Using N-gram Co-Ocurrence Statistics" शीर्षक वाले एक पेपर में पेश किया गया था, जो एसोसिएशन फॉर कम्प्यूटेशनल लिंग्विस्टिक्स की 36वीं वार्षिक बैठक की कार्यवाही में प्रकाशित हुआ था। होवी और लिन ने इसे दस्तावेज़ समझ सम्मेलनों के लिए विकसित किया, जो 2001 में शुरू हुआ स्वचालित सारांशीकरण का एक वार्षिक मूल्यांकन था। समय के साथ, ROUGE स्वचालित सारांशीकरण के लिए मानक स्वचालित संदर्भ सेट बन गया, और बाद में इसे अमेरिकी राष्ट्रीय मानक और प्रौद्योगिकी संस्थान (NIST) द्वारा पाठ विश्लेषण सम्मेलन के लिए अपनाया गया।

मेट्रिक की उत्पत्ति पहले के काम से हुई। यह इस विचार पर आधारित है कि पाठों के बीच समानता को शब्द ओवरलैप द्वारा मापा जा सकता है, जो सूचना पुनर्प्राप्ति में पहले के तरीकों जैसे बैग ऑफ वर्ड्स मॉडल से जुड़ा है। लेकिन ROUGE ने इस सेटिंग में रिकॉल के उपयोग को मानकीकृत किया।

बाद के प्रकारों और सुधार प्रयासों में स्टेमिंग और स्टॉपवर्ड सूची प्रसंस्करण की शुरुआत, और कई टूलकिट की उपलब्धता शामिल थी। सबसे आम कार्यान्वयन लिन द्वारा विकसित ROUGE पैकेज के हिस्से के रूप में पर्ल स्क्रिप्टिंग में है, जो अभी भी SourceForge पर बना हुआ है। अधिक आधुनिक पायथन लाइब्रेरी जैसे "py-rouge" और Google से पैकेज "rouge_score" में "Rouge Score" ने अधिक कुशल कार्यान्वयन प्रदान किया, जिससे समकालीन प्रणालियों के बड़े पाठ आउटपुट को संभालना संभव हो गया।

आधुनिक NLP में उपयोग

आधुनिक अनुक्रम-से-अनुक्रम प्रणालियों के युग में, ROUGE मूल्यांकन सेटअप का एक अभिन्न हिस्सा रहा है। अनुवाद के लिए, यह BLEU का पूरक था। सारांशीकरण के लिए, यह मुख्य उपकरण है। निष्कर्षण प्रणालियों के लिए, जो इनपुट से वाक्यों की नकल करती हैं, वे आसानी से उच्च स्कोर करती हैं; सारगर्भित गहन शिक्षण मॉडल के लिए, वे महत्वपूर्ण सामग्री को पुन: पेश करते हैं लेकिन शाब्दिक ओवरलैप पर कम स्कोर कर सकते हैं।

पाइस और सावॉय जैसे कार्य, या तंत्रिका विधियों की तुलना करने वाले हाल के पेपर, विशेष रूप से Google DeepMind से CLIFF सिस्टम या OpenAI के GPT मॉडल में सुधार, ROUGE मान शामिल करते हैं। ROUGE का उपयोग प्रश्न उत्तर और दस्तावेज़ सरलीकरण जैसे कार्यों में भी किया जाता है, आकस्मिक संदर्भ के कारण।

इसका उपयोग आलोचना के बिना नहीं रहा है। शोध से पता चला है कि ROUGE मानव निर्णय के साथ केवल मध्यम रूप से सहसंबंधित है, विशेष रूप से सारगर्भित सारांशों के लिए। अर्थ संबंधी पर्यायवाची मिलान और पैराफ्रेज़िंग पहचान की कमी एक प्रमुख कमी है। क्योंकि यह पूरी तरह से शाब्दिक है, एक पैराफ्रेज़ जो संदर्भ के समान अच्छा है लेकिन सटीक शब्दों से मेल नहीं खाता, उसे काफी कम ROUGE स्कोर मिलता है। इससे अन्य मूल्यांकन मेट्रिक्स का विकास हुआ, जैसे BERTScore (2019), जो तंत्रिका Transformer (architecture) मॉडल से एम्बेडिंग का उपयोग करता है, और METEOR जो स्टेमिंग और पर्यायवाची हैंडलिंग को शामिल करता है।

इनके बावजूद, ROUGE को डिफ़ॉल्ट के रूप में उपयोग किया जाता है क्योंकि यह सस्ता, नियतात्मक और समझने में आसान है। कई मॉडल कार्ड और शोध रिपोर्ट नए उपायों के साथ ROUGE प्रकाशित करते हैं।

अनुसंधान और बेंचमार्क में अनुप्रयोग

CNN/DailyMail (Map, AMF से प्राप्त) जैसे बड़े सार्वजनिक सारांश सेट और Xsum और BIllSum जैसे अन्य सेट - कई पेपर इनकी रिपोर्ट करते हैं। बड़े भाषा मॉडल युग की रेखा का अनुसरण करते हुए, मॉडल और मानव-लिखित सारांशों की तुलना करने वाले अध्ययनों ने FAR के साथ ROUGE का उपयोग किया। 2003 में DUC श्रृंखला में केवल एक या दो संदर्भ शामिल थे; कई संदर्भों के साथ विशिष्ट आधुनिक अभ्यास में, ROUGE अधिकतम या औसत का उपयोग करके स्कोर भी एकत्र करता है।

व्यावहारिक विचार

ROUGE का उपयोग करते समय, कुछ मानक तरकीबें हैं जो स्कोर को प्रभावित करती हैं:

  • स्टेमिंग: अक्सर विभिन्न शब्द रूपों को सामान्य करने के लिए पोर्टर स्टेमर का उपयोग किया जाता है (बिल्लियाँ -> बिल्ली)।
  • स्टॉपवर्ड हटाना: कुछ पाइपलाइन शोर कम करने के लिए 'the', 'a' जैसे लगातार शब्दों को बाहर करती हैं, लेकिन यह स्कोर कम कर सकता है।
  • लंबाई: ROUGE सारांश लंबाई के प्रति संवेदनशील है। लंबे सारांश स्वाभाविक रूप से उच्च ध्यान रखते हैं। आम तौर पर, इसे क्रॉस-डेटासेट उपयोग नहीं किया जा सकता।
  • कई संदर्भ: कई संदर्भ गुणवत्ता (R1) का उपयोग करने से स्कोर बढ़ जाता है, क्योंकि अधिक विशिष्ट n-ग्राम कवर होते हैं।
  • F-माप: जैसा कि उल्लेख किया गया है, T1 रिपोर्ट 1-2 या सभी का उपयोग कर सकती है, लेकिन लगातार महत्वपूर्ण है।

समीक्षा और भविष्य की दिशाएँ

उम्र के बावजूद, ROUGE जा रहा नहीं है। इसकी वही दीर्घायु है जो भाषा मॉडलिंग में Perplexity की है - या एक सरल मेट्रिक नहीं हो सकता। पिछले वर्ष में, कार्यों ने क्रम और तथ्यों को बेहतर ढंग से संबोधित करने के लिए संशोधन प्रस्तावित किए हैं, या मॉडल के साथ प्रवेश का उपयोग करने के लिए, लेकिन ये महंगे हैं।

ROUGE एक सुसंगत, व्याख्या योग्य तरीका प्रदान करता है यह जाँचने के लिए कि उम्मीदवार संदर्भ से सामग्री नहीं चूकता है, और यह पाठ समझ कार्यों में Sequence-to-Sequence (Seq2Seq) मॉडल के मूल्यांकन के लिए एक मानक हिस्सा बना हुआ है। शोध समुदाय इसे आधार के रूप में रखता है, पूरक के लिए मेट्रिक्स जोड़ता है।

मानव परिणामों और रचनात्मक सारांशों को संभालने में भविष्य के शोध इसे अप्रचलित कर सकते हैं, लेकिन स्कोर स्वयं एक सरल आधार रेखा माप के रूप में बने रहने की संभावना है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:evaluation-metrics·natural-language-processing·text-summarization
इस पृष्ठ को अंतिम बार संपादित किया गया 9 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास