METEOR (Metric for Evaluation of Translation with Explicit ORdering) मशीन अनुवाद आउटपुट की गुणवत्ता का मूल्यांकन करने के लिए एक मीट्रिक है। यह यूनिग्राम परिशुद्धता और प्रत्यावर्तन के हार्मोनिक माध्य पर आधारित एक स्कोर की गणना करता है, जिसमें प्रत्यावर्तन को परिशुद्धता से अधिक भार दिया जाता है, और यह सटीक शब्द मिलान के अतिरिक्त स्टेमिंग और पर्यायवाची मिलान को भी शामिल करता है। यह मीट्रिक BLEU मीट्रिक की सीमाओं को संबोधित करने और वाक्य या खंड स्तर पर मानव निर्णय के साथ एक मजबूत सहसंबंध उत्पन्न करने के लिए विकसित किया गया था, जबकि BLEU का लक्ष्य कॉर्पस स्तर पर सहसंबंध है।
यह मीट्रिक जून 2005 में एन आर्बर, मिशिगन में एसोसिएशन फॉर कम्प्यूटेशनल लिंग्विस्टिक्स की 43वीं वार्षिक बैठक में आयोजित मशीन अनुवाद और सारांशीकरण के लिए आंतरिक और बाह्य मूल्यांकन उपायों पर कार्यशाला में प्रस्तुत किया गया था। रिपोर्ट किए गए परिणामों ने कॉर्पस स्तर पर मानव निर्णय के साथ 0.964 तक का सहसंबंध दिखाया, जबकि समान डेटा सेट पर BLEU का सहसंबंध 0.817 था। वाक्य स्तर पर, अधिकतम रिपोर्ट किया गया सहसंबंध 0.403 था। मीट्रिक का नाम एक पुनरावर्ती संक्षिप्त नाम है जो Metric for Evaluation of Translation with Explicit ORdering के लिए है।
प्रेरणा और डिज़ाइन
METEOR को आंशिक रूप से पहले के BLEU मीट्रिक की सीमाओं के जवाब में विकसित किया गया था, जो मशीन अनुवाद मूल्यांकन के लिए एक मानक बन गया था। BLEU मुख्य रूप से कॉर्पस स्तर पर कार्य करता है और सीमित एन-ग्राम परिशुद्धता के साथ सटीक शब्द मिलान पर निर्भर करता है। यह व्यक्तिगत वाक्यों पर लागू होने पर मानव निर्णय के साथ कमजोर सहसंबंध दिखाता था। METEOR ने प्रत्यावर्तन को परिशुद्धता से अधिक भार देकर (हार्मोनिक माध्य में 9 से 1 का अनुपात), सटीक सतह रूपों से परे मिलान के लिए भाषाई संसाधनों को शामिल करके, और खंड स्तर पर सार्थक रूप से तुलना किए जा सकने वाले स्कोर उत्पन्न करके इन कमियों को संबोधित किया।
स्कोरिंग प्रक्रिया एक संरेखण चरण से शुरू होती है। एल्गोरिदम उम्मीदवार अनुवाद में यूनिग्राम और संदर्भ अनुवाद में यूनिग्राम के बीच मैपिंग बनाता है। उम्मीदवार में प्रत्येक यूनिग्राम संदर्भ में अधिकतम एक यूनिग्राम से मैप हो सकता है। जब समान संख्या में मैपिंग के साथ कई संरेखण संभव हों, तो एल्गोरिदम मैपिंग लाइनों के बीच कम क्रॉसिंग वाले संरेखण को प्राथमिकता देता है, जो मोनोटोनिक, सन्निहित मिलानों का पक्ष लेता है।
मिलान चरण
METEOR कई चरणों में मिलान लागू करता है। पहला चरण सटीक शब्द मिलान का उपयोग करता है। बाद के चरण स्टेमिंग और पर्यायवाची पर आधारित मिलान जोड़ते हैं, जो अंग्रेजी के लिए WordNet जैसे संसाधनों पर आधारित होते हैं। प्रत्येक चरण केवल उन यूनिग्राम को जोड़ता है जो पहले के चरणों में पहले से मेल नहीं खाए हैं। यह चरणबद्ध दृष्टिकोण मीट्रिक को शब्दार्थ रूप से समकक्ष लेकिन शाब्दिक रूप से भिन्न अभिव्यक्तियों को श्रेय देने की अनुमति देता है, एक क्षमता जो पहले के मीट्रिक में नहीं थी।
संरेखण के बाद, परिशुद्धता और प्रत्यावर्तन की गणना मेल खाने वाले यूनिग्राम की संख्या से की जाती है। अंतिम F-माध्य स्कोर में प्रत्यावर्तन को परिशुद्धता से अधिक भार दिया जाता है, जिसमें सूत्र 10PR/(R+9P) का उपयोग किया जाता है। यह भारांकन उन निष्कर्षों को दर्शाता है कि अनुवाद गुणवत्ता में प्रत्यावर्तन मानव निर्णय के साथ अधिक मजबूती से सहसंबंधित होता है। अंतिम स्कोर को मेल खाने वाले यूनिग्राम के चंकों की संख्या से प्राप्त विखंडन दंड द्वारा समायोजित किया जाता है; लंबे सन्निहित मिलान कम चंक उत्पन्न करते हैं और कम दंड देते हैं।
एल्गोरिदम अवलोकन
एल्गोरिदम एक वाक्य जोड़ी पर कार्य करता है: एक उम्मीदवार अनुवाद और एक संदर्भ अनुवाद। यह बाधाओं के तहत यूनिग्राम मैप करके एक संरेखण बनाता है, जो कम क्रॉसिंग वाले संरेखणों का पक्ष लेता है। मिलान चरणों में आगे बढ़ता है, जहां प्रत्येक चरण सटीक शब्द रूपों, फिर स्टेम, फिर पर्यायवाची शब्दों पर आधारित मिलान जोड़ता है। संरेखण के बाद, यूनिग्राम परिशुद्धता मेल खाने वाले यूनिग्राम की संख्या को उम्मीदवार में कुल यूनिग्राम से विभाजित करके प्राप्त की जाती है, जबकि प्रत्यावर्तन संदर्भ में कुल यूनिग्राम से विभाजित करता है। इन्हें प्रत्यावर्तन को परिशुद्धता से नौ गुना अधिक भार देकर हार्मोनिक माध्य के रूप में जोड़ा जाता है। फिर एक दंड लागू किया जाता है जो इस बात पर आधारित होता है कि मेल खाने वाले यूनिग्राम सन्निहित चंकों में कितने खंडित हैं; कई गैर-सन्निहित मिलान वाले अनुवादों को उच्च दंड मिलता है, जिससे अंतिम स्कोर 50 प्रतिशत तक कम हो जाता है।
कॉर्पस के लिए, सभी खंडों में समग्र परिशुद्धता, प्रत्यावर्तन और दंड मानों की गणना की जाती है। जब कई संदर्भ अनुवाद उपलब्ध हों, तो उम्मीदवार को प्रत्येक के विरुद्ध स्कोर किया जाता है और उच्चतम स्कोर बनाए रखा जाता है।
BLEU के साथ तुलना
BLEU, जो पहले पेश किया गया था, संक्षिप्तता दंड के साथ एन-ग्राम ओवरलैप मापता है और मशीन अनुवाद अनुसंधान में व्यापक रूप से उपयोग किया जाता है। हालांकि, यह सटीक शब्द मिलान पर निर्भर करता है और पर्यायवाची या रूपात्मक रूपों को ध्यान में नहीं रखता है। METEOR को स्टेमिंग और पर्यायवाची मैपिंग का उपयोग करके और प्रत्यावर्तन को अधिक भार देकर इन मुद्दों को दूर करने के लिए डिज़ाइन किया गया था। रिपोर्ट किए गए प्रयोगों ने संकेत दिया कि METEOR ने कॉर्पस स्तर पर मानव निर्णय के साथ 0.964 तक का सहसंबंध हासिल किया, जबकि BLEU ने समान डेटा पर 0.817 हासिल किया। खंड स्तर पर, METEOR ने अधिकतम 0.403 का सहसंबंध दिखाया, जिसे समर्थकों ने व्यक्तिगत वाक्यों के मूल्यांकन के लिए बेहतर उपयुक्त बताया।
एल्गोरिदम विवरण
METEOR में संरेखण प्रक्रिया उम्मीदवार अनुवाद से यूनिग्राम को संदर्भ अनुवाद में यूनिग्राम से मैप करती है, जिसमें प्रत्येक उम्मीदवार यूनिग्राम अधिकतम एक संदर्भ यूनिग्राम से मैप होता है। एल्गोरिदम सबसे अधिक संख्या में मैपिंग वाले संरेखण का चयन करता है; जब दो संरेखणों में समान संख्या में मैपिंग होती है, तो यह मेल खाने वाले यूनिग्राम के बीच कम क्रॉसिंग लाइनों वाले को चुनता है। मिलान चरणों में आगे बढ़ता है: पहले सटीक शब्द मिलान, फिर स्टेम मिलान (स्टेमिंग टूल का उपयोग करके), फिर पर्यायवाची मिलान। प्रत्येक चरण केवल उन यूनिग्राम के लिए मैपिंग जोड़ता है जो पिछले चरणों में पहले से मेल नहीं खाए हैं।
अंतिम संरेखण की गणना के बाद, परिशुद्धता P और प्रत्यावर्तन R की गणना की जाती है। हार्मोनिक माध्य Fmean को 10PR/(R+9P) के रूप में परिभाषित किया गया है, जो प्रत्यावर्तन को परिशुद्धता का नौ गुना भार देता है। प्रवाह और शब्द क्रम को ध्यान में रखने के लिए, एल्गोरिदम मेल खाने वाले यूनिग्राम को न्यूनतम संभव चंकों में समूहित करता है, जहां एक चंक यूनिग्राम का एक सेट है जो उम्मीदवार और संदर्भ दोनों में सन्निहित हैं। दंड p की गणना 0.5 × (c/um)^3 के रूप में की जाती है, जहां c चंकों की संख्या है और um मैप किए गए यूनिग्राम की संख्या है। अंतिम खंड स्कोर Fmean को (1 - p) से गुणा करके प्राप्त किया जाता है।
अनुप्रयोग और विस्तार
METEOR का उपयोग मशीन अनुवाद के लिए मूल्यांकन अभियानों में किया गया है, विशेष रूप से साझा कार्यों और प्रणाली तुलनाओं में जहां वाक्य-स्तरीय विश्वसनीयता मायने रखती है। चूंकि इसे खंड स्तर पर लागू किया जा सकता है, यह कॉर्पस-स्तरीय मीट्रिक के लिए आसानी से समर्थन नहीं कर सकने वाले तरीकों से अनुवाद आउटपुट को ट्यून करने और विश्लेषण करने के लिए उपयोगी है। समय के साथ विविधताएं और विस्तार सामने आए हैं, जिनमें विभिन्न भाषा जोड़ों और सारांशीकरण मूल्यांकन के लिए तैयार किए गए संस्करण शामिल हैं। मीट्रिक ने छवि कैप्शनिंग जैसे संबंधित क्षेत्रों में बाद के मूल्यांकन दृष्टिकोणों को भी प्रभावित किया है, जहां पर्यायवाची मिलान और एन-ग्राम ओवरलैप उपयोगी साबित हुए हैं।
सीमाएं
मीट्रिक अभी भी संदर्भ अनुवादों पर निर्भर करता है और शाब्दिक ओवरलैप से निहित से परे अनुवाद गुणवत्ता के पहलुओं जैसे प्रवाह को कैप्चर नहीं करता है। पूर्वनिर्धारित पर्यायवाची संसाधनों पर इसकी निर्भरता डोमेन-विशिष्ट शब्दावली या ऐसे संसाधनों की कमी वाली भाषाओं के लिए प्रदर्शन को सीमित कर सकती है। जबकि प्रारंभिक प्रयोगों में कॉर्पस स्तर पर मानव निर्णय के साथ सहसंबंध उच्च बताया गया था, वाक्य-स्तरीय सहसंबंध मध्यम बना रहा, जो खंड-स्तरीय स्वचालित मूल्यांकन की अंतर्निहित कठिनाई को दर्शाता है। बाद के विविधताओं और वैकल्पिक मीट्रिक ने इन विचारों पर निर्माण जारी रखा है।