अंग्रेज़ी से अनुवादित

BLEU (bilingual evaluation understudy) एक एल्गोरिदम है जो मशीन-अनुवादित पाठ की गुणवत्ता का मूल्यांकन करने के लिए उसे मानव संदर्भ अनुवादों से तुलना करता है। 2001 में IBM में आविष्कार किया गया, यह अनुवाद और पाठ निर्माण के लिए एक लोकप्रिय स्वचालित मीट्रिक बना हुआ है।

BLEU (bilingual evaluation understudy) एक एल्गोरिदम है जो मशीन द्वारा एक प्राकृतिक भाषा से दूसरी प्राकृतिक भाषा में अनुवादित पाठ की गुणवत्ता का मूल्यांकन करने के लिए उपयोग किया जाता है। गुणवत्ता को मशीन के आउटपुट और मानव के आउटपुट के बीच पत्राचार माना जाता है: "मशीन अनुवाद पेशेवर मानव अनुवाद के जितना करीब होता है, उतना ही बेहतर होता है" - यह BLEU के पीछे केंद्रीय विचार है। 2001 में IBM में आविष्कार किया गया, BLEU पहले मेट्रिक्स में से एक था जिसने मानव निर्णयों के साथ उच्च सहसंबंध का दावा किया, और यह सबसे लोकप्रिय स्वचालित और सस्ती मेट्रिक्स में से एक बना हुआ है।

स्कोर की गणना व्यक्तिगत अनुवादित खंडों - आम तौर पर वाक्यों - के लिए की जाती है, उनकी तुलना अच्छी गुणवत्ता वाले संदर्भ अनुवादों के एक सेट से करके। फिर उन स्कोरों को पूरे कॉर्पस पर औसत किया जाता है ताकि अनुवाद की समग्र गुणवत्ता का अनुमान लगाया जा सके। बोधगम्यता या व्याकरणिक शुद्धता को ध्यान में नहीं रखा जाता है। BLEU का आउटपुट हमेशा 0 और 1 के बीच एक संख्या होता है, जो दर्शाता है कि उम्मीदवार पाठ संदर्भ पाठों के कितना समान है, 1 के करीब मान अधिक समान पाठों का प्रतिनिधित्व करते हैं। कुछ मानव अनुवाद 1 का स्कोर प्राप्त करेंगे, क्योंकि यह संकेत देगा कि उम्मीदवार संदर्भ अनुवादों में से एक के समान है। इस कारण से, 1 का स्कोर प्राप्त करना आवश्यक नहीं है। क्योंकि मिलान के अधिक अवसर होते हैं, अतिरिक्त संदर्भ अनुवाद जोड़ने से BLEU स्कोर बढ़ेगा।

ऐतिहासिक संदर्भ

BLEU को IBM के शोधकर्ताओं द्वारा विकसित किया गया था, जिनमें किशोर पापिनेनी, सलीम रूकोस, टॉड वार्ड और वेई-जिंग झू शामिल थे, जिन्होंने 2002 के एक पेपर में "BLEU: a Method for Automatic Evaluation of Machine Translation" शीर्षक से मेट्रिक प्रकाशित किया। यह कार्य Machine learning और Artificial intelligence के क्षेत्र में स्वचालित मूल्यांकन की बढ़ती आवश्यकता से उभरा, विशेष रूप से जब मशीन अनुवाद प्रणालियाँ अधिक परिष्कृत हो गईं। BLEU से पहले, मशीन अनुवाद का मूल्यांकन आम तौर पर मानव न्यायाधीशों पर निर्भर करता था, जो महंगा, समय लेने वाला और विभिन्न अध्ययनों में दोहराना मुश्किल था। BLEU ने एक सस्ता, तेज़ और भाषा-स्वतंत्र विकल्प पेश किया जिसे किसी भी अनुवाद प्रणाली पर लगातार लागू किया जा सकता था।

मेट्रिक को उस अवधि के दौरान पेश किया गया था जब सांख्यिकीय मशीन अनुवाद गति पकड़ रहा था, और यह जल्दी से क्षेत्र में एक मानक बेंचमार्क बन गया। इसका विकास IBM के अनुसंधान प्रभाग के काम से निकटता से जुड़ा था, जो 1980 के दशक से प्राकृतिक भाषा प्रसंस्करण में एक प्रमुख खिलाड़ी रहा था। नाम "bilingual evaluation understudy" मानव मूल्यांकन के लिए एक स्टैंड-इन के रूप में इसकी भूमिका को दर्शाता है, जैसे एक अंडरस्टडी अभिनेता जो मुख्य कलाकार के लिए भरता है।

गणितीय परिभाषा

मूल सेटअप

BLEU स्कोर को परिभाषित करने का एक बुनियादी, पहला प्रयास दो तर्क लेगा: एक उम्मीदवार स्ट्रिंग और संदर्भ स्ट्रिंग्स की एक सूची। विचार यह है कि BLEU स्कोर 1 के करीब होना चाहिए जब उम्मीदवार संदर्भों के समान हो, और 0 के करीब यदि नहीं। एक सादृश्य के रूप में, BLEU स्कोर एक भाषा शिक्षक की तरह है जो संदर्भ उत्तरों का कितनी बारीकी से पालन करता है, यह जांचकर छात्र अनुवाद की गुणवत्ता को स्कोर करने की कोशिश कर रहा है।

चूंकि प्राकृतिक भाषा प्रसंस्करण में, किसी को उम्मीदवार स्ट्रिंग्स के एक बड़े सेट का मूल्यांकन करना चाहिए, किसी को BLEU स्कोर को उस मामले में सामान्यीकृत करना चाहिए जहां किसी के पास M उम्मीदवार स्ट्रिंग्स की एक सूची है (जिसे "कॉर्पस" कहा जाता है), और प्रत्येक उम्मीदवार स्ट्रिंग के लिए, संदर्भ उम्मीदवार स्ट्रिंग्स की एक सूची। किसी भी स्ट्रिंग और किसी भी पूर्णांक n ≥ 1 के लिए, इसके n-ग्राम का सेट n शब्दों के अद्वितीय सन्निहित अनुक्रमों के सेट के रूप में परिभाषित किया गया है। उदाहरण के लिए, स्ट्रिंग "the cat sat" के 2-ग्राम {"the cat", "cat sat"} होंगे।

परिशुद्धता और संशोधित परिशुद्धता

BLEU का मूल एक संशोधित रूप की परिशुद्धता है। मानक परिशुद्धता उम्मीदवार में n-ग्राम की संख्या की गणना करेगी जो किसी भी संदर्भ में दिखाई देते हैं, उम्मीदवार में n-ग्राम की कुल संख्या से विभाजित। हालांकि, यह सामान्य शब्दों को दोहराने से बढ़ाया जा सकता है। BLEU एक क्लिप की गई परिशुद्धता का उपयोग करता है: उम्मीदवार में प्रत्येक n-ग्राम के लिए, इसकी गणना अधिकतम संख्या में क्लिप की जाती है जो यह किसी एक संदर्भ में दिखाई देता है। यह अधिक गिनती को रोकता है और सुनिश्चित करता है कि स्कोर वास्तविक पत्राचार को दर्शाता है।

प्रत्येक n-ग्राम क्रम n (आम तौर पर 1 से 4) के लिए, संशोधित परिशुद्धता की गणना सभी उम्मीदवार वाक्यों पर क्लिप की गई गणनाओं के योग के रूप में की जाती है, जो सभी उम्मीदवारों में कुल n-ग्राम गणनाओं के योग से विभाजित होती है। इसे अक्सर p_n के रूप में दर्शाया जाता है।

संक्षिप्तता दंड

BLEU का एक महत्वपूर्ण घटक संक्षिप्तता दंड है, जो छोटे अनुवादों की समस्या को संबोधित करता है। एक प्रणाली केवल कुछ शब्दों को आउटपुट करके उच्च परिशुद्धता प्राप्त कर सकती है जो संदर्भों से मेल खाते हैं, लेकिन ऐसा अनुवाद अधूरा होगा। संक्षिप्तता दंड की गणना उम्मीदवार कॉर्पस की कुल लंबाई के संदर्भ कॉर्पस की कुल लंबाई के अनुपात के आधार पर की जाती है। यदि उम्मीदवार संदर्भ से छोटा है, तो दंड स्कोर को कम करता है; यदि यह लंबा है, तो कोई दंड लागू नहीं होता है। सूत्र है: BP = 1 यदि c > r, और BP = exp(1 - r/c) यदि c ≤ r, जहां c उम्मीदवार की लंबाई है और r प्रभावी संदर्भ लंबाई है (प्रत्येक उम्मीदवार की लंबाई के सबसे करीब संदर्भ लंबाई का योग)।

अंतिम स्कोर

अंतिम BLEU स्कोर संक्षिप्तता दंड और क्रम 1 से N (आम तौर पर N=4) के n-ग्राम के लिए संशोधित परिशुद्धता के ज्यामितीय माध्य का उत्पाद है। ज्यामितीय माध्य समान रूप से भारित है, और परिणाम 0 और 1 के बीच एक मान है। व्यवहार में, स्कोर अक्सर प्रतिशत के रूप में रिपोर्ट किए जाते हैं (जैसे, BLEU 30 का अर्थ 0.30 है)। सूत्र है: BLEU = BP exp(Σ_{n=1}^{N} (1/N) log p_n)।

मशीन अनुवाद में अनुप्रयोग

BLEU मूल रूप से मशीन अनुवाद प्रणालियों के मूल्यांकन के लिए डिज़ाइन किया गया था, और यह उस डोमेन में एक मानक मेट्रिक बना हुआ है। अनुवाद प्रणालियों को विकसित करने वाले अनुसंधान समूह और कंपनियां, प्रारंभिक सांख्यिकीय मॉडल से लेकर आधुनिक Neural network-आधारित दृष्टिकोणों तक, अपने आउटपुट की तुलना संदर्भ अनुवादों से करने के लिए BLEU का उपयोग करती हैं। उदाहरण के लिए, Google DeepMind और अन्य संगठनों की प्रणालियों ने बेसलाइन पर सुधार प्रदर्शित करने के लिए शैक्षणिक पेपरों में BLEU स्कोर की रिपोर्ट की है।

मेट्रिक विकास के दौरान तेजी से पुनरावृत्ति के लिए विशेष रूप से उपयोगी है। डेवलपर्स मॉडल में प्रत्येक परिवर्तन के बाद एक परीक्षण सेट पर BLEU चला सकते हैं, जिससे उन्हें मानव एनोटेटर की आवश्यकता के बिना प्रगति को ट्रैक करने की अनुमति मिलती है। इसने BLEU को क्षेत्र में एक वास्तविक मानक बना दिया है, इसकी ज्ञात सीमाओं के बावजूद।

पाठ निर्माण और बड़े भाषा मॉडल में उपयोग

मशीन अनुवाद से परे, BLEU को अन्य पाठ निर्माण कार्यों के मूल्यांकन के लिए अनुकूलित किया गया है, जिसमें सारांश, संवाद प्रणाली और छवि कैप्शनिंग शामिल हैं। OpenAI और Anthropic द्वारा विकसित Large language model के उदय के साथ, BLEU का उपयोग आउटपुट गुणवत्ता का आकलन करने के लिए कई स्वचालित मेट्रिक्स में से एक के रूप में किया गया है। हालांकि, खुले-अंत निर्माण के लिए इसकी प्रयोज्यता पर बहस होती है, क्योंकि BLEU संदर्भों के साथ सटीक n-ग्राम ओवरलैप को पुरस्कृत करता है, जो शब्दार्थ समानता को पकड़ नहीं सकता है।

सारांश जैसे कार्यों में, BLEU का उपयोग अक्सर ROUGE जैसे अन्य मेट्रिक्स के साथ किया जाता है। संवाद प्रणालियों के लिए, BLEU भ्रामक हो सकता है क्योंकि किसी दिए गए संकेत के लिए कई मान्य प्रतिक्रियाएं होती हैं, और एक एकल संदर्भ सभी संभावनाओं का प्रतिनिधित्व नहीं कर सकता है। इन मुद्दों के बावजूद, BLEU गुणवत्ता का एक मोटा अनुमान प्राप्त करने का एक त्वरित और सस्ता तरीका बना हुआ है, और इसे अक्सर शोध पत्रों में बेसलाइन मेट्रिक के रूप में रिपोर्ट किया जाता है।

सीमाएं और आलोचनाएं

BLEU की कई अच्छी तरह से प्रलेखित सीमाएं हैं। पहला, यह बोधगम्यता या व्याकरणिक शुद्धता के लिए जिम्मेदार नहीं है; एक अनुवाद उच्च स्कोर कर सकता है यदि यह संदर्भों के साथ कई n-ग्राम साझा करता है लेकिन फिर भी अव्याकरणिक है। दूसरा, यह संदर्भों की पसंद के प्रति संवेदनशील है; विभिन्न संदर्भ सेट एक ही उम्मीदवार के लिए बहुत अलग स्कोर दे सकते हैं। तीसरा, BLEU उन अनुवादों का पक्ष लेता है जो संदर्भों के लिए शाब्दिक रूप से समान हैं, जो वैध अनुवादों को दंडित कर सकता है जो विभिन्न शब्दावली या वाक्य संरचना का उपयोग करते हैं।

एक और आलोचना यह है कि BLEU समानार्थी शब्दों या व्याख्याओं को अच्छी तरह से संभालता नहीं है। उदाहरण के लिए, यदि एक संदर्भ कहता है "the cat sat on the mat" और एक उम्मीदवार कहता है "the feline rested on the rug," तो BLEU स्कोर शब्दार्थ समानता के बावजूद कम होगा। इसने वैकल्पिक मेट्रिक्स के विकास को जन्म दिया है, जैसे METEOR और ROUGE, जो स्टेमिंग और समानार्थी मिलान को शामिल करते हैं। Generative AI के संदर्भ में, शोधकर्ताओं ने यह भी नोट किया है कि BLEU रचनात्मक या खुले-अंत आउटपुट के लिए मानव निर्णय के साथ खराब सहसंबंध रखता है।

अन्य मेट्रिक्स से संबंध

BLEU प्राकृतिक भाषा प्रसंस्करण में स्वचालित मूल्यांकन मेट्रिक्स के एक व्यापक परिवार का हिस्सा है। यह परिशुद्धता-उन्मुख है, इस पर ध्यान केंद्रित करता है कि उम्मीदवार की सामग्री का कितना हिस्सा संदर्भों में दिखाई देता है। इसके विपरीत, ROUGE पुनर्प्राप्ति-उन्मुख है, यह मापता है कि उम्मीदवार द्वारा संदर्भ सामग्री का कितना हिस्सा कैप्चर किया गया है। METEOR समानार्थी मिलान और शब्द क्रम अंतर के लिए दंड के साथ परिशुद्धता और पुनर्प्राप्ति को जोड़ता है। इन मेट्रिक्स का उपयोग अक्सर एक साथ किया जाता है ताकि अधिक व्यापक मूल्यांकन प्रदान किया जा सके।

Transformer (architecture)-आधारित मॉडल और Deep learning प्रणालियों के संदर्भ में, BLEU का उपयोग कुछ सुदृढीकरण सीखने के सेटअप में प्रशिक्षण उद्देश्य के रूप में किया गया है, हालांकि यह विशुद्ध रूप से मूल्यांकन के लिए उपयोग करने से कम आम है। मेट्रिक की सादगी और कम्प्यूटेशनल दक्षता इसे बड़े पैमाने पर बेंचमार्किंग के लिए आकर्षक बनाती है, जैसे कि शैक्षणिक सम्मेलनों द्वारा आयोजित साझा कार्यों में।

व्यावहारिक विचार

BLEU का उपयोग करते समय, कई व्यावहारिक कारक स्कोर को प्रभावित करते हैं। संदर्भ अनुवादों की संख्या मायने रखती है: अधिक संदर्भ जोड़ने से आम तौर पर स्कोर बढ़ता है क्योंकि n-ग्राम मिलान के अधिक अवसर होते हैं। टोकनाइजेशन विधि भी परिणामों को प्रभावित करती है; उदाहरण के लिए, क्या विराम चिह्न हटा दिया गया है या मामला सामान्यीकृत है, n-ग्राम गणनाओं को बदल सकता है। विभिन्न कार्यान्वयन एक ही डेटा के लिए थोड़े अलग स्कोर उत्पन्न कर सकते हैं, इसलिए उपयोग की गई सटीक सेटिंग्स की रिपोर्ट करना महत्वपूर्ण है।

BLEU स्कोर विभिन्न कॉर्पोरा या भाषाओं में तुलनीय नहीं हैं। एक परीक्षण सेट पर 0.40 का स्कोर उत्कृष्ट हो सकता है, जबकि दूसरे पर यह औसत हो सकता है। इसलिए, BLEU का उपयोग एक ही डेटा पर प्रणालियों के बीच सापेक्ष तुलना के लिए सबसे अच्छा किया जाता है, न कि गुणवत्ता के पूर्ण माप के रूप में। शोधकर्ता अक्सर निष्कर्षों को मान्य करने के लिए मानव मूल्यांकन के साथ BLEU की रिपोर्ट करते हैं।

भविष्य की दिशाएं

जैसे-जैसे Artificial intelligence और Machine learning विकसित होते रहते हैं, BLEU की भूमिका का पुनर्मूल्यांकन किया जा रहा है। BERTScore और COMET जैसे नए मेट्रिक्स, शब्दार्थ समानता को अधिक प्रभावी ढंग से पकड़ने के लिए पूर्व-प्रशिक्षित मॉडल से एम्बेडिंग का उपयोग करते हैं। ये मेट्रिक्स अक्सर मानव निर्णय के साथ बेहतर सहसंबंध रखते हैं लेकिन कम्प्यूटेशनल रूप से अधिक महंगे होते हैं। BLEU, हालांकि, अपनी सादगी और व्याख्या के कारण एक उपयोगी बेसलाइन बना हुआ है।

Large language model के युग में, मूल्यांकन तेजी से निर्देश पालन और तथ्यात्मक सटीकता जैसे कार्यों पर केंद्रित है, जहां BLEU कम प्रासंगिक है। फिर भी, पहले स्वचालित मूल्यांकन मेट्रिक्स में से एक के रूप में BLEU की विरासत ने क्षेत्र के गुणवत्ता मूल्यांकन के दृष्टिकोण को आकार दिया है। इसके सिद्धांत - मशीन आउटपुट की मानव संदर्भों से तुलना करना - नए मेट्रिक्स के डिजाइन को सूचित करना जारी रखते हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:machine-translation·evaluation-metrics·natural-language-processing·ibm
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास