BLEU (bilingual evaluation understudy) एक एल्गोरिदम है जो एक प्राकृतिक भाषा से दूसरी भाषा में मशीन-अनुवादित पाठ की गुणवत्ता का मूल्यांकन करने के लिए उपयोग किया जाता है। यह मीट्रिक इस सिद्धांत पर कार्य करता है कि एक मशीन अनुवाद उतना ही बेहतर होता है जितना वह एक पेशेवर मानव अनुवाद के करीब होता है। 2001 में IBM में विकसित, BLEU उन पहले स्वचालित मीट्रिक में से एक था जिसने अनुवाद गुणवत्ता के मानवीय मूल्यांकन के साथ उच्च सहसंबंध दिखाया, और यह अपनी कम लागत और गति के कारण अपनी लोकप्रियता बनाए रखता है।
BLEU स्कोर की गणना व्यक्तिगत अनुवादित खंडों - आम तौर पर वाक्यों - के लिए की जाती है, उनकी तुलना उच्च-गुणवत्ता वाले संदर्भ अनुवादों के एक सेट के साथ करके। फिर इन खंड स्कोर को पूरे कॉर्पस पर औसत किया जाता है ताकि समग्र अनुवाद गुणवत्ता का अनुमान लगाया जा सके। यह मीट्रिक सीधे तौर पर सुगमता या व्याकरणिक शुद्धता पर विचार नहीं करता है। इसका आउटपुट हमेशा 0 और 1 के बीच की संख्या होती है, जहां 1 के करीब मान संदर्भ अनुवादों के साथ अधिक समानता दर्शाते हैं। बहुत कम मानव अनुवाद पूर्ण 1.0 प्राप्त करते हैं, क्योंकि इसके लिए संदर्भ के साथ सटीक मिलान की आवश्यकता होगी, और अधिक संदर्भ अनुवाद जोड़ने से मिलान की संभावना और इस प्रकार स्कोर बढ़ जाता है।
गणितीय परिभाषा
BLEU स्कोर एक उम्मीदवार स्ट्रिंग ŷ की तुलना संदर्भ स्ट्रिंग्स की सूची (y^(1), ..., y^(N)) के साथ करता है। स्कोर 1 के करीब पहुंचता है जब उम्मीदवार संदर्भों से काफी मिलता-जुलता होता है और 0 के करीब जब ऐसा नहीं होता है। एक उपयोगी सादृश्य एक भाषा शिक्षक का है जो संदर्भ उत्तरों के साथ तुलना करके छात्र के अनुवाद का मूल्यांकन करता है।
M उम्मीदवार स्ट्रिंग्स के एक कॉर्पस के लिए, जिनमें से प्रत्येक के अपने संदर्भ अनुवादों का सेट होता है, BLEU n-grams पर आधारित एक संशोधित परिशुद्धता स्कोर की गणना करता है। एक n-gram पाठ से n शब्दों का एक सतत अनुक्रम है। यह मीट्रिक गिनता है कि उम्मीदवार अनुवाद में कितने n-grams किसी भी संदर्भ अनुवाद में दिखाई देते हैं, लेकिन दोहराए गए n-grams की अधिक गिनती से बचने के लिए गिनती को सीमित करता है।
संशोधित परिशुद्धता
n-grams के लिए संशोधित परिशुद्धता (आम तौर पर n = 1 से 4) उम्मीदवार n-grams की संख्या लेकर गणना की जाती है जो किसी भी संदर्भ n-gram से मेल खाते हैं और कुल उम्मीदवार n-grams की संख्या से विभाजित करके। संक्षिप्तता दंड छोटे अनुवादों की कृत्रिम रूप से उच्च परिशुद्धता स्कोर प्राप्त करने की प्रवृत्ति को संबोधित करता है। यह अपने संदर्भों से छोटे उम्मीदवारों को दंडित करता है।
अंतिम BLEU स्कोर n-gram परिशुद्धता का ज्यामितीय माध्य है जो संक्षिप्तता दंड से गुणा किया जाता है। सामान्य अभ्यास आदेश 1 से 4 के n-grams पर एक समान भार का उपयोग करता है।
== इतिहास ==
किशोर पापिनेनी, सलीम रूकोस, टॉड वार्ड और वेई-जिंग झू ने IBM के थॉमस जे. वॉटसन रिसर्च सेंटर में काम करते हुए BLEU विकसित किया। उन्होंने इसे 2002 में एसोसिएशन फॉर कम्प्यूटेशनल लिंग्विस्टिक्स (ACL) की वार्षिक बैठक में प्रकाशित किया। यह मीट्रिक अनुवाद गुणवत्ता के मानवीय निर्णय के लिए उच्च सहसंबंध का दावा करने वाले पहले स्वचालित मूल्यांकन विधियों में से एक के रूप में उभरा। इसका परिचय मानव मूल्यांकन के लिए एक तेज़, सस्ते विकल्प की आवश्यकता को संबोधित करता है, जो महंगा और धीमा था। BLEU जल्दी से Machine learning और प्राकृतिक भाषा प्रसंस्करण अनुसंधान में एक मानक बेंचमार्क बन गया, जिसे शैक्षणिक पत्रों और उद्योग मूल्यांकन में व्यापक रूप से अपनाया गया।
गणितीय आधार
BLEU स्कोर प्रति खंड, आम तौर पर एक वाक्य, की गणना की जाती है, जिसमें उम्मीदवार अनुवाद की तुलना एक या अधिक संदर्भ अनुवादों के साथ की जाती है। एल्गोरिदम एक संशोधित n-gram परिशुद्धता की गणना करता है: यह उम्मीदवार में n-grams (n शब्दों के सतत अनुक्रम) की संख्या गिनता है जो किसी भी संदर्भ अनुवाद में दिखाई देते हैं, एक क्लिपिंग तंत्र के साथ जो अधिक गिनती को रोकता है जब एक उम्मीदवार एक n-gram को संदर्भ में होने की तुलना में अधिक बार दोहराता है। यह परिशुद्धता n-gram लंबाई की एक सीमा के लिए गणना की जाती है, आमतौर पर 1 से 4।
एक संक्षिप्तता दंड स्कोर पर लागू किया जाता है ताकि उन उम्मीदवारों को हतोत्साहित किया जा सके जो संदर्भों के सापेक्ष बहुत छोटे हैं, क्योंकि छोटे आउटपुट केवल मिलान वाले शब्दों को शामिल करके उच्च परिशुद्धता प्राप्त कर सकते हैं। संक्षिप्तता दंड की गणना उम्मीदवार की लंबाई और प्रभावी संदर्भ लंबाई के अनुपात से की जाती है, यह सुनिश्चित करते हुए कि अधूरे अनुवादों को दंडित किया जाता है। अंतिम BLEU स्कोर संशोधित n-gram परिशुद्धता का ज्यामितीय माध्य है जो इस संक्षिप्तता दंड कारक से गुणा किया जाता है।
आउटपुट हमेशा 0 और 1 के बीच आता है और कम लागत और गणना की गति के कारण अपनी लोकप्रियता बनाए रखता है। बहुत कम मानव अनुवाद 1 का पूर्ण स्कोर प्राप्त करते हैं, क्योंकि यह संकेत देगा कि उम्मीदवार संदर्भ अनुवादों में से एक के समान है। चूंकि n-gram मिलान के अधिक अवसर होते हैं, इसलिए अधिक संदर्भ अनुवाद शामिल करने से आम तौर पर BLEU स्कोर बढ़ जाएगा।
इतिहास और विकास
BLEU को 2001 में IBM के शोधकर्ताओं, जिनमें किशोर पापिनेनी, सलीम रूकोस, टॉड वार्ड और वेई-जिंग झू शामिल थे, द्वारा पेश किया गया था। मीट्रिक को मशीन अनुवाद के लिए एक सस्ती, भाषा-स्वतंत्र मूल्यांकन विधि की आवश्यकता को संबोधित करने के लिए डिज़ाइन किया गया था, जो महंगे और धीमे मानव मूल्यांकन को प्रतिस्थापित करता है। नाम, bilingual evaluation understudy, मानव न्यायाधीशों के लिए एक स्टैंड-इन के रूप में इसकी भूमिका को दर्शाता है।
मीट्रिक का परिचय सांख्यिकीय मशीन अनुवाद में बढ़ती रुचि के साथ मेल खाता था, जहां तेजी से पुनरावृत्ति के लिए सिस्टम आउटपुट की तुलना करने के लिए एक स्वचालित तरीके की आवश्यकता थी। BLEU की सरलता और मानवीय निर्णय के साथ मजबूत सहसंबंध ने इसे वर्षों तक क्षेत्र में एक मानक बेंचमार्क बना दिया।
N-gram परिशुद्धता और संक्षिप्तता दंड
BLEU विभिन्न लंबाई के n-grams के लिए परिशुद्धता की गणना करता है, आम तौर पर 1 से 4 तक। प्रत्येक n-gram क्रम के लिए संशोधित परिशुद्धता उस अधिकतम संख्या को गिनती है जितनी बार एक n-gram किसी एकल संदर्भ में दिखाई देता है, उम्मीदवार की गिनती को उस अधिकतम पर सीमित करता है। यह अत्यधिक लंबे या दोहराव वाले अनुवादों को स्कोर में हेरफेर करने से रोकता है।
एक संक्षिप्तता दंड उन उम्मीदवार अनुवादों पर लागू किया जाता है जो अपने संदर्भ समकक्षों से छोटे होते हैं। यदि उम्मीदवार संदर्भ से लंबा है, तो दंड 1 है; अन्यथा, यह लंबाई अनुपात के साथ घातीय रूप से घटता है। यह दंड अधूरे अनुवादों को हतोत्साहित करता है जो अन्यथा उच्च परिशुद्धता प्राप्त कर सकते हैं।
ज्यामितीय माध्य और स्कोर सीमा
अंतिम BLEU स्कोर n-gram क्रमों में संशोधित परिशुद्धता को ज्यामितीय माध्य का उपयोग करके जोड़ता है, आम तौर पर n = 1 से 4 के लिए। संक्षिप्तता दंड इस माध्य को गुणा करता है। BLEU स्कोर आम तौर पर 0 और 1 के बीच आते हैं, हालांकि उन्हें अक्सर 0 से 100 के पैमाने पर प्रतिशत के रूप में रिपोर्ट किया जाता है। 0.4 से ऊपर के स्कोर आम तौर पर उच्च-गुणवत्ता वाले अनुवाद माने जाते हैं, लेकिन पैमाना पूर्ण नहीं है और भाषा जोड़ी और डोमेन पर काफी हद तक निर्भर करता है।
अनुप्रयोग और सीमाएं
BLEU मशीन अनुवाद अनुसंधान में सबसे व्यापक रूप से उपयोग किए जाने वाले मीट्रिक में से एक बना हुआ है। इसका उपयोग शैक्षणिक पत्रों, उद्योग बेंचमार्क और साझा कार्यों में सिस्टम का मूल्यांकन करने के लिए किया गया है। मीट्रिक का उपयोग अनुवाद से परे क्षेत्रों में भी किया जाता है, जैसे कि पाठ सारांश और छवि कैप्शनिंग, जहां संदर्भ पाठ जमीनी सत्य के रूप में कार्य करते हैं।
आलोचक ध्यान देते हैं कि BLEU सीधे तौर पर सुगमता या व्याकरणिक शुद्धता को नहीं मापता है। एक उम्मीदवार जो धाराप्रवाह है लेकिन संदर्भ से शब्दार्थ रूप से भिन्न है, कम स्कोर कर सकता है, जबकि एक जो अजीब है लेकिन n-grams साझा करता है, उच्च स्कोर कर सकता है। मीट्रिक का n-gram मिलान पूरी तरह से शाब्दिक दर्पण है, इसलिए पर्यायवाची और पुनर्लेखन को दंडित किया जाता है, भले ही अर्थ संरक्षित हो। मानवीय निर्णय के साथ सहसंबंध कॉर्पस स्तर पर मजबूत है लेकिन व्यक्तिगत वाक्यों के लिए कमजोर है।
अनुप्रयोग और सीमाएं
BLEU Machine learning अनुसंधान और Large language model-आधारित अनुवाद प्रणालियों के विकास में सबसे लोकप्रिय स्वचालित मीट्रिक में से एक बना हुआ है। इसका उपयोग अक्सर Artificial intelligence विकास में मॉडल पुनरावृत्तियों की तुलना करने और Neural network मॉडल में हाइपरपैरामीटर ट्यून करने के लिए किया जाता है। इसकी कम कम्प्यूटेशनल लागत इसे प्रशिक्षण और विकास चक्रों के दौरान बड़े पैमाने पर मूल्यांकन के लिए उपयुक्त बनाती है।
सीमाओं में संदर्भ अनुवाद गुणवत्ता के प्रति संवेदनशीलता, शब्दार्थ समानता पर कोई विचार नहीं करना, और विश्वसनीय स्कोर के लिए कई संदर्भों की आवश्यकता शामिल है। BLEU भी उन अनुवादों को पसंद करता है जो संदर्भ वाक्यांश को बारीकी से दर्शाते हैं, संभावित रूप से वैध वैकल्पिक अनुवादों को दंडित करते हैं। बाद के मीट्रिक, जैसे METEOR और ROUGE, ने इनमें से कुछ कमियों को दूर करने का प्रयास किया है, हालांकि BLEU Machine learning अनुसंधान में व्यापक रूप से उद्धृत आधार रेखा बना हुआ है।
अनुप्रयोग और प्रभाव
BLEU का उपयोग प्राकृतिक भाषा प्रसंस्करण के क्षेत्र में किया जाता है, विशेष रूप से Deep learning दृष्टिकोण जैसे Transformer (architecture)-आधारित मॉडल के साथ विकसित अनुवाद प्रणालियों के प्रशिक्षण और मूल्यांकन में। इसे अन्य उत्पादन कार्यों के लिए भी अनुकूलित किया गया है, जिसमें पाठ सारांश और छवि कैप्शनिंग शामिल हैं, इसके मूल अनुवाद डिजाइन के बावजूद। मीट्रिक का प्रभाव शिक्षा से परे फैला हुआ है; प्रमुख AI प्रयोगशालाओं और कंपनियों, जिनमें OpenAI, Google DeepMind, और Anthropic शामिल हैं, ने जनरेटिव मॉडल की बेंचमार्किंग करते समय BLEU या इसके वेरिएंट का उपयोग किया है।
मानक कार्यान्वयन, जैसे कि NLTK (Natural Language Toolkit) लाइब्रेरी में, BLEU स्कोर की गणना के लिए उपयोग में आसान फ़ंक्शन प्रदान करते हैं। इस पहुंच ने प्राकृतिक भाषा प्रसंस्करण मूल्यांकन में एक डिफ़ॉल्ट मीट्रिक के रूप में इसकी भूमिका को मजबूत किया है। हालांकि, शोधकर्ताओं ने नोट किया है कि BLEU शब्दार्थ समानता को अच्छी तरह से कैप्चर नहीं करता है; समान अर्थ वाले लेकिन अलग शब्द चयन वाले दो अनुवाद उच्च गुणवत्ता के होने के बावजूद कम स्कोर प्राप्त कर सकते हैं। यह सीमा विकल्पों के विकास के लिए प्रेरित हुई है, लेकिन BLEU मशीन अनुवाद मूल्यांकन में एक मौलिक आधार रेखा बना हुआ है।
सीमाएं और आलोचना
BLEU की कई ज्ञात सीमाएं हैं। यह व्याकरणिक शुद्धता को अनदेखा करता है और n-gram मिलान से परे शब्द क्रम को स्पष्ट रूप से ध्यान में नहीं रखता है। यह पर्यायवाची या ऐसे पुनर्लेखन को पहचानने में भी विफल रहता है जो संदर्भ शब्दों से मेल नहीं खाते। ये कमजोरियां ऐसे मामलों को जन्म दे सकती हैं जहां एक अनुवाद सटीक है लेकिन खराब स्कोर करता है, या जहां उच्च शाब्दिक ओवरलैप वाला एक दोषपूर्ण अनुवाद अच्छा स्कोर करता है।
इसके अतिरिक्त, BLEU स्कोर संदर्भ अनुवादों की संख्या और गुणवत्ता के प्रति संवेदनशील होते हैं। सिस्टम सामान्य वाक्यांशों को पसंद करके BLEU के लिए अनुकूलन कर सकते हैं, कभी-कभी धाराप्रवाह या पर्याप्तता की कीमत पर। इन मुद्दों के बावजूद, BLEU कॉर्पस स्तर पर मानवीय निर्णय के साथ उचित रूप से सहसंबंधित है और त्वरित सिस्टम तुलना के लिए व्यापक रूप से उपयोग किया जाता है, हालांकि नए मीट्रिक अनुसंधान सेटिंग्स में इसे तेजी से पूरक या प्रतिस्थापित कर रहे हैं।
अनुप्रयोग और सीमाएं
BLEU का प्राथमिक अनुप्रयोग मशीन अनुवाद प्रणालियों का मूल्यांकन करना है, प्रारंभिक सांख्यिकीय वाक्यांश-आधारित मॉडल से लेकर आधुनिक Neural network और Transformer (architecture)-आधारित दृष्टिकोण तक। इसे पाठ सारांश और छवि कैप्शनिंग जैसे कार्यों के लिए भी अनुकूलित किया गया है। इसकी कम कम्प्यूटेशनल लागत इसे पुनरावृत्त विकास के लिए आदर्श बनाती है, जहां Deep learning प्रशिक्षण लूप के दौरान हजारों अनुवादों को जल्दी से स्कोर किया जाना चाहिए।
हालांकि, BLEU की ज्ञात सीमाएं हैं। यह शब्दार्थ समानता को कैप्चर नहीं करता है, इसलिए अलग शब्द चयन वाले पुनर्लेखन खराब स्कोर कर सकते हैं। यह रूपात्मक रूप से समृद्ध भाषाओं के साथ भी संघर्ष करता है और n-gram आसन्नता से परे शब्द क्रम को ध्यान में नहीं रखता है। इन कमियों ने वैकल्पिक मीट्रिक के विकास को प्रेरित किया है, हालांकि BLEU अधिकांश बड़े भाषा मॉडल और Neural network अनुवाद अनुसंधान में एक आधार संदर्भ बना हुआ है।
अनुप्रयोग और सीमाएं
BLEU का व्यापक रूप से शैक्षणिक अनुसंधान और उद्योग में अनुवाद प्रणालियों की तुलना करने के लिए उपयोग किया जाता है, जिसमें Transformer (architecture) आर्किटेक्चर और बड़े भाषा मॉडल पर निर्मित शामिल हैं। यह मॉडल विकास के दौरान एक त्वरित प्रतिगमन जांच के रूप में कार्य करता है, मानव मूल्यांकन का पूरक। हालांकि, BLEU की ज्ञात सीमाएं हैं: यह मानवीय निर्णयों के साथ अपूर्ण रूप से सहसंबंधित होता है, विशेष रूप से रूपात्मक रूप से समृद्ध भाषाओं के लिए या जब पुनर्लेखन मान्य होते हैं। यह शब्दार्थ समानता पर शाब्दिक ओवरलैप को पुरस्कृत करता है, एक अंतर जिसे बाद के मीट्रिक जैसे METEOR और ROUGE ने संबोधित करने का प्रयास किया, हालांकि BLEU सबसे अधिक उद्धृत बना हुआ है।
इन कमियों के बावजूद, BLEU की सरलता और प्रतिलिपि प्रस्तुत करने की क्षमता ने मशीन अनुवाद अनुसंधान और संबंधित कार्यों में इसका निरंतर उपयोग सुनिश्चित किया है। क्षेत्र में इसकी भूमिका मौलिक है, जो Neural network-आधारित अनुवाद प्रणालियों और उससे परे के मूल्यांकन प्रोटोकॉल के डिजाइन को प्रभावित करती है।