अंग्रेज़ी से अनुवादित

आईसीडीएआर 2015 एक प्रतियोगिता थी जो 13वें अंतर्राष्ट्रीय दस्तावेज़ विश्लेषण और पहचान सम्मेलन के भाग के रूप में आयोजित की गई थी, जिसका ध्यान प्राकृतिक छवियों में दृश्य पाठ का पता लगाने और पहचानने पर केंद्रित था।

ICDAR 2015 उस रोबस्ट रीडिंग प्रतियोगिता को संदर्भित करता है जो 2015 में दस्तावेज़ विश्लेषण और पहचान पर 13वें अंतर्राष्ट्रीय सम्मेलन (ICDAR) में आयोजित की गई थी। यह प्रतियोगिता दृश्य पाठ का पता लगाने और पहचान पर केंद्रित थी, जिसमें प्रतिभागियों को प्राकृतिक छवियों में पाठ का पता लगाने और पढ़ने की चुनौती दी गई थी। यह प्रतियोगिताओं की एक श्रृंखला का हिस्सा थी जिसने Computer vision और दस्तावेज़ विश्लेषण के क्षेत्र में प्रगति को बढ़ावा दिया है, जो एल्गोरिदम के मूल्यांकन के लिए मानकीकृत बेंचमार्क प्रदान करती है।

इस प्रतियोगिता में कई कार्य शामिल थे, विशेष रूप से पाठ स्थानीयकरण (पाठ क्षेत्रों के चारों ओर बाउंडिंग बॉक्स का पता लगाना) और पाठ पहचान (पता लगाए गए पाठ को मशीन-पठनीय स्ट्रिंग में लिप्यंतरित करना)। उपयोग किया जाने वाला प्राथमिक डेटासेट ICDAR 2015 इंसिडेंटल सीन टेक्स्ट डेटासेट था, जिसमें व्यस्त सड़क के वातावरण में Google Glass डिवाइस से कैप्चर की गई 1,500 छवियां शामिल थीं। ये छवियां जानबूझकर 'आकस्मिक' तरीके से कैप्चर की गई थीं, जिसका अर्थ है कि उन्हें सावधानीपूर्वक फ्रेम नहीं किया गया था, जिससे मोशन ब्लर, कम रिज़ॉल्यूशन और पाठ के मनमाने ओरिएंटेशन जैसी चुनौतियाँ उत्पन्न हुईं।

डेटासेट और मूल्यांकन

ICDAR 2015 डेटासेट में 1,000 प्रशिक्षण छवियां और 500 परीक्षण छवियां शामिल थीं। ग्राउंड ट्रुथ एनोटेशन ने शब्द-स्तरीय बाउंडिंग बॉक्स और ट्रांसक्रिप्शन प्रदान किए। पता लगाने के लिए मूल्यांकन में मानक PASCAL VOC मानदंड का उपयोग किया गया, जहां एक डिटेक्शन को सही माना जाता था यदि ग्राउंड ट्रुथ बॉक्स के साथ इंटरसेक्शन-ओवर-यूनियन (IoU) 0.5 से अधिक हो। पहचान के लिए, मीट्रिक भविष्यवाणी और ग्राउंड ट्रुथ स्ट्रिंग्स के बीच संपादन दूरी थी। प्रतियोगिता में एक संयुक्त कार्य भी शामिल था जिसके लिए पता लगाने और पहचान दोनों की आवश्यकता थी, जिसका मूल्यांकन एंड-टू-एंड वर्ड स्पॉटिंग मीट्रिक का उपयोग करके किया गया।

परिणाम और प्रभाव

पाठ स्थानीयकरण कार्य के लिए विजेता प्रविष्टि टोरंटो विश्वविद्यालय की एक टीम द्वारा प्रस्तुत की गई थी, जिसने लगभग 0.72 का F-माप प्राप्त किया। एंड-टू-एंड पहचान कार्य के लिए, शीर्ष प्रदर्शन करने वाला चीनी विज्ञान अकादमी की एक टीम थी, जिसने लगभग 0.68 का F-माप हासिल किया। ये परिणाम बाद के वर्षों की तुलना में मामूली थे, जो आकस्मिक दृश्य पाठ समस्या की कठिनाई को दर्शाते हैं। प्रतियोगिता ने मनमाने ओरिएंटेशन और अलग-अलग प्रकाश स्थितियों को संभालने में मौजूदा तरीकों की सीमाओं को उजागर किया, जिससे गहन शिक्षण-आधारित दृष्टिकोणों में बाद के शोध को बढ़ावा मिला।

विरासत और अनुवर्ती

ICDAR 2015 अनुसंधान समुदाय में व्यापक रूप से उपयोग किया जाने वाला बेंचमार्क बन गया। दृश्य पाठ का पता लगाने और पहचान पर कई बाद के पेपर, विशेष रूप से Deep learning और Neural network आर्किटेक्चर का उपयोग करने वाले, ने इस डेटासेट पर परिणाम रिपोर्ट किए। आकस्मिक पाठ पर प्रतियोगिता के जोर ने बाद के संस्करणों, जैसे ICDAR 2017 और ICDAR 2019 को प्रभावित किया, जिन्होंने और भी अधिक चुनौतीपूर्ण डेटासेट पेश किए। 2015 बेंचमार्क वास्तविक दुनिया के परिदृश्यों में पाठ पढ़ने की प्रणालियों की मजबूती का मूल्यांकन करने के लिए एक मानक संदर्भ बना हुआ है।

व्यापक AI अनुसंधान से संबंध

ICDAR 2015 के लिए विकसित तकनीकें, जैसे क्षेत्र प्रस्ताव नेटवर्क और पहचान के लिए अनुक्रम-से-अनुक्रम मॉडल, Artificial intelligence और Machine learning में व्यापक प्रगति के साथ प्रतिच्छेदित हुईं। प्रतियोगिता ने एल्गोरिदम के लिए एक व्यावहारिक परीक्षण मंच के रूप में कार्य किया जिन्हें बाद में स्वायत्त ड्राइविंग, संवर्धित वास्तविकता और दस्तावेज़ डिजिटलीकरण में अनुप्रयोग मिले। इसने Data Augmentation रणनीतियों के विकास में भी योगदान दिया, क्योंकि प्रतिभागियों ने सामान्यीकरण में सुधार के लिए सिंथेटिक पाठ निर्माण और छवि परिवर्तनों का उपयोग किया।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:computer-vision·document-analysis·competition·scene-text
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास