अंग्रेज़ी से अनुवादित

Total-Text एक बेंचमार्क डेटासेट है जो दृश्य पाठ पहचान (scene text detection) के लिए है, जिसमें वास्तविक दुनिया की छवियों में घुमावदार, बहु-अभिविन्यास, और क्षैतिज पाठ उदाहरण शामिल हैं, जिसका उपयोग पाठ पहचान एल्गोरिदम का मूल्यांकन और उन्नति करने के लिए किया जाता है।

Total-Text एक बेंचमार्क डेटासेट है जो सीन टेक्स्ट डिटेक्शन के लिए है, जिसे 2017 में टोरंटो विश्वविद्यालय और अन्य संस्थानों के शोधकर्ताओं द्वारा पेश किया गया था। इसे पहले के डेटासेट की सीमाओं को संबोधित करने के लिए डिज़ाइन किया गया था, जो मुख्य रूप से क्षैतिज या मोटे तौर पर संरेखित पाठ पर केंद्रित थे, इसमें घुमावदार और मनमाने ढंग से उन्मुख पाठ उदाहरणों का एक महत्वपूर्ण अनुपात शामिल करके। यह डेटासेट सीन टेक्स्ट डिटेक्शन के क्षेत्र में मशीन लर्निंग और डीप लर्निंग मॉडल के लिए एक मानक मूल्यांकन संसाधन बन गया है, जो कृत्रिम बुद्धिमत्ता और कंप्यूटर विज़न का एक उपक्षेत्र है।

डेटासेट में वास्तविक दुनिया के दृश्यों से एकत्रित 1,555 छवियां शामिल हैं, जैसे कि सड़क के संकेत, दुकान के मुखौटे और पोस्टर। प्रत्येक छवि को शब्द-स्तरीय बाउंडिंग बहुभुजों के साथ एनोटेट किया गया है जो पाठ क्षेत्रों को सटीक रूप से रेखांकित करते हैं, जिसमें घुमावदार और बहु-उन्मुख पाठ शामिल हैं। एनोटेशन एक प्रारूप में प्रदान किए जाते हैं जो बहुभुज और आयताकार दोनों प्रतिनिधित्व का समर्थन करता है, जिससे डिटेक्शन एल्गोरिदम का लचीला मूल्यांकन संभव होता है। Total-Text में 1,255 छवियों का एक प्रशिक्षण सेट और 300 छवियों का एक परीक्षण सेट शामिल है, जिसमें कुल 9,000 से अधिक एनोटेटेड पाठ उदाहरण हैं। यह डेटासेट अपने उच्च अनुपात के घुमावदार पाठ के लिए उल्लेखनीय है, जो पारंपरिक डिटेक्शन विधियों के लिए एक महत्वपूर्ण चुनौती पेश करता है जो अक्ष-संरेखित या क्षैतिज पाठ मानते हैं।

Total-Text का व्यापक रूप से शैक्षणिक अनुसंधान और प्रतियोगिताओं में उपयोग किया गया है, जैसे कि ICDAR (इंटरनेशनल कॉन्फ्रेंस ऑन डॉक्यूमेंट एनालिसिस एंड रिकग्निशन) चुनौतियां, ताकि पाठ डिटेक्शन सिस्टम के प्रदर्शन का बेंचमार्क किया जा सके। इसने उन्नत तंत्रिका नेटवर्क आर्किटेक्चर के विकास को प्रेरित किया है, जिसमें अवशिष्ट नेटवर्क और U-Net-जैसे विभाजन दृष्टिकोण पर आधारित शामिल हैं, साथ ही ऐसे तरीके जो मजबूती में सुधार के लिए डेटा संवर्धन और बैच सामान्यीकरण का लाभ उठाते हैं।

डेटासेट संरचना और एनोटेशन

Total-Text में छवियां विभिन्न शहरी वातावरणों से प्राप्त की गई हैं, जो विभिन्न भाषाओं, फोंट, प्रकाश स्थितियों और दृष्टिकोणों में पाठ को कैप्चर करती हैं। एनोटेशन शब्द स्तर पर किए जाते हैं, जिसमें प्रत्येक शब्द एक बहुभुज द्वारा घिरा होता है जो पाठ के आकार का अनुसरण करता है, चाहे वह घुमावदार, घुमाया हुआ या क्षैतिज हो। डेटासेट प्रत्येक शब्द के लिए अक्ष-संरेखित बाउंडिंग बॉक्स का एक अलग सेट भी प्रदान करता है, जिसका उपयोग उन मूल्यांकन विधियों के लिए किया जा सकता है जिन्हें आयताकार क्षेत्रों की आवश्यकता होती है। ग्राउंड ट्रुथ एक टेक्स्ट फ़ाइल प्रारूप में संग्रहीत है, जहां प्रत्येक पंक्ति एक शब्द से मेल खाती है और इसमें बहुभुज निर्देशांक और पाठ का प्रतिलेखन शामिल है।

मूल्यांकन मेट्रिक्स और प्रोटोकॉल

Total-Text के लिए मानक मूल्यांकन ICDAR प्रतियोगिताओं द्वारा स्थापित प्रोटोकॉल का पालन करता है, जिसमें प्राथमिक मेट्रिक्स के रूप में परिशुद्धता, प्रत्यावर्तन और F-माप का उपयोग किया जाता है। डिटेक्शन परिणामों को इंटरसेक्शन-ओवर-यूनियन (IoU) थ्रेसहोल्ड के आधार पर ग्राउंड ट्रुथ बहुभुजों से मिलान किया जाता है, जो आमतौर पर 0.5 पर सेट होता है। डेटासेट का आधिकारिक मूल्यांकन कोड विधियों के बीच सुसंगत तुलना सुनिश्चित करने के लिए उपलब्ध है। शोधकर्ताओं को परीक्षण सेट पर परिणाम रिपोर्ट करने के लिए प्रोत्साहित किया जाता है, और कई प्रकाशित पेपरों में ICDAR 2015 और MSRA-TD500 जैसे अन्य डेटासेट के साथ Total-Text पर तुलना शामिल है।

सीन टेक्स्ट डिटेक्शन अनुसंधान पर प्रभाव

Total-Text ने आधुनिक पाठ डिटेक्शन सिस्टम के डिज़ाइन को महत्वपूर्ण रूप से प्रभावित किया है। प्रारंभिक विधियां हस्त-निर्मित विशेषताओं और जुड़े घटक विश्लेषण पर निर्भर थीं, लेकिन घुमावदार पाठ की जटिलता ने डीप लर्निंग दृष्टिकोणों की ओर बदलाव को प्रेरित किया। कई अत्याधुनिक मॉडल अब पिक्सेल-वार तरीके से पाठ क्षेत्रों की भविष्यवाणी करने के लिए पूर्ण रूप से संवेगात्मक नेटवर्क, मल्टी-हेड अटेंशन तंत्र और एनकोडर-डिकोडर आर्किटेक्चर का उपयोग करते हैं। डेटासेट का उपयोग एंड-टू-एंड टेक्स्ट स्पॉटिंग सिस्टम को प्रशिक्षित और मूल्यांकन करने के लिए भी किया गया है जो डिटेक्शन और पहचान को जोड़ते हैं, अक्सर अनुक्रम-से-अनुक्रम मॉडल और ट्रांसफॉर्मर बैकबोन का लाभ उठाते हैं।

सीमाएं और विस्तार

जबकि Total-Text एक चुनौतीपूर्ण बेंचमार्क प्रदान करता है, इसमें सीमाएं हैं, जिनमें कुछ आधुनिक डेटासेट की तुलना में अपेक्षाकृत कम संख्या में छवियां और अंग्रेजी पाठ पर ध्यान केंद्रित करना शामिल है। बाद के डेटासेट, जैसे CTW1500 और ArT, ने अधिक विविध पाठ आकृतियों और भाषाओं को शामिल करने के लिए दायरे का विस्तार किया है। फिर भी, Total-Text पाठ डिटेक्शन एल्गोरिदम की मजबूती का मूल्यांकन करने के लिए एक व्यापक रूप से उद्धृत और उपयोग किया जाने वाला संसाधन बना हुआ है, विशेष रूप से घुमावदार और मनमाने ढंग से उन्मुख पाठ को संभालने में।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:dataset·computer-vision·scene-text-detection
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास