Total-Text एक बेंचमार्क डेटासेट है जो सीन टेक्स्ट डिटेक्शन के लिए है, जिसे 2017 में टोरंटो विश्वविद्यालय और अन्य संस्थानों के शोधकर्ताओं द्वारा पेश किया गया था। इसे पहले के डेटासेट की सीमाओं को संबोधित करने के लिए डिज़ाइन किया गया था, जो मुख्य रूप से क्षैतिज या मोटे तौर पर संरेखित पाठ पर केंद्रित थे, इसमें घुमावदार और मनमाने ढंग से उन्मुख पाठ उदाहरणों का एक महत्वपूर्ण अनुपात शामिल करके। यह डेटासेट सीन टेक्स्ट डिटेक्शन के क्षेत्र में मशीन लर्निंग और डीप लर्निंग मॉडल के लिए एक मानक मूल्यांकन संसाधन बन गया है, जो कृत्रिम बुद्धिमत्ता और कंप्यूटर विज़न का एक उपक्षेत्र है।
डेटासेट में वास्तविक दुनिया के दृश्यों से एकत्रित 1,555 छवियां शामिल हैं, जैसे कि सड़क के संकेत, दुकान के मुखौटे और पोस्टर। प्रत्येक छवि को शब्द-स्तरीय बाउंडिंग बहुभुजों के साथ एनोटेट किया गया है जो पाठ क्षेत्रों को सटीक रूप से रेखांकित करते हैं, जिसमें घुमावदार और बहु-उन्मुख पाठ शामिल हैं। एनोटेशन एक प्रारूप में प्रदान किए जाते हैं जो बहुभुज और आयताकार दोनों प्रतिनिधित्व का समर्थन करता है, जिससे डिटेक्शन एल्गोरिदम का लचीला मूल्यांकन संभव होता है। Total-Text में 1,255 छवियों का एक प्रशिक्षण सेट और 300 छवियों का एक परीक्षण सेट शामिल है, जिसमें कुल 9,000 से अधिक एनोटेटेड पाठ उदाहरण हैं। यह डेटासेट अपने उच्च अनुपात के घुमावदार पाठ के लिए उल्लेखनीय है, जो पारंपरिक डिटेक्शन विधियों के लिए एक महत्वपूर्ण चुनौती पेश करता है जो अक्ष-संरेखित या क्षैतिज पाठ मानते हैं।
Total-Text का व्यापक रूप से शैक्षणिक अनुसंधान और प्रतियोगिताओं में उपयोग किया गया है, जैसे कि ICDAR (इंटरनेशनल कॉन्फ्रेंस ऑन डॉक्यूमेंट एनालिसिस एंड रिकग्निशन) चुनौतियां, ताकि पाठ डिटेक्शन सिस्टम के प्रदर्शन का बेंचमार्क किया जा सके। इसने उन्नत तंत्रिका नेटवर्क आर्किटेक्चर के विकास को प्रेरित किया है, जिसमें अवशिष्ट नेटवर्क और U-Net-जैसे विभाजन दृष्टिकोण पर आधारित शामिल हैं, साथ ही ऐसे तरीके जो मजबूती में सुधार के लिए डेटा संवर्धन और बैच सामान्यीकरण का लाभ उठाते हैं।
डेटासेट संरचना और एनोटेशन
Total-Text में छवियां विभिन्न शहरी वातावरणों से प्राप्त की गई हैं, जो विभिन्न भाषाओं, फोंट, प्रकाश स्थितियों और दृष्टिकोणों में पाठ को कैप्चर करती हैं। एनोटेशन शब्द स्तर पर किए जाते हैं, जिसमें प्रत्येक शब्द एक बहुभुज द्वारा घिरा होता है जो पाठ के आकार का अनुसरण करता है, चाहे वह घुमावदार, घुमाया हुआ या क्षैतिज हो। डेटासेट प्रत्येक शब्द के लिए अक्ष-संरेखित बाउंडिंग बॉक्स का एक अलग सेट भी प्रदान करता है, जिसका उपयोग उन मूल्यांकन विधियों के लिए किया जा सकता है जिन्हें आयताकार क्षेत्रों की आवश्यकता होती है। ग्राउंड ट्रुथ एक टेक्स्ट फ़ाइल प्रारूप में संग्रहीत है, जहां प्रत्येक पंक्ति एक शब्द से मेल खाती है और इसमें बहुभुज निर्देशांक और पाठ का प्रतिलेखन शामिल है।
मूल्यांकन मेट्रिक्स और प्रोटोकॉल
Total-Text के लिए मानक मूल्यांकन ICDAR प्रतियोगिताओं द्वारा स्थापित प्रोटोकॉल का पालन करता है, जिसमें प्राथमिक मेट्रिक्स के रूप में परिशुद्धता, प्रत्यावर्तन और F-माप का उपयोग किया जाता है। डिटेक्शन परिणामों को इंटरसेक्शन-ओवर-यूनियन (IoU) थ्रेसहोल्ड के आधार पर ग्राउंड ट्रुथ बहुभुजों से मिलान किया जाता है, जो आमतौर पर 0.5 पर सेट होता है। डेटासेट का आधिकारिक मूल्यांकन कोड विधियों के बीच सुसंगत तुलना सुनिश्चित करने के लिए उपलब्ध है। शोधकर्ताओं को परीक्षण सेट पर परिणाम रिपोर्ट करने के लिए प्रोत्साहित किया जाता है, और कई प्रकाशित पेपरों में ICDAR 2015 और MSRA-TD500 जैसे अन्य डेटासेट के साथ Total-Text पर तुलना शामिल है।
सीन टेक्स्ट डिटेक्शन अनुसंधान पर प्रभाव
Total-Text ने आधुनिक पाठ डिटेक्शन सिस्टम के डिज़ाइन को महत्वपूर्ण रूप से प्रभावित किया है। प्रारंभिक विधियां हस्त-निर्मित विशेषताओं और जुड़े घटक विश्लेषण पर निर्भर थीं, लेकिन घुमावदार पाठ की जटिलता ने डीप लर्निंग दृष्टिकोणों की ओर बदलाव को प्रेरित किया। कई अत्याधुनिक मॉडल अब पिक्सेल-वार तरीके से पाठ क्षेत्रों की भविष्यवाणी करने के लिए पूर्ण रूप से संवेगात्मक नेटवर्क, मल्टी-हेड अटेंशन तंत्र और एनकोडर-डिकोडर आर्किटेक्चर का उपयोग करते हैं। डेटासेट का उपयोग एंड-टू-एंड टेक्स्ट स्पॉटिंग सिस्टम को प्रशिक्षित और मूल्यांकन करने के लिए भी किया गया है जो डिटेक्शन और पहचान को जोड़ते हैं, अक्सर अनुक्रम-से-अनुक्रम मॉडल और ट्रांसफॉर्मर बैकबोन का लाभ उठाते हैं।
सीमाएं और विस्तार
जबकि Total-Text एक चुनौतीपूर्ण बेंचमार्क प्रदान करता है, इसमें सीमाएं हैं, जिनमें कुछ आधुनिक डेटासेट की तुलना में अपेक्षाकृत कम संख्या में छवियां और अंग्रेजी पाठ पर ध्यान केंद्रित करना शामिल है। बाद के डेटासेट, जैसे CTW1500 और ArT, ने अधिक विविध पाठ आकृतियों और भाषाओं को शामिल करने के लिए दायरे का विस्तार किया है। फिर भी, Total-Text पाठ डिटेक्शन एल्गोरिदम की मजबूती का मूल्यांकन करने के लिए एक व्यापक रूप से उद्धृत और उपयोग किया जाने वाला संसाधन बना हुआ है, विशेष रूप से घुमावदार और मनमाने ढंग से उन्मुख पाठ को संभालने में।