SROIE (स्कैन किए गए रसीद OCR और सूचना निष्कर्षण) एक बेंचमार्क डेटासेट है जिसे स्कैन किए गए रसीदों पर ऑप्टिकल कैरेक्टर पहचान (OCR) और सूचना निष्कर्षण प्रणालियों के मूल्यांकन के लिए डिज़ाइन किया गया है। 2019 में ICDAR (दस्तावेज़ विश्लेषण और पहचान पर अंतर्राष्ट्रीय सम्मेलन) प्रतियोगिता के भाग के रूप में पेश किया गया, इसमें 1,000 वास्तविक दुनिया की रसीद छवियाँ शामिल हैं, जिन्हें 600 प्रशिक्षण, 100 सत्यापन और 300 परीक्षण नमूनों में विभाजित किया गया है। डेटासेट कंपनी का नाम, पता, तिथि और कुल राशि जैसे प्रमुख क्षेत्रों को निकालने पर केंद्रित है, जो इसे दस्तावेज़ समझ मॉडल के लिए एक मानक परीक्षण मंच बनाता है।
डेटासेट चीनी विज्ञान अकादमी और अन्य संस्थानों के शोधकर्ताओं द्वारा रसीद OCR के लिए मानकीकृत मूल्यांकन की कमी को दूर करने के लिए बनाया गया था। सिंथेटिक डेटासेट के विपरीत, SROIE वास्तविक रसीदों का उपयोग करता है जिनमें विविध लेआउट, फ़ॉन्ट और मुद्रण गुणवत्ता होती है, जो शोर, तिरछापन और कम रिज़ॉल्यूशन जैसी वास्तविक दुनिया की चुनौतियों को दर्शाती है। प्रत्येक रसीद पर पाठ-स्तरीय बाउंडिंग बॉक्स और संरचित कुंजी-मूल्य जोड़े दोनों के साथ एनोटेशन किया गया है, जिससे पाठ स्थानीयकरण, प्रतिलेखन और शब्दार्थ पार्सिंग जैसे कार्य सक्षम होते हैं।
कार्य संरचना और मूल्यांकन
SROIE तीन प्राथमिक कार्यों को परिभाषित करता है: पाठ स्थानीयकरण (शब्दों और पंक्तियों का पता लगाना), पाठ पहचान (पता लगाए गए पाठ का प्रतिलेखन), और प्रमुख सूचना निष्कर्षण (पहचाने गए पाठ को पूर्वनिर्धारित क्षेत्रों में मैप करना)। आधिकारिक मूल्यांकन मेट्रिक्स में प्रत्येक कार्य के लिए परिशुद्धता, प्रत्यावर्तन और F1-स्कोर शामिल हैं, जिसमें निष्कर्षण कार्य के लिए सटीक क्षेत्र मिलान की आवश्यकता होती है। निष्कर्षण कार्य के लिए, सिस्टम को "कंपनी", "पता", "तिथि" और "कुल" जैसे क्षेत्रों के साथ एक JSON-जैसी संरचना आउटपुट करनी चाहिए। प्रतियोगिता की अंतिम रैंकिंग निष्कर्षण F1-स्कोर पर आधारित है, जो सभी क्षेत्रों में सटीकता को जोड़ती है।
तकनीकी विशेषताएँ
SROIE में रसीदें विविध प्रारूप प्रदर्शित करती हैं, जिनमें थर्मल प्रिंट, डॉट-मैट्रिक्स प्रिंट और हस्तलिखित एनोटेशन शामिल हैं। छवियाँ आमतौर पर अलग-अलग प्रकाश स्थितियों के तहत कैप्चर की जाती हैं, जो OCR एल्गोरिदम के लिए जटिलता जोड़ती हैं। डेटासेट के एनोटेशन एक कस्टम XML प्रारूप में प्रदान किए जाते हैं, जिसमें प्रत्येक शब्द को उसकी स्थिति और पाठ द्वारा टैग किया जाता है, और प्रत्येक प्रमुख क्षेत्र संबंधित शब्द या वाक्यांश से जुड़ा होता है। यह संरचना एंड-टू-एंड मॉडल और मॉड्यूलर पाइपलाइन दोनों का समर्थन करती है जो पहचान, पहचान और निष्कर्षण को अलग करती हैं।
दस्तावेज़ AI पर प्रभाव
SROIE दस्तावेज़ समझ और OCR के क्षेत्र में व्यापक रूप से उद्धृत बेंचमार्क बन गया है। इसका उपयोग कन्वोल्यूशनल न्यूरल नेटवर्क और आवर्तक तंत्रिका नेटवर्क पर आधारित मॉडलों के साथ-साथ हाल के ट्रांसफॉर्मर-आधारित आर्किटेक्चर का मूल्यांकन करने के लिए किया गया है। डेटासेट ने रसीद छवियों के लिए डेटा संवर्धन तकनीकों में अनुसंधान को भी प्रेरित किया है, जैसे सिंथेटिक शोर जोड़ना और ज्यामितीय परिवर्तन। कई बड़े भाषा मॉडल जिनमें विज़न क्षमताएँ हैं, वास्तविक दुनिया के दस्तावेज़ों से संरचित निष्कर्षण करने की उनकी क्षमता का आकलन करने के लिए SROIE पर परीक्षण किए गए हैं।
सीमाएँ और विस्तार
अपनी उपयोगिता के बावजूद, SROIE की सीमाएँ हैं। डेटासेट अपेक्षाकृत छोटा है, केवल 1,000 छवियों के साथ, जो मॉडल प्रशिक्षण में अति-अनुकूलन का कारण बन सकता है। क्षेत्र सेट चार प्रमुख क्षेत्रों तक सीमित है, जिसमें कर या आइटमीकृत पंक्तियाँ जैसे अन्य सामान्य रसीद तत्व शामिल नहीं हैं। इसके अतिरिक्त, रसीदें मुख्य रूप से चीनी व्यापारियों से हैं, जो भाषा और क्षेत्रीय पूर्वाग्रह पेश कर सकते हैं। शोधकर्ताओं ने विस्तार प्रस्तावित किए हैं, जैसे अधिक विविध रसीदें जोड़ना या सिंथेटिक वेरिएंट बनाना, लेकिन मूल SROIE उचित तुलना के लिए मानक बना हुआ है।
संबंधित बेंचमार्क
SROIE दस्तावेज़ समझ डेटासेट के व्यापक परिवार का हिस्सा है, जिसमें फ़ॉर्म समझ के लिए FUNSD और रसीद निष्कर्षण के लिए CORD शामिल हैं। जबकि CORD अधिक विस्तृत क्षेत्र एनोटेशन प्रदान करता है (जैसे, आइटम नाम, मूल्य, उप-योग), SROIE की सरलता और स्पष्ट मूल्यांकन प्रोटोकॉल इसे नए मॉडल के लिए पसंदीदा प्रारंभिक बिंदु बनाते हैं। डेटासेट को DocVQA और दृश्य पाठ पहचान चुनौतियों जैसे बड़े बहु-कार्य बेंचमार्क में भी शामिल किया गया है, जिससे क्रॉस-डोमेन मूल्यांकन संभव होता है।
भविष्य की दिशाएँ
2025 तक, SROIE का उपयोग शैक्षणिक अनुसंधान और उद्योग अनुप्रयोगों में जारी है, विशेष रूप से व्यय प्रबंधन और लेखा वर्कफ़्लो को स्वचालित करने के लिए। जनरेटिव AI और मल्टीमॉडल मॉडल के उदय के साथ, शोधकर्ता यह पता लगा रहे हैं कि कार्य-विशिष्ट प्रशिक्षण के बिना SROIE पर उच्च निष्कर्षण सटीकता प्राप्त करने के लिए पूर्व-प्रशिक्षित विज़न-भाषा मॉडल का लाभ कैसे उठाया जाए। हालाँकि, डेटासेट का निश्चित आकार और सीमित क्षेत्र विविधता का मतलब है कि अधिक जटिल दस्तावेज़ प्रकारों को संबोधित करने के लिए नए बेंचमार्क उभर रहे हैं, जबकि SROIE OCR और सूचना निष्कर्षण के लिए एक ऐतिहासिक संदर्भ बिंदु बना हुआ है।