अंग्रेज़ी से अनुवादित

SROIE स्कैन किए गए रसीदों के OCR के लिए एक डेटासेट है, जिसमें प्रमुख जानकारी निष्कर्षण कार्यों के लिए 1,000 छवियाँ शामिल हैं। इसे 2019 में ICDAR प्रतियोगिता के लिए पेश किया गया था और इसका उपयोग OCR और दस्तावेज़ समझ प्रणालियों के बेंचमार्किंग के लिए किया जाता है।

SROIE (स्कैन किए गए रसीद OCR और सूचना निष्कर्षण) एक बेंचमार्क डेटासेट है जिसे स्कैन किए गए रसीदों पर ऑप्टिकल कैरेक्टर पहचान (OCR) और सूचना निष्कर्षण प्रणालियों के मूल्यांकन के लिए डिज़ाइन किया गया है। 2019 में ICDAR (दस्तावेज़ विश्लेषण और पहचान पर अंतर्राष्ट्रीय सम्मेलन) प्रतियोगिता के भाग के रूप में पेश किया गया, इसमें 1,000 वास्तविक दुनिया की रसीद छवियाँ शामिल हैं, जिन्हें 600 प्रशिक्षण, 100 सत्यापन और 300 परीक्षण नमूनों में विभाजित किया गया है। डेटासेट कंपनी का नाम, पता, तिथि और कुल राशि जैसे प्रमुख क्षेत्रों को निकालने पर केंद्रित है, जो इसे दस्तावेज़ समझ मॉडल के लिए एक मानक परीक्षण मंच बनाता है।

डेटासेट चीनी विज्ञान अकादमी और अन्य संस्थानों के शोधकर्ताओं द्वारा रसीद OCR के लिए मानकीकृत मूल्यांकन की कमी को दूर करने के लिए बनाया गया था। सिंथेटिक डेटासेट के विपरीत, SROIE वास्तविक रसीदों का उपयोग करता है जिनमें विविध लेआउट, फ़ॉन्ट और मुद्रण गुणवत्ता होती है, जो शोर, तिरछापन और कम रिज़ॉल्यूशन जैसी वास्तविक दुनिया की चुनौतियों को दर्शाती है। प्रत्येक रसीद पर पाठ-स्तरीय बाउंडिंग बॉक्स और संरचित कुंजी-मूल्य जोड़े दोनों के साथ एनोटेशन किया गया है, जिससे पाठ स्थानीयकरण, प्रतिलेखन और शब्दार्थ पार्सिंग जैसे कार्य सक्षम होते हैं।

कार्य संरचना और मूल्यांकन

SROIE तीन प्राथमिक कार्यों को परिभाषित करता है: पाठ स्थानीयकरण (शब्दों और पंक्तियों का पता लगाना), पाठ पहचान (पता लगाए गए पाठ का प्रतिलेखन), और प्रमुख सूचना निष्कर्षण (पहचाने गए पाठ को पूर्वनिर्धारित क्षेत्रों में मैप करना)। आधिकारिक मूल्यांकन मेट्रिक्स में प्रत्येक कार्य के लिए परिशुद्धता, प्रत्यावर्तन और F1-स्कोर शामिल हैं, जिसमें निष्कर्षण कार्य के लिए सटीक क्षेत्र मिलान की आवश्यकता होती है। निष्कर्षण कार्य के लिए, सिस्टम को "कंपनी", "पता", "तिथि" और "कुल" जैसे क्षेत्रों के साथ एक JSON-जैसी संरचना आउटपुट करनी चाहिए। प्रतियोगिता की अंतिम रैंकिंग निष्कर्षण F1-स्कोर पर आधारित है, जो सभी क्षेत्रों में सटीकता को जोड़ती है।

तकनीकी विशेषताएँ

SROIE में रसीदें विविध प्रारूप प्रदर्शित करती हैं, जिनमें थर्मल प्रिंट, डॉट-मैट्रिक्स प्रिंट और हस्तलिखित एनोटेशन शामिल हैं। छवियाँ आमतौर पर अलग-अलग प्रकाश स्थितियों के तहत कैप्चर की जाती हैं, जो OCR एल्गोरिदम के लिए जटिलता जोड़ती हैं। डेटासेट के एनोटेशन एक कस्टम XML प्रारूप में प्रदान किए जाते हैं, जिसमें प्रत्येक शब्द को उसकी स्थिति और पाठ द्वारा टैग किया जाता है, और प्रत्येक प्रमुख क्षेत्र संबंधित शब्द या वाक्यांश से जुड़ा होता है। यह संरचना एंड-टू-एंड मॉडल और मॉड्यूलर पाइपलाइन दोनों का समर्थन करती है जो पहचान, पहचान और निष्कर्षण को अलग करती हैं।

दस्तावेज़ AI पर प्रभाव

SROIE दस्तावेज़ समझ और OCR के क्षेत्र में व्यापक रूप से उद्धृत बेंचमार्क बन गया है। इसका उपयोग कन्वोल्यूशनल न्यूरल नेटवर्क और आवर्तक तंत्रिका नेटवर्क पर आधारित मॉडलों के साथ-साथ हाल के ट्रांसफॉर्मर-आधारित आर्किटेक्चर का मूल्यांकन करने के लिए किया गया है। डेटासेट ने रसीद छवियों के लिए डेटा संवर्धन तकनीकों में अनुसंधान को भी प्रेरित किया है, जैसे सिंथेटिक शोर जोड़ना और ज्यामितीय परिवर्तन। कई बड़े भाषा मॉडल जिनमें विज़न क्षमताएँ हैं, वास्तविक दुनिया के दस्तावेज़ों से संरचित निष्कर्षण करने की उनकी क्षमता का आकलन करने के लिए SROIE पर परीक्षण किए गए हैं।

सीमाएँ और विस्तार

अपनी उपयोगिता के बावजूद, SROIE की सीमाएँ हैं। डेटासेट अपेक्षाकृत छोटा है, केवल 1,000 छवियों के साथ, जो मॉडल प्रशिक्षण में अति-अनुकूलन का कारण बन सकता है। क्षेत्र सेट चार प्रमुख क्षेत्रों तक सीमित है, जिसमें कर या आइटमीकृत पंक्तियाँ जैसे अन्य सामान्य रसीद तत्व शामिल नहीं हैं। इसके अतिरिक्त, रसीदें मुख्य रूप से चीनी व्यापारियों से हैं, जो भाषा और क्षेत्रीय पूर्वाग्रह पेश कर सकते हैं। शोधकर्ताओं ने विस्तार प्रस्तावित किए हैं, जैसे अधिक विविध रसीदें जोड़ना या सिंथेटिक वेरिएंट बनाना, लेकिन मूल SROIE उचित तुलना के लिए मानक बना हुआ है।

संबंधित बेंचमार्क

SROIE दस्तावेज़ समझ डेटासेट के व्यापक परिवार का हिस्सा है, जिसमें फ़ॉर्म समझ के लिए FUNSD और रसीद निष्कर्षण के लिए CORD शामिल हैं। जबकि CORD अधिक विस्तृत क्षेत्र एनोटेशन प्रदान करता है (जैसे, आइटम नाम, मूल्य, उप-योग), SROIE की सरलता और स्पष्ट मूल्यांकन प्रोटोकॉल इसे नए मॉडल के लिए पसंदीदा प्रारंभिक बिंदु बनाते हैं। डेटासेट को DocVQA और दृश्य पाठ पहचान चुनौतियों जैसे बड़े बहु-कार्य बेंचमार्क में भी शामिल किया गया है, जिससे क्रॉस-डोमेन मूल्यांकन संभव होता है।

भविष्य की दिशाएँ

2025 तक, SROIE का उपयोग शैक्षणिक अनुसंधान और उद्योग अनुप्रयोगों में जारी है, विशेष रूप से व्यय प्रबंधन और लेखा वर्कफ़्लो को स्वचालित करने के लिए। जनरेटिव AI और मल्टीमॉडल मॉडल के उदय के साथ, शोधकर्ता यह पता लगा रहे हैं कि कार्य-विशिष्ट प्रशिक्षण के बिना SROIE पर उच्च निष्कर्षण सटीकता प्राप्त करने के लिए पूर्व-प्रशिक्षित विज़न-भाषा मॉडल का लाभ कैसे उठाया जाए। हालाँकि, डेटासेट का निश्चित आकार और सीमित क्षेत्र विविधता का मतलब है कि अधिक जटिल दस्तावेज़ प्रकारों को संबोधित करने के लिए नए बेंचमार्क उभर रहे हैं, जबकि SROIE OCR और सूचना निष्कर्षण के लिए एक ऐतिहासिक संदर्भ बिंदु बना हुआ है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:dataset·ocr·information-extraction·document-understanding
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास