CORD (समेकित रसीद डेटासेट) एक सार्वजनिक रूप से उपलब्ध डेटासेट है जिसे Artificial intelligence के भीतर दस्तावेज़ समझ के एक उप-क्षेत्र, रसीद समझ में अनुसंधान के लिए डिज़ाइन किया गया है। इसमें वास्तविक दुनिया के स्रोतों से एकत्रित 11,000 से अधिक एनोटेटेड रसीद छवियां शामिल हैं, जो विविध व्यापारियों, लेआउट और भाषाओं को कवर करती हैं। डेटासेट पिक्सेल-स्तर और टोकन-स्तर एनोटेशन प्रदान करता है जो कुंजी सूचना निष्कर्षण, अर्थगत विभाजन और इकाई पहचान जैसे कार्यों का समर्थन करते हैं, जिससे यह रसीदों को संसाधित करने वाले मॉडलों के मूल्यांकन के लिए एक मानक बन जाता है।
CORD को 2019 में दक्षिण कोरिया के नेवर कॉर्पोरेशन और विज्ञान और प्रौद्योगिकी विश्वविद्यालय के शोधकर्ताओं द्वारा पेश किया गया था। डेटासेट को रसीद पार्सिंग के लिए मानकीकृत, बड़े पैमाने पर एनोटेटेड डेटा की कमी को दूर करने के लिए बनाया गया था, जो व्यय ट्रैकिंग, लेखांकन स्वचालन और मोबाइल भुगतान प्रणालियों जैसे अनुप्रयोगों के लिए महत्वपूर्ण है। अपनी रिलीज़ के बाद से, CORD को शैक्षणिक अनुसंधान और उद्योग में व्यापक रूप से अपनाया गया है, जो दस्तावेज़ बुद्धिमत्ता के लिए Deep learning और Machine learning दृष्टिकोणों की तुलना करने के लिए एक मानक परीक्षण आधार के रूप में कार्य करता है।
CORD में एनोटेशन एक पदानुक्रमित संरचना का पालन करते हैं जो रसीद जानकारी को स्टोर नाम, दिनांक, समय, आइटम, मूल्य और भुगतान विधियों जैसी श्रेणियों में व्यवस्थित करता है। प्रत्येक पाठ क्षेत्र को एक अर्थगत वर्ग के साथ लेबल किया जाता है, और क्षेत्रों के बीच संबंध (जैसे, आइटम से मूल्य) कैप्चर किए जाते हैं। यह सूक्ष्म-स्तरीय एनोटेशन मॉडल को न केवल यह सीखने में सक्षम बनाता है कि कौन सी जानकारी मौजूद है, बल्कि यह भी कि यह कैसे संरचित है, जो स्वचालित बहीखाता जैसे डाउनस्ट्रीम कार्यों के लिए आवश्यक है।
एनोटेशन संरचना
CORD की एनोटेशन योजना 4 मुख्य श्रेणियों में 30 वर्गों को परिभाषित करती है: मेनू, उप-मेनू, आइटम और विकल्प, साथ ही मात्रा, इकाई मूल्य और कुल जैसे अतिरिक्त क्षेत्र। प्रत्येक पाठ खंड को एक वर्ग सौंपा गया है, और खंडों के बीच स्थानिक संबंधों को निर्देशित किनारों के रूप में एन्कोड किया गया है। उदाहरण के लिए, एक आइटम नाम उसके संबंधित इकाई मूल्य और मात्रा से जुड़ा होता है। यह संरचना फ्लैट वर्गीकरण और संबंधपरक शिक्षण दोनों का समर्थन करती है, जिससे मॉडल संयुक्त निष्कर्षण और संबंध भविष्यवाणी कर सकते हैं।
डेटासेट में प्रत्येक पाठ क्षेत्र के लिए बाउंडिंग बॉक्स, साथ ही पाठ सामग्री और उसका वर्ग लेबल शामिल है। एनोटेशन JSON प्रारूप में प्रदान किए जाते हैं, जो आधुनिक Neural network पाइपलाइनों के साथ आसान एकीकरण की सुविधा प्रदान करते हैं। पदानुक्रमित डिज़ाइन टोकन-स्तर और खंड-स्तर दोनों प्रदर्शन के मूल्यांकन को भी सक्षम बनाता है, जिससे शोधकर्ताओं को सूक्ष्म मीट्रिक मिलते हैं।
एआई अनुसंधान में अनुप्रयोग
CORD दस्तावेज़ समझ में मॉडल विकसित करने और बेंचमार्क करने के लिए एक संदर्भ बिंदु बन गया है। इसका उपयोग आमतौर पर Transformer (architecture)-आधारित आर्किटेक्चर को प्रशिक्षित और परीक्षण करने के लिए किया जाता है, जैसे कि जो दृश्य और पाठ्य सुविधाओं को जोड़ते हैं। उदाहरण के लिए, LayoutLM और Donut जैसे मॉडलों का मूल्यांकन CORD पर किया गया है, जो अत्याधुनिक प्रदर्शन को आगे बढ़ाने में इसकी उपयोगिता को प्रदर्शित करता है। डेटासेट Generative AI में अनुसंधान का भी समर्थन करता है, जहां मॉडल कच्ची रसीद छवियों से संरचित आउटपुट उत्पन्न करते हैं।
शैक्षणिक अनुसंधान के अलावा, CORD के पास उन उद्योगों में व्यावहारिक अनुप्रयोग हैं जो रसीद डिजिटलीकरण पर निर्भर हैं। फिनटेक, खुदरा और लॉजिस्टिक्स में कंपनियां डेटा प्रविष्टि को स्वचालित करने, मैन्युअल त्रुटियों को कम करने और ग्राहक अनुभवों में सुधार करने के लिए CORD पर प्रशिक्षित मॉडल का उपयोग करती हैं। रसीद प्रारूपों में डेटासेट की विविधता यह सुनिश्चित करने में मदद करती है कि मॉडल वास्तविक दुनिया की विविधताओं, जैसे विभिन्न फ़ॉन्ट, अभिविन्यास और प्रकाश स्थितियों के लिए सामान्यीकरण करते हैं।
तकनीकी चुनौतियाँ
रसीद समझ कई चुनौतियाँ प्रस्तुत करती है जिन्हें CORD शोधकर्ताओं को संबोधित करने में मदद करता है। रसीदों में अक्सर शोरगुल वाला पाठ, ओवरलैपिंग तत्व और अनियमित लेआउट होते हैं, जिससे सटीक विभाजन मुश्किल हो जाता है। इसके अतिरिक्त, CORD में भाषाओं और मुद्राओं की विविधता के लिए मॉडल को बहुभाषी और बहु-प्रारूप इनपुट संभालने की आवश्यकता होती है। एक और चुनौती कुछ पाठ क्षेत्रों का छोटा आकार है, जो पहचान प्रणालियों द्वारा छूट सकता है। CORD के विस्तृत एनोटेशन शोधकर्ताओं को इन मुद्दों को अलग करने और बेहतर Data Augmentation तकनीकों या Multi-Head Attention तंत्र जैसे लक्षित समाधान विकसित करने की अनुमति देते हैं।
संबंधित डेटासेट और बेंचमार्क
CORD की तुलना अक्सर अन्य रसीद और दस्तावेज़ डेटासेट, जैसे SROIE (स्कैन की गई रसीदें ओसीआर और सूचना निष्कर्षण) और FUNSD (शोर दस्तावेजों में फॉर्म समझ) के साथ की जाती है। जबकि SROIE रसीदों से कुंजी सूचना निष्कर्षण पर केंद्रित है, CORD अर्थगत विभाजन और संबंध निष्कर्षण सहित समृद्ध एनोटेशन प्रदान करता है। यह CORD को उन कार्यों के लिए अधिक उपयुक्त बनाता है जिनके लिए दस्तावेज़ संरचना की गहरी समझ की आवश्यकता होती है। शोधकर्ता अक्सर विभिन्न दस्तावेज़ प्रकारों में अपने मॉडल के सामान्यीकरण का मूल्यांकन करने के लिए इन डेटासेट के साथ CORD का उपयोग करते हैं।
भविष्य की दिशाएँ
दस्तावेज़ समझ का क्षेत्र तेजी से विकसित हो रहा है, जिसमें Large language model को मल्टीमॉडल कार्यों के लिए अनुकूलित किया जा रहा है। CORD संभवतः ऐसे मॉडलों को प्रशिक्षित और मूल्यांकन करने के लिए एक मूल्यवान संसाधन बना रहेगा, खासकर जब वे जटिल लेआउट और भाषाओं को संभालने में अधिक सक्षम हो जाते हैं। CORD के भविष्य के विस्तार में अधिक विविध रसीद प्रारूप, अतिरिक्त भाषाएं और तालिका निष्कर्षण या विसंगति का पता लगाने जैसे नए कार्यों के लिए एनोटेशन शामिल हो सकते हैं। जैसे-जैसे Artificial intelligence आगे बढ़ता है, CORD जैसे डेटासेट यह सुनिश्चित करने में महत्वपूर्ण भूमिका निभाएंगे कि मॉडल मजबूत, सटीक और वास्तविक दुनिया के परिदृश्यों पर लागू हों।