TextCaps एक बड़े पैमाने पर डेटासेट और इमेज कैप्शनिंग के लिए बेंचमार्क है, जो विशेष रूप से छवियों के भीतर दिखाई देने वाले टेक्स्ट को शामिल करने वाले कैप्शन उत्पन्न करने पर केंद्रित है। पारंपरिक इमेज कैप्शनिंग कार्यों के विपरीत, जो वस्तुओं और दृश्यों का वर्णन करते हैं, TextCaps के लिए मॉडलों को छवि में मौजूद टेक्स्ट को पढ़ने और उसके बारे में तर्क करने की आवश्यकता होती है, जैसे कि सड़क के संकेत, उत्पाद लेबल, या पुस्तक कवर, और उस जानकारी को एक सुसंगत प्राकृतिक भाषा विवरण में एकीकृत करना होता है। यह डेटासेट 2020 में Google और कैलिफोर्निया विश्वविद्यालय, बर्कले के शोधकर्ताओं द्वारा पेश किया गया था, और यह दृष्टि-भाषा मॉडलों के लिए एक मानक मूल्यांकन बन गया है जो दृश्य धारणा और ऑप्टिकल कैरेक्टर रिकग्निशन (OCR) के बीच की खाई को पाटने का लक्ष्य रखते हैं।
TextCaps की मुख्य चुनौती यह है कि यह दो अलग-अलग क्षमताओं को जोड़ता है: दृश्य समझ और टेक्स्ट पहचान। एक मॉडल को न केवल वस्तुओं और उनके संबंधों की पहचान करनी चाहिए, बल्कि छवि में टेक्स्ट को सटीक रूप से लिपिबद्ध करना चाहिए और यह तय करना चाहिए कि उस टेक्स्ट के कौन से हिस्से समग्र दृश्य विवरण के लिए प्रासंगिक हैं। उदाहरण के लिए, एक कॉफी शॉप की छवि के लिए कैप्शन में दुकान के मुखौटे पर नाम, मेनू बोर्ड पर पेय का प्रकार, या पृष्ठभूमि में पोस्टर पर टेक्स्ट का उल्लेख करना आवश्यक हो सकता है। इसके लिए Computer vision तकनीकों का Natural language processing और Optical character recognition (OCR) प्रणालियों के साथ गहन एकीकरण आवश्यक है।
डेटासेट संरचना और एनोटेशन
TextCaps डेटासेट में 28,000 छवियाँ हैं, जिनमें से प्रत्येक के साथ कई मानव-लिखित कैप्शन जुड़े हैं, जिनकी कुल संख्या 145,000 से अधिक है। छवियाँ टेक्स्ट-इन-इमेजेस डोमेन से ली गई हैं, जिसमें वास्तविक दुनिया के विभिन्न दृश्य शामिल हैं, जैसे कि सड़क दृश्य, इनडोर सेटिंग्स और उत्पाद शॉट्स। प्रत्येक छवि में औसतन पाँच कैप्शन होते हैं, और कैप्शन वर्णनात्मक और प्राकृतिक होने के लिए डिज़ाइन किए गए हैं, जिनमें अक्सर छवि में दिखाई देने वाले विशिष्ट टेक्स्ट स्ट्रिंग शामिल होते हैं। डेटासेट को प्रशिक्षण, सत्यापन और परीक्षण सेटों में विभाजित किया गया है, जिसमें परीक्षण सेट का उपयोग आधिकारिक बेंचमार्क मूल्यांकन के लिए किया जाता है। एनोटेशन एक क्राउडसोर्सिंग प्लेटफॉर्म के माध्यम से एकत्र किए गए थे, जिसमें यह सुनिश्चित करने के लिए सावधानीपूर्वक निर्देश दिए गए थे कि कैप्शन केवल तभी टेक्स्ट का उल्लेख करें जब वह दृश्य के लिए प्रासंगिक हो।
डेटासेट प्रत्येक छवि के लिए OCR एनोटेशन भी प्रदान करता है, जिसमें बाउंडिंग बॉक्स और लिपिबद्ध टेक्स्ट शामिल हैं, जिन्हें कई मॉडलों में इनपुट के रूप में उपयोग किया जाता है। यह शोधकर्ताओं को कच्चे OCR पहचान के बजाय तर्क और पीढ़ी पहलुओं पर ध्यान केंद्रित करने की अनुमति देता है, हालांकि कुछ मॉडल एंड-टू-एंड OCR सीखने को भी शामिल करते हैं।
मूल्यांकन मेट्रिक्स और चुनौतियाँ
TextCaps के लिए प्राथमिक मूल्यांकन मेट्रिक CIDEr है, जो उत्पन्न कैप्शन और मानव संदर्भों के बीच समानता को मापता है, जिसमें आम सहमति और सूचनात्मकता पर ध्यान केंद्रित किया जाता है। BLEU, METEOR और ROUGE जैसे अन्य मेट्रिक्स भी रिपोर्ट किए जाते हैं, लेकिन CIDEr मुख्य रैंकिंग मानदंड है। यह कार्य विशेष रूप से चुनौतीपूर्ण है क्योंकि कैप्शन व्याकरणिक रूप से सही और छवि में टेक्स्ट के संबंध में तथ्यात्मक रूप से सटीक दोनों होने चाहिए। एक मॉडल जो वस्तुओं की सही पहचान करता है लेकिन एक संकेत को गलत पढ़ता है, उसे कम स्कोर मिलेगा।
मानक इमेज कैप्शनिंग मॉडलों का उपयोग करने वाले शुरुआती बेसलाइन, जैसे कि Encoder-Decoder Architecture आर्किटेक्चर और Residual Network (ResNet) सुविधाओं पर आधारित, TextCaps पर खराब प्रदर्शन करते थे, CIDEr स्कोर 50 से नीचे प्राप्त करते थे। इसने विशेष आर्किटेक्चर की आवश्यकता को उजागर किया जो पीढ़ी प्रक्रिया में OCR टोकन को शामिल कर सकते हैं। बाद के कार्यों ने ऐसे तरीके पेश किए जो OCR सुविधाओं के लिए क्रॉस-अटेंशन के साथ Transformer (architecture)-आधारित डिकोडर का उपयोग करते हैं, जिससे महत्वपूर्ण सुधार हुए।
मॉडल आर्किटेक्चर और दृष्टिकोण
TextCaps के लिए अधिकांश सफल दृष्टिकोण दो-चरणीय पाइपलाइन का उपयोग करते हैं: पहले, एक OCR प्रणाली छवि से टेक्स्ट निकालती है, और दूसरे, एक कैप्शनिंग मॉडल दृश्य सुविधाओं और OCR टोकन दोनों का उपयोग करके विवरण उत्पन्न करता है। कैप्शनिंग मॉडल अक्सर एक Transformer (architecture) होता है जो छवि क्षेत्र सुविधाओं और OCR टोकन एम्बेडिंग के अनुक्रम को इनपुट के रूप में लेता है, और टोकन-दर-टोकन कैप्शन आउटपुट करता है। उदाहरण के लिए, Hu et al. द्वारा पेश किया गया M4C (Multimodal Multi-Copy Mesh) मॉडल, एक कॉपी तंत्र के साथ एक ट्रांसफॉर्मर का उपयोग करता है जो OCR टोकन से सीधे टेक्स्ट कॉपी कर सकता है, जो ब्रांड नाम या पते जैसे स्ट्रिंग्स को सटीक रूप से पुन:प्रस्तुत करने के लिए महत्वपूर्ण है।
काम की एक और पंक्ति OCR को सीधे दृश्य एनकोडर में एकीकृत करती है, एक Neural network का उपयोग करके जो पिक्सेल और टेक्स्ट एम्बेडिंग दोनों को एक साथ संसाधित करता है। ये मॉडल अक्सर टेक्स्ट पीढ़ी भाग के लिए पूर्व-प्रशिक्षित Large language model का लाभ उठाते हैं, उन्हें TextCaps प्रशिक्षण सेट पर फाइन-ट्यून करते हैं। दृश्य और पाठ्य मोडैलिटी के बीच Cross-Attention का उपयोग एक सामान्य डिज़ाइन पैटर्न है, जो मॉडल को OCR टोकन को छवि क्षेत्रों के साथ संरेखित करने की अनुमति देता है।
प्रभाव और संबंधित बेंचमार्क
TextCaps ने अधिक व्यापक बेंचमार्क के विकास को प्रेरित किया है जो टेक्स्ट और दृष्टि को जोड़ते हैं, जैसे कि OCR-VQA और ST-VQA, जो टेक्स्ट के साथ दृश्य प्रश्न उत्तर पर केंद्रित हैं। इसने मल्टीमोडल Large language model के डिज़ाइन को भी प्रभावित किया है, जैसे कि OpenAI और Google DeepMind द्वारा विकसित, जो अब छवियों में टेक्स्ट पढ़ने और वर्णनात्मक प्रतिक्रियाएँ उत्पन्न करने में सक्षम हैं। डेटासेट AI प्रणालियों की OCR-जागरूक तर्क क्षमताओं का मूल्यांकन करने के लिए एक मानक परीक्षण स्थल बना हुआ है, और इसका उपयोग अक्सर text-vqa और COCO-Text जैसे अन्य डेटासेट के साथ संयोजन में किया जाता है।
2025 तक, TextCaps पर अत्याधुनिक मॉडल 140 से ऊपर CIDEr स्कोर प्राप्त करते हैं, जो प्रारंभिक बेसलाइन की तुलना में एक महत्वपूर्ण सुधार है, लेकिन यह कार्य अभी भी खुला माना जाता है, जिसमें दुर्लभ टेक्स्ट शैलियों, जटिल लेआउट और अस्पष्ट टेक्स्ट प्रासंगिकता को संभालने में सुधार की गुंजाइश है। बेंचमार्क Generative AI और मल्टीमोडल समझ में अनुसंधान को आगे बढ़ाने के लिए एक मूल्यवान संसाधन बना हुआ है।
भविष्य की दिशाएँ
TextCaps अनुसंधान का भविष्य ऐसे मॉडल विकसित करने में निहित है जो न केवल टेक्स्ट पढ़ सकें बल्कि संदर्भ में इसके अर्थ संबंधी महत्व के बारे में तर्क कर सकें, जैसे कि यह समझना कि एक "Sale" संकेत छूट का संकेत देता है या एक "Do Not Enter" संकेत प्रतिबंध का संकेत देता है। इसके लिए विश्व ज्ञान और सामान्य ज्ञान का गहन एकीकरण आवश्यक है, जो Artificial intelligence में अध्ययन का एक सक्रिय क्षेत्र है। इसके अतिरिक्त, TextCaps को वीडियो तक विस्तारित करने में रुचि है, जहाँ टेक्स्ट गतिशील रूप से दिखाई देता है, और बहुभाषी सेटिंग्स में, जहाँ OCR और कैप्शनिंग को कई लिपियों को संभालना होगा। डेटासेट के डिज़ाइन ने अन्य डोमेन में भी समान प्रयासों को प्रेरित किया है, जैसे कि चिकित्सा इमेजिंग और स्वायत्त ड्राइविंग, जहाँ पर्यावरण में टेक्स्ट पढ़ना महत्वपूर्ण है।
यह भी देखें
- image-captioning
- Optical character recognition
- Vision-language model
- multimodal-learning
संदर्भ
- Hu, R., Singh, A., Darrell, T., & Rohrbach, M. (2020). TextCaps: A Dataset for Image Captioning with Reading Comprehension. In European Conference on Computer Vision (ECCV).
- Sidorov, O., Hu, R., Rohrbach, M., & Singh, A. (2020). TextCaps: A Dataset for Image Captioning with Reading Comprehension. arXiv preprint arXiv:2003.12462.