अंग्रेज़ी से अनुवादित

TextVQA एक दृश्य प्रश्न उत्तर कार्य है जिसमें मॉडलों को छवियों में मौजूद पाठ, जैसे संकेत, लेबल और दस्तावेज़, को पढ़ने और उसके बारे में तर्क करने की आवश्यकता होती है, ताकि प्रश्नों के उत्तर दिए जा सकें।

TextVQA अनुसंधान का एक कार्य और बेंचमार्क है जो Artificial intelligence के क्षेत्र में कंप्यूटर विज़न और प्राकृतिक भाषा प्रसंस्करण को जोड़ता है। यह छवियों के बारे में प्रश्नों के उत्तर देने पर केंद्रित है, जहां सही उत्तर छवि के भीतर दिखाई देने वाले पाठ को पढ़ने और समझने पर निर्भर करता है। इसमें सड़क के संकेतों, उत्पाद लेबल, रेस्तरां मेनू, हस्तलिखित नोट्स और अन्य वास्तविक दुनिया की वस्तुओं पर पाठ शामिल है। मानक दृश्य प्रश्नोत्तर (VQA) के विपरीत, जो अक्सर वस्तुओं और दृश्यों को पहचानने पर निर्भर करता है, TextVQA विशेष रूप से एक मॉडल की ऑप्टिकल कैरेक्टर रिकग्निशन (OCR) करने और निकाली गई पाठ्य सूचना को दृश्य संदर्भ और प्रश्न के शब्दार्थ के साथ एकीकृत करने की क्षमता का परीक्षण करता है।

यह कार्य पहले के VQA डेटासेट में एक अंतर को संबोधित करने के लिए पेश किया गया था, जिसमें आमतौर पर बहुत कम या कोई सार्थक पाठ वाली छवियां होती थीं। TextVQA के लिए एक प्रणाली को न केवल पाठ का पता लगाने और पहचानने की आवश्यकता होती है, बल्कि प्रश्न से इसकी प्रासंगिकता के बारे में तर्क करने की भी आवश्यकता होती है, जिसमें अक्सर स्थानिक तर्क (जैसे, "दरवाजे के ऊपर क्या लिखा है?") या सामान्य ज्ञान अनुमान (जैसे, "यह किस प्रकार की दुकान है?" एक संकेत के आधार पर) शामिल होता है। इस बेंचमार्क ने मल्टीमॉडल लर्निंग में महत्वपूर्ण शोध को बढ़ावा दिया है, विशेष रूप से ऐसे आर्किटेक्चर विकसित करने में जो दृश्य सुविधाओं, OCR टोकन और भाषा प्रतिनिधित्व को संयुक्त रूप से संसाधित कर सकते हैं।

डेटासेट और बेंचमार्क

TextVQA डेटासेट 2019 में जॉर्जिया इंस्टीट्यूट ऑफ टेक्नोलॉजी और फेसबुक एआई रिसर्च (अब मेटा एआई का हिस्सा) के शोधकर्ताओं द्वारा जारी किया गया था। इसमें 4,972 छवियों पर 28,408 प्रश्न शामिल हैं, जिनमें छवियां ओपन इमेजेज डेटासेट से ली गई हैं। प्रत्येक छवि में कम से कम एक शब्द का पाठ होता है, और प्रश्नों को सही उत्तर देने के लिए उस पाठ को पढ़ने की आवश्यकता के लिए डिज़ाइन किया गया है। डेटासेट को प्रशिक्षण (34,602 प्रश्न), सत्यापन (5,000 प्रश्न) और परीक्षण सेट में विभाजित किया गया है, जिसमें परीक्षण सेट का उपयोग ऑनलाइन सर्वर के माध्यम से आधिकारिक मूल्यांकन के लिए किया जाता है।

प्रश्न खुले-अंत वाले होते हैं और छोटे उत्तरों की आवश्यकता होती है, आमतौर पर एक से तीन शब्द। डेटासेट में प्रत्येक छवि के लिए ग्राउंड-ट्रूथ OCR एनोटेशन शामिल हैं, जो शब्द बाउंडिंग बॉक्स और मान्यता प्राप्त पाठ प्रदान करते हैं। यह मॉडल को स्पष्ट OCR पर्यवेक्षण के साथ प्रशिक्षित करने या पूर्व-निकाले गए OCR सुविधाओं का उपयोग करने की अनुमति देता है। मूल्यांकन मीट्रिक मानक VQA सटीकता है, जहां एक पूर्वानुमानित उत्तर सही माना जाता है यदि यह दस मानव-प्रदत्त ग्राउंड-ट्रूथ उत्तरों में से एक से मेल खाता है।

मॉडल आर्किटेक्चर

TextVQA के शुरुआती दृष्टिकोणों ने मॉड्यूलर पाइपलाइनों का उपयोग किया जो एक पूर्व-प्रशिक्षित OCR प्रणाली (जैसे रोसेटा या टेसेरैक्ट) को Neural network के साथ तर्क के लिए जोड़ते थे। एक सामान्य आर्किटेक्चर लुक, रीड, रीज़न, आंसर (LoRRA) मॉडल था, जो छवि सुविधाओं के लिए Residual Network (ResNet), प्रश्न एन्कोडिंग के लिए एक द्विदिश LSTM, और दृश्य, पाठ्य और OCR सुविधाओं को संयोजित करने के लिए एक मल्टीमॉडल फ्यूजन परत का उपयोग करता था। LoRRA ने एक कॉपी तंत्र भी शामिल किया जो मॉडल को सीधे OCR टोकन से शब्दों को आउटपुट करने की अनुमति देता था, जो उन प्रश्नों के उत्तर देने के लिए प्रभावी साबित हुआ जिनके लिए शब्दशः पाठ की आवश्यकता होती है।

बाद के मॉडलों ने Transformer (architecture)-आधारित आर्किटेक्चर का लाभ उठाया, जैसे M4C (मल्टीमॉडल मल्टी-कॉपी मेश), जिसने एक पुनरावृत्त उत्तर डिकोडिंग प्रक्रिया और कई OCR टोकन को संभालने के लिए एक मल्टी-कॉपी तंत्र पेश किया। बाद में, Large language model-आधारित प्रणालियों (जैसे LLaVA, Flamingo) जैसे एकीकृत विज़न-भाषा मॉडल को डेटासेट पर फाइन-ट्यूनिंग द्वारा TextVQA के लिए अनुकूलित किया गया, जिससे छवि-पाठ जोड़ों पर बड़े पैमाने पर पूर्व-प्रशिक्षण का लाभ उठाकर उच्च सटीकता प्राप्त हुई।

चुनौतियाँ और मूल्यांकन

TextVQA कई अनूठी चुनौतियाँ प्रस्तुत करता है। पहला, प्राकृतिक दृश्यों में OCR विभिन्न फ़ॉन्ट, प्रकाश, अवरोध और परिप्रेक्ष्य विरूपण के कारण कठिन है। दूसरा, मॉडल को यह निर्धारित करना होगा कि कौन सा पाठ प्रश्न के लिए प्रासंगिक है, क्योंकि छवियों में अक्सर कई पाठ उदाहरण होते हैं। तीसरा, तर्क के लिए पाठ को दृश्य संकेतों के साथ संयोजित करने की आवश्यकता हो सकती है, जैसे किसी संकेत का रंग या लेबल की स्थिति की पहचान करना। चौथा, कुछ प्रश्नों के लिए पाठ के आधार पर अंकगणितीय या लौकिक तर्क की आवश्यकता होती है (जैसे, "दुकान किस समय बंद होती है?" एक संकेत से)।

मूल्यांकन परीक्षण सेट पर किया जाता है, जिसमें मॉडल को सटीकता के आधार पर रैंक किया जाता है। 2024 तक, अत्याधुनिक मॉडल लगभग 80% सटीकता प्राप्त करते हैं, जो शुरुआती बेसलाइन के लिए लगभग 40% से ऊपर है। बेंचमार्क को OCR-VQA और ST-VQA जैसे संबंधित कार्यों तक भी बढ़ाया गया है, जो विभिन्न संदर्भों में दृश्य पाठ समझ पर केंद्रित हैं।

प्रभाव और अनुप्रयोग

TextVQA ने मल्टीमॉडल एआई प्रणालियों के विकास को प्रभावित किया है, विशेष रूप से दस्तावेज़ समझ और सहायक प्रौद्योगिकियों के संदर्भ में। अनुप्रयोगों में दृष्टिबाधित उपयोगकर्ताओं को संकेत या लेबल पढ़ने में मदद करना, स्वचालित फॉर्म प्रोसेसिंग, और पाठ के साथ छवियों को अनुक्रमित करने वाले खोज इंजनों को बढ़ाना शामिल है। इस कार्य ने स्थानिक पाठ ग्राउंडिंग के लिए Cross-Attention तंत्र और Positional Encoding पर शोध को भी प्रेरित किया है।

बेंचमार्क व्यापक रूप से शैक्षणिक अनुसंधान और उद्योग में उपयोग किया जाता है, जिसमें Google DeepMind, OpenAI, और अन्य प्रयोगशालाएं विज़न-भाषा मॉडल के मूल्यांकन के लिए इसे एक परीक्षण मंच के रूप में उपयोग करती हैं। इसे Artificial intelligence तर्क सुइट जैसे व्यापक बेंचमार्क में भी एकीकृत किया गया है, जो पाठ्य संकेतों के साथ मल्टीमॉडल तर्क को संभालने के तरीके की समझ में योगदान देता है।

संबंधित कार्य और डेटासेट

TextVQA दृश्य-पाठ समझ कार्यों के एक परिवार का हिस्सा है। संबंधित डेटासेट में ST-VQA (सीन टेक्स्ट विज़ुअल क्वेश्चन आंसरिंग) शामिल है, जो एक अलग छवि वितरण के साथ पाठ-आधारित तर्क पर केंद्रित है, और OCR-VQA, जो पुस्तक कवर की छवियों का उपयोग करता है और शीर्षकों और लेखकों के बारे में प्रश्न पूछता है। ये बेंचमार्क सामूहिक रूप से उच्च-स्तरीय तर्क के साथ OCR के संयोजन में Machine learning की सीमाओं को आगे बढ़ाते हैं।

भविष्य की दिशाएँ

TextVQA पर भविष्य के काम में बहुभाषी पाठ का अधिक मजबूत संचालन, लंबे उत्तर उत्पन्न करने वाले Generative AI मॉडल के साथ बेहतर एकीकरण, और अज्ञात डोमेन के लिए बेहतर सामान्यीकरण शामिल हो सकता है। शोधकर्ता यह भी खोज रहे हैं कि मॉडल को उनके तर्क चरणों की व्याख्या करके अधिक व्याख्यात्मक कैसे बनाया जाए, और पाठ के साथ अलेबल छवियों पर स्व-पर्यवेक्षित शिक्षण के माध्यम से बड़े एनोटेटेड डेटासेट पर निर्भरता कैसे कम की जाए।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:computer-vision·natural-language-processing·multimodal-learning·benchmark
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास