KVQA (नॉलेज-अवेयर विज़ुअल प्रश्न उत्तर) Artificial intelligence और Machine learning की एक उप-शाखा है जो कंप्यूटर विज़न, प्राकृतिक भाषा प्रसंस्करण और ज्ञान प्रतिनिधित्व को जोड़ती है। पारंपरिक विज़ुअल प्रश्न उत्तर (VQA) के विपरीत, जो केवल छवि की दृश्य सामग्री पर निर्भर करता है, KVQA प्रणालियों को सटीक उत्तर देने के लिए बाहरी ज्ञान स्रोतों, जैसे ज्ञान ग्राफ, विश्वकोशीय डेटाबेस, या संरचित तथ्यों तक पहुंचने और उन पर तर्क करने की भी आवश्यकता होती है। इस कार्य के लिए मॉडल को न केवल छवि में वस्तुओं, दृश्यों और संबंधों को पहचानना होता है, बल्कि प्रासंगिक विश्व ज्ञान प्राप्त करना और बहु-चरणीय तर्क करना भी होता है, ताकि उन प्रश्नों का उत्तर दिया जा सके जो छवि में सीधे दिखाई न देने वाली संस्थाओं, विशेषताओं या तथ्यों का संदर्भ दे सकें।
KVQA का विकास Deep learning में प्रगति और बड़े पैमाने पर मल्टीमॉडल मॉडल के उद्भव से निकटता से जुड़ा हुआ है। 2010 के दशक के मध्य में पेश किए गए शुरुआती VQA डेटासेट, केवल छवि से उत्तर देने योग्य प्रश्नों पर केंद्रित थे। हालांकि, शोधकर्ताओं ने जल्द ही पहचान लिया कि कई प्राकृतिक प्रश्न, जैसे "इस इमारत को किसने बनाया?" या "इस शहर की जनसंख्या कितनी है?", के लिए बाहरी ज्ञान की आवश्यकता होती है। इस अहसास ने KVQA-विशिष्ट बेंचमार्क के निर्माण और तंत्रिका आर्किटेक्चर में ज्ञान आधारों के एकीकरण को जन्म दिया, जिसमें अक्सर Transformer (architecture)-आधारित मॉडल का उपयोग किया जाता है जो दृश्य विशेषताओं और पाठ्य ज्ञान प्रतिनिधित्व दोनों पर ध्यान केंद्रित कर सकते हैं।
ऐतिहासिक विकास
KVQA की अवधारणा व्यापक VQA अनुसंधान एजेंडे से उभरी, जिसने 2015 में वर्जीनिया टेक और Microsoft (AI) के शोधकर्ताओं द्वारा VQA डेटासेट जारी करने के बाद गति प्राप्त की। प्रारंभिक VQA कार्य पूरी तरह से दृश्य था, लेकिन बाद के कार्य, जैसे 2016 में पेश किया गया FVQA (फैक्ट-आधारित विज़ुअल प्रश्न उत्तर) डेटासेट, को स्पष्ट रूप से बाहरी तथ्यों की आवश्यकता थी। FVQA ने त्रिक (विषय, संबंध, वस्तु) का ज्ञान आधार प्रदान किया और मॉडल को प्रश्नों के उत्तर देने के लिए प्रासंगिक तथ्य प्राप्त करने का कार्य सौंपा। इसके बाद अन्य डेटासेट आए, जैसे KVQA (नाम, 2018 में भारतीय प्रौद्योगिकी संस्थान दिल्ली और सहयोगियों के शोधकर्ताओं द्वारा पेश किया गया), जो प्रसिद्ध लोगों और स्थानों के बारे में प्रश्नों पर केंद्रित था, जिसके लिए विकिपीडिया और फ्रीबेस जैसे स्रोतों से ज्ञान की आवश्यकता होती थी।
इन शुरुआती डेटासेट ने संरचित ज्ञान आधारों का उपयोग किया और अक्सर छवि सुविधाओं को पुनर्प्राप्त ज्ञान के साथ संयोजित करने के लिए Sequence-to-Sequence (Seq2Seq) मॉडल या ध्यान तंत्र पर निर्भर थे। 2017 में Transformer (architecture) आर्किटेक्चर की शुरुआत, विशेष रूप से Multi-Head Attention तंत्र, ने दृश्य और पाठ्य जानकारी के अधिक परिष्कृत संलयन को सक्षम किया। 2010 के दशक के अंत तक, LXMERT और VisualBERT जैसे मॉडल, जो छवि-पाठ जोड़े पर पूर्व-प्रशिक्षित थे, ने ज्ञान मॉड्यूल को शामिल करना शुरू कर दिया, हालांकि वे अभी भी खुले-डोमेन ज्ञान के साथ संघर्ष करते थे जो प्रशिक्षण डेटा में मौजूद नहीं था।
मुख्य चुनौतियाँ
KVQA मानक VQA की तुलना में कई अद्वितीय चुनौतियाँ प्रस्तुत करता है। पहला, सिस्टम को यह निर्धारित करना होता है कि बाहरी ज्ञान की आवश्यकता कब है; कई प्रश्नों का उत्तर अकेले छवि से दिया जा सकता है, और अनावश्यक ज्ञान पुनर्प्राप्ति शोर उत्पन्न कर सकती है। दूसरा, पुनर्प्राप्ति प्रक्रिया कुशल और सटीक होनी चाहिए, जिसके लिए अक्सर सिस्टम को वास्तविक समय में बड़े ज्ञान आधार से पूछताछ करनी पड़ती है। तीसरा, दृश्य और ज्ञान-आधारित साक्ष्य का एकीकरण परिष्कृत तर्क की मांग करता है, क्योंकि उत्तर कई तथ्यों को संयोजित करने या जो देखा जाता है और जो ज्ञात है, के बीच विरोधाभासों को हल करने पर निर्भर हो सकता है।
एक और महत्वपूर्ण चुनौती Data Augmentation और एनोटेशन लागत है। KVQA डेटासेट बनाने के लिए छवियों को ऐसे प्रश्नों के साथ जोड़ना पड़ता है जिनके उत्तर छवि में नहीं होते, जिसके लिए मैन्युअल एनोटेशन और ज्ञान आधार क्यूरेशन की आवश्यकता होती है। इसके कारण अर्ध-स्वचालित पाइपलाइनों का उपयोग हुआ है जो ज्ञान ग्राफ से प्रश्न उत्पन्न करते हैं, लेकिन ये अक्सर सरल या अप्राकृतिक प्रश्न उत्पन्न करते हैं। परिणामस्वरूप, कई KVQA मॉडल का मूल्यांकन सीमित डोमेन, जैसे प्रसिद्ध स्थलों या मशहूर हस्तियों पर किया जाता है, और खुले-डोमेन प्रश्नों पर उनका प्रदर्शन सीमित रहता है।
आधुनिक दृष्टिकोण
Large language model और GPT-4V (OpenAI से) और Gemini (Google DeepMind से) जैसे मल्टीमॉडल मॉडल के उदय के साथ, KVQA में एक आदर्श बदलाव देखा गया है। ये मॉडल, जो अक्सर अरबों मापदंडों के साथ ट्रांसफॉर्मर आर्किटेक्चर पर निर्मित होते हैं, पाठ और छवियों के विशाल कोष पर पूर्व-प्रशिक्षित होते हैं, जो उनके मापदंडों में बड़ी मात्रा में विश्व ज्ञान को स्पष्ट रूप से एन्कोड करते हैं। परिणामस्वरूप, वे अक्सर स्पष्ट पुनर्प्राप्ति के बिना, अपने मापदंडों में एम्बेडेड ज्ञान का लाभ उठाकर ज्ञान-आधारित दृश्य प्रश्नों का उत्तर दे सकते हैं। यह दृष्टिकोण, जिसे कभी-कभी "क्लोज्ड-बुक" KVQA कहा जाता है, ने OK-VQA (आउटसाइड नॉलेज VQA) जैसे बेंचमार्क पर प्रभावशाली परिणाम दिखाए हैं, जिसे 2019 में पेश किया गया था और इसके लिए बाहरी ज्ञान की आवश्यकता होती है।
हालांकि, क्लोज्ड-बुक मॉडल की सीमाएँ हैं, जिनमें मतिभ्रम (प्रशंसनीय लेकिन गलत उत्तर उत्पन्न करना) और दुर्लभ या हाल के तथ्यों में कठिनाई शामिल है। इसे संबोधित करने के लिए, हाइब्रिड दृष्टिकोण पैरामीट्रिक ज्ञान को गैर-पैरामीट्रिक पुनर्प्राप्ति के साथ जोड़ते हैं, पुनर्प्राप्त ज्ञान स्निपेट्स को दृश्य विशेषताओं के साथ संलयन करने के लिए Cross-Attention जैसी तकनीकों का उपयोग करते हैं। उदाहरण के लिए, REVEAL और KAT (नॉलेज-ऑगमेंटेड ट्रांसफॉर्मर) जैसे मॉडल एक ज्ञान कोष से प्रासंगिक अंशों को लाने के लिए एक रिट्रीवर का उपयोग करते हैं, फिर उन्हें एक ट्रांसफॉर्मर-आधारित जनरेटर को खिलाते हैं। ये सिस्टम अक्सर उत्तर उत्पन्न करने के लिए Beam Search या Top-P (Nucleus) Sampling का उपयोग करते हैं।
Knowledge graph एम्बेडिंग का एकीकरण भी खोजा गया है, जहां मॉडल ग्राफ संरचनाओं पर तर्क करना सीखता है। उदाहरण के लिए, कुछ कार्य पुनर्प्राप्त संस्थाओं से जानकारी प्रसारित करने के लिए ग्राफ तंत्रिका नेटवर्क का उपयोग करते हैं, जिससे बहु-हॉप तर्क सक्षम होता है। ये विधियाँ विशेष रूप से उन प्रश्नों के लिए उपयोगी हैं जिनमें कई तथ्यों को संयोजित करने की आवश्यकता होती है, जैसे "इस अभिनेता को अभिनीत करने वाली फिल्म के निर्देशक कौन हैं?"
मूल्यांकन और बेंचमार्क
KVQA के लिए मानक बेंचमार्क में FVQA, KVQA और OK-VQA शामिल हैं। FVQA (2016) में 50,000 तथ्यों के ज्ञान आधार के साथ लगभग 2,000 प्रश्न हैं। KVQA (2018) में 1,800 प्रसिद्ध लोगों और स्थलों के बारे में 18,000 से अधिक प्रश्न हैं, जिनके उत्तर फ्रीबेस से प्राप्त होते हैं। OK-VQA (2019) बड़ा है, जिसमें 14,000 से अधिक प्रश्न हैं जिनके लिए बाहरी ज्ञान की आवश्यकता होती है, लेकिन यह कोई विशिष्ट ज्ञान आधार प्रदान नहीं करता है, जिससे यह अधिक चुनौतीपूर्ण हो जाता है। A-OKVQA (2022) जैसे हालिया बेंचमार्क, बहुविकल्पीय और खुले-अंत प्रश्नों के साथ विस्तार करते हैं, और छवि कैप्शन और बाहरी तथ्यों का ज्ञान आधार शामिल करते हैं।
मूल्यांकन मेट्रिक्स में आमतौर पर सटीकता (सटीक मिलान या बहुविकल्पीय शुद्धता) और, जनरेटिव मॉडल के लिए, CIDEr या BLEU जैसे मेट्रिक्स शामिल होते हैं। हालांकि, ये मेट्रिक्स अक्सर तर्क गुणवत्ता को पकड़ने में विफल रहते हैं, और इस बात पर बहस जारी है कि क्या मॉडल वास्तव में तर्क कर रहे हैं या केवल पैटर्न याद कर रहे हैं। कुछ शोधकर्ताओं ने नैदानिक डेटासेट प्रस्तावित किए हैं जो विशिष्ट तर्क क्षमताओं का परीक्षण करते हैं, जैसे रचनात्मक प्रश्न या प्रतिकूल उदाहरण जिनके लिए प्रशिक्षण वितरण में नहीं होने वाले ज्ञान की आवश्यकता होती है।
अनुप्रयोग और भविष्य की दिशाएँ
KVQA के व्यावहारिक अनुप्रयोग हैं, जैसे assistive-technology (दृष्टिबाधित उपयोगकर्ताओं को उनके वातावरण को समझने में मदद करना), शिक्षा (ऐतिहासिक छवियों या वैज्ञानिक आरेखों के बारे में प्रश्नों का उत्तर देना), और ई-कॉमर्स (छवियों के आधार पर उत्पाद जानकारी प्रदान करना)। चिकित्सा क्षेत्र में, KVQA रेडियोलॉजिस्ट को स्कैन के बारे में प्रश्नों का उत्तर देने में सहायता कर सकता है, जिसके लिए शरीर रचना या बीमारी के ज्ञान की आवश्यकता होती है, हालांकि यह एक सक्रिय शोध क्षेत्र बना हुआ है।
भविष्य की दिशाओं में ज्ञान पुनर्प्राप्ति की विश्वसनीयता में सुधार, जनरेटिव मॉडल में मतिभ्रम को कम करना, और ऐसे बेंचमार्क विकसित करना शामिल है जो वास्तविक दुनिया की जटिलता को बेहतर ढंग से दर्शाते हैं। KVQA मॉडल को अधिक व्याख्यात्मक बनाने में भी रुचि है, जिससे उपयोगकर्ता देख सकें कि उत्तर प्राप्त करने के लिए किन तथ्यों का उपयोग किया गया था। जैसे-जैसे Generative AI आगे बढ़ता है, KVQA के मल्टीमॉडल सहायकों का एक मानक घटक बनने की संभावना है, जिससे वे विश्व ज्ञान के साथ कई प्रकार के दृश्य प्रश्नों का उत्तर दे सकें।
यह भी देखें
- Visual Question Answering
- Knowledge graph
- multimodal-learning
- Retrieval-augmented generation