VQA 3.0 एक दृश्य प्रश्न उत्तर (VQA) प्रणाली का तीसरा प्रमुख संस्करण है, जो Artificial intelligence मॉडलों का एक वर्ग है जो इनपुट के रूप में एक छवि और एक प्राकृतिक भाषा प्रश्न स्वीकार करता है और एक पाठ्य उत्तर उत्पन्न करता है। 2023 में जारी, VQA 3.0 अपने पूर्ववर्तियों पर Large language model को एक विज़न एन्कोडर के साथ एकीकृत करके निर्माण करता है, जिससे यह खुले-अंत प्रश्नों को संभालने में सक्षम होता है जिनके लिए तर्क, सामान्य ज्ञान और विस्तृत दृश्य समझ की आवश्यकता होती है, न कि संभावित उत्तरों के एक निश्चित सेट पर निर्भर रहने की। यह प्रणाली दृष्टिबाधित उपयोगकर्ताओं के लिए सहायक तकनीक से लेकर चिकित्सा और रोबोटिक्स जैसे क्षेत्रों में स्वचालित छवि विश्लेषण तक के अनुप्रयोगों में उपयोग के लिए डिज़ाइन की गई है।
VQA 3.0 का विकास Google DeepMind में एक शोध टीम द्वारा किया गया था, जिसमें University of Toronto और Stanford AI Lab के सहयोगियों का योगदान था। परियोजना की घोषणा 2023 की शुरुआत में एक तकनीकी रिपोर्ट में की गई थी, और मॉडल की वास्तुकला और प्रशिक्षण पद्धति को उसी वर्ष बाद में एक प्रमुख कंप्यूटर विज़न सम्मेलन में प्रस्तुत एक पेपर में विस्तृत किया गया। यह प्रणाली Transformer (architecture) वास्तुकला पर बनी है, जो दृश्य सुविधाओं को पाठ्य टोकन के साथ संरेखित करने के लिए Multi-Head Attention तंत्र का उपयोग करती है, और यह Sequence-to-Sequence (Seq2Seq) ढांचे को नियोजित करती है जहां इनपुट छवि को एन्कोड किया जाता है और प्रश्न को उत्तर में डिकोड किया जाता है।
वास्तुकला और प्रशिक्षण
VQA 3.0 एक दोहरे-एन्कोडर डिज़ाइन का उपयोग करता है। विज़न एन्कोडर, 21 परतों वाला एक Residual Network (ResNet) संस्करण, इनपुट छवि को फीचर वैक्टर के एक ग्रिड में संसाधित करता है। इन सुविधाओं को फिर भाषा मॉडल की एम्बेडिंग स्पेस में प्रक्षेपित किया जाता है, जो 7 बिलियन मापदंडों वाला 12-परत डिकोडर-केवल ट्रांसफॉर्मर है। मॉडल को दो चरणों में प्रशिक्षित किया जाता है: पहला, वेब से छवि-पाठ जोड़े के एक बड़े संग्रह पर एक प्रीट्रेनिंग चरण, और दूसरा, VQA v2 और विजुअल जीनोम जैसे क्यूरेटेड VQA डेटासेट पर एक फाइन-ट्यूनिंग चरण। फाइन-ट्यूनिंग के दौरान, मॉडल को cross-entropy loss के साथ cosine learning rate schedule और Adam optimizer का उपयोग करके अनुकूलित किया जाता है। प्रशिक्षण में लगभग दो सप्ताह के लिए 256 TPU v4 चिप्स का उपयोग किया गया, जिसमें 100 मिलियन से अधिक छवि-प्रश्न-उत्तर त्रिक संसाधित किए गए।
क्षमताएं और बेंचमार्क
VQA 3.0 कई मानक बेंचमार्कों पर अत्याधुनिक परिणाम प्राप्त करता है। VQA v2 टेस्ट-डेव विभाजन पर, यह 78.4% की सटीकता तक पहुंचता है, जो पिछले सर्वश्रेष्ठ मॉडल से 3.2 प्रतिशत अंक अधिक है। GQA डेटासेट पर, जो रचनात्मक तर्क का परीक्षण करता है, यह 63.1% स्कोर करता है, और विज़विज़ बेंचमार्क पर, जो अंधे उपयोगकर्ताओं के प्रश्नों के लिए डिज़ाइन किया गया है, यह 71.8% प्राप्त करता है। मॉडल वस्तुओं की गिनती, स्थानिक तर्क और बाहरी ज्ञान की आवश्यकता वाले प्रश्नों का उत्तर देने में विशेष रूप से मजबूत है, जैसे "यह किस प्रकार का जानवर है?" जब छवि एक दुर्लभ प्रजाति दिखाती है। एक मानव मूल्यांकन अध्ययन में, VQA 3.0 द्वारा उत्पन्न 87% उत्तरों को एनोटेटर्स द्वारा सटीक और धाराप्रवाह के रूप में रेट किया गया, जबकि पिछले संस्करण के लिए यह 79% था।
सीमाएं और नैतिक विचार
अपने प्रदर्शन के बावजूद, VQA 3.0 में ज्ञात सीमाएं हैं। यह प्रतिकूल प्रक्षेपणों के प्रति कमजोर हो सकता है, जैसे प्रकाश या वस्तु अभिविन्यास में छोटे परिवर्तन, और यह कभी-कभी प्रश्न अस्पष्ट होने पर प्रशंसनीय लेकिन गलत उत्तर उत्पन्न करता है। मॉडल अपने प्रशिक्षण डेटा से पूर्वाग्रह भी प्राप्त करता है, जो कम प्रतिनिधित्व वाले जनसांख्यिकीय समूहों के लोगों की छवियों पर कम सटीकता दिखाता है। डेवलपर्स ने एक मॉडल कार्ड प्रकाशित किया है जो इन मुद्दों का दस्तावेजीकरण करता है और अनुशंसा करता है कि उच्च-दांव अनुप्रयोगों के लिए तैनाती में मानव निरीक्षण शामिल हो। प्रतिक्रिया में, टीम ने एक पूर्वाग्रह मूल्यांकन टूलकिट जारी किया है और विभिन्न जनसंख्या खंडों में मॉडल के प्रदर्शन के नियमित ऑडिट के लिए प्रतिबद्ध है।
तैनाती और प्रभाव
VQA 3.0 Google Cloud वर्टेक्स एआई प्लेटफॉर्म पर एक प्रबंधित API के रूप में उपलब्ध है, जो डेवलपर्स को एक सरल REST कॉल के साथ अपने अनुप्रयोगों में दृश्य प्रश्न उत्तर को एकीकृत करने की अनुमति देता है। इसे कई संगठनों द्वारा अपनाया गया है, जिनमें Samsung Electronics उनके स्मार्टफोन में एक्सेसिबिलिटी सुविधाओं के लिए और Intuitive Surgical सर्जनों को इंट्राऑपरेटिव छवियों की व्याख्या में सहायता के लिए शामिल हैं। मॉडल का उपयोग शोध सेटिंग्स में भी किया गया है, जैसे Bhabha Atomic Research Centre उपग्रह इमेजरी के विश्लेषण के लिए। VQA 3.0 की रिलीज़ ने मल्टीमॉडल मॉडलों में आगे के शोध को प्रेरित किया है, और इसकी वास्तुकला ने VQA 4.0 जैसी बाद की प्रणालियों को प्रभावित किया है, जो एक बड़े विज़न एन्कोडर और एक मिश्रण-विशेषज्ञ भाषा मॉडल को शामिल करता है।
भविष्य की दिशाएं
VQA 3.0 टीम ने भविष्य के काम के लिए कई क्षेत्रों की रूपरेखा तैयार की है। एक दिशा वीडियो को संभालने की मॉडल की क्षमता में सुधार करना है, जो वर्तमान एकल-छवि ढांचे को अस्थायी अनुक्रमों तक विस्तारित करता है। एक और व्याख्या क्षमता को बढ़ाना है, जिसमें ध्यान मानचित्रों का उपयोग करके यह दिखाया जाता है कि उत्तर उत्पन्न करते समय मॉडल छवि के किन हिस्सों पर ध्यान केंद्रित करता है। टीम Model Pruning और Data Augmentation जैसी अधिक कुशल प्रशिक्षण तकनीकों का उपयोग करके मॉडल के कार्बन पदचिह्न को कम करने के तरीकों की भी खोज कर रही है। 2024 तक, एक उत्तराधिकारी मॉडल, VQA 3.5, विकास में है, जो कुछ-शॉट सीखने और अमूर्त अवधारणाओं के बेहतर संचालन पर केंद्रित है।