VizWiz एक बड़े पैमाने का डेटासेट और बेंचमार्क है जो दृश्य प्रश्न उत्तर (VQA) के लिए है, जो नेत्रहीन और कम दृष्टि वाले व्यक्तियों द्वारा पूछे गए वास्तविक दुनिया के प्रश्नों से उत्पन्न होता है। पारंपरिक VQA डेटासेट के विपरीत, जिनमें अक्सर इंटरनेट से छवियाँ और दृष्टिहीन एनोटेटरों के प्रश्न होते हैं, VizWiz नेत्रहीन उपयोगकर्ताओं से उनके रोजमर्रा के वातावरण में छवियों और बोले गए प्रश्नों को एकत्र करके प्रामाणिक उपयोगकर्ता आवश्यकताओं को पकड़ता है। यह डेटासेट 2018 में कार्नेगी मेलन विश्वविद्यालय और माइक्रोसॉफ्ट रिसर्च के शोधकर्ताओं द्वारा पेश किया गया था, और तब से यह पहुँच-केंद्रित AI प्रणालियों के लिए एक मानक मूल्यांकन सेट बन गया है।
VizWiz का प्राथमिक लक्ष्य कृत्रिम बुद्धिमत्ता प्रणालियों को आगे बढ़ाना है जो नेत्रहीन उपयोगकर्ताओं को दृश्य सामग्री समझने में सहायता कर सकें। बेंचमार्क में न केवल प्रश्न-उत्तर कार्य शामिल है, बल्कि यह भविष्यवाणी करने के लिए एक सहायक कार्य भी शामिल है कि क्या कोई प्रश्न छवि से उत्तर देने योग्य है, जो वास्तविक व्यावहारिकता को दर्शाता है कि कई उपयोगकर्ता-सबमिट की गई छवियाँ धुंधली, खराब फ्रेम वाली या अन्यथा अपर्याप्त होती हैं। VizWiz का उपयोग शैक्षणिक और औद्योगिक दोनों सेटिंग्स में मॉडलों को प्रशिक्षित और मूल्यांकन करने के लिए किया गया है, और इसने बहुविध शिक्षण में प्रगति को बढ़ावा दिया है, विशेष रूप से दृष्टि और भाषा मॉडलों के एकीकरण में।
डेटासेट संरचना और संग्रह
VizWiz डेटासेट एक मोबाइल एप्लिकेशन के माध्यम से एकत्र किया गया था जो नेत्रहीन उपयोगकर्ताओं को एक फोटो लेने और उसके बारे में एक बोला गया प्रश्न रिकॉर्ड करने की अनुमति देता था। प्रत्येक नमूने में एक छवि, पाठ में लिखा गया एक बोला गया प्रश्न और कई मानव-एनोटेटेड उत्तर शामिल होते हैं। 2018 में प्रारंभिक रिलीज़ में 8,000 से अधिक नेत्रहीन उपयोगकर्ताओं के 31,000 से अधिक दृश्य प्रश्न शामिल थे, जिनमें प्रत्येक प्रश्न को दृष्टिहीन एनोटेटरों से 10 उत्तर मिले। निष्पक्ष बेंचमार्किंग सुनिश्चित करने के लिए एक अलग सत्यापन सेट और परीक्षण सेट बनाया गया था, जिसमें परीक्षण सेट को सार्वजनिक मूल्यांकन के लिए अलग रखा गया था।
VizWiz की एक विशिष्ट विशेषता उत्तर देने योग्य प्रश्नों का समावेश है। डेटासेट में लगभग 30% प्रश्न खराब छवि गुणवत्ता या लापता संदर्भ के कारण मानव एनोटेटरों द्वारा उत्तर देने योग्य नहीं माने जाते हैं। यह पहलू VizWiz को विशिष्ट VQA डेटासेट की तुलना में अधिक चुनौतीपूर्ण बनाता है और मॉडलों की अपनी सीमाओं को पहचानने की आवश्यकता पर प्रकाश डालता है, जो वास्तविक दुनिया के सहायक अनुप्रयोगों के लिए एक महत्वपूर्ण क्षमता है।
बेंचमार्क कार्य और मूल्यांकन
VizWiz में प्राथमिक कार्य दृश्य प्रश्न उत्तर है, जहाँ एक मॉडल को एक छवि और एक प्रश्न दिए जाने पर सही उत्तर उत्पन्न करना होता है। मूल्यांकन मानक VQA सटीकता मीट्रिक का उपयोग करता है, जो एक उत्तर को सही मानता है यदि यह दस मानव-प्रदत्त उत्तरों में से कम से कम तीन से मेल खाता है। इसके अतिरिक्त, VizWiz ने उत्तर देने की क्षमता के लिए एक द्विआधारी वर्गीकरण कार्य पेश किया, जहाँ मॉडलों को भविष्यवाणी करनी होती है कि क्या कोई प्रश्न छवि से उत्तर दिया जा सकता है। यह दोहरा कार्य सेटअप उन प्रणालियों के विकास को प्रोत्साहित करता है जो सटीक उत्तर प्रदान कर सकते हैं और आवश्यक होने पर परहेज कर सकते हैं।
अपनी रिलीज़ के बाद से, VizWiz मशीन लर्निंग समुदाय में एक प्रमुख बेंचमार्क रहा है, जिसमें कई शोध पत्र इस पर परिणाम रिपोर्ट करते हैं। तंत्रिका नेटवर्क वास्तुकला और गहन शिक्षण तकनीकों पर आधारित प्रारंभिक मॉडलों ने मामूली सटीकता हासिल की, लेकिन ट्रांसफार्मर-आधारित मॉडलों और बड़े भाषा मॉडलों के आगमन ने महत्वपूर्ण सुधार किए हैं। 2025 तक, बहुविध ट्रांसफार्मर का उपयोग करने वाली अत्याधुनिक प्रणालियाँ उत्तर देने योग्य प्रश्नों के 70% से अधिक सही उत्तर दे सकती हैं, हालाँकि उत्तर देने योग्य प्रश्नों पर प्रदर्शन एक चुनौती बनी हुई है।
पहुँच और सहायक प्रौद्योगिकी पर प्रभाव
VizWiz का नेत्रहीन उपयोगकर्ताओं के लिए सहायक प्रौद्योगिकियों के विकास पर सीधा प्रभाव पड़ा है। डेटासेट का उपयोग उन मॉडलों को प्रशिक्षित करने के लिए किया गया है जो मोबाइल एप्लिकेशन को शक्ति प्रदान करते हैं जो वास्तविक समय में पाठ पढ़ने, वस्तुओं की पहचान करने और दृश्यों का वर्णन करने में सक्षम हैं। गूगल डीपमाइंड और ओपनएआई जैसी कंपनियों ने बहुविध AI पर अपने शोध में VizWiz का उल्लेख किया है, और बेंचमार्क को अक्सर वाणिज्यिक दृष्टि-भाषा प्रणालियों के मूल्यांकन में शामिल किया जाता है।
डेटासेट ने संबंधित संसाधनों के निर्माण को भी प्रेरित किया, जैसे VizWiz-VQA-Grounding, जो ऑब्जेक्ट स्थानीयकरण कार्यों का समर्थन करने के लिए स्थानिक ग्राउंडिंग एनोटेशन जोड़ता है। यह विस्तार मॉडलों को न केवल प्रश्नों का उत्तर देने में सक्षम बनाता है, बल्कि छवि में प्रासंगिक क्षेत्रों को इंगित करने में भी सक्षम बनाता है, जिससे स्क्रीन रीडर या हैप्टिक फीडबैक पर निर्भर नेत्रहीन उपयोगकर्ताओं के लिए उपयोगिता और बढ़ जाती है।
चुनौतियाँ और सीमाएँ
अपनी उपयोगिता के बावजूद, VizWiz की सीमाएँ हैं। डेटासेट अंग्रेजी बोलने वाले उपयोगकर्ताओं की ओर पक्षपाती है और मुख्य रूप से प्रारंभिक संग्रह अवधि की जनसांख्यिकी को दर्शाता है। छवियाँ अक्सर कम-रिज़ॉल्यूशन और शोर वाली होती हैं, जो मॉडल प्रदर्शन में बाधा डाल सकती हैं लेकिन वास्तविक दुनिया की स्थितियों को भी दर्शाती हैं। इसके अतिरिक्त, उत्तर देने की क्षमता का कार्य व्यक्तिपरक है, क्योंकि विभिन्न एनोटेटर इस बात पर असहमत हो सकते हैं कि कोई प्रश्न उत्तर देने योग्य है या नहीं, जिससे लेबल शोर होता है।
शोधकर्ताओं ने यह भी नोट किया है कि VizWiz दृश्य हानियों की विविधता या सहायक आवश्यकताओं की सीमा को पूरी तरह से कैप्चर नहीं करता है। भविष्य के काम का उद्देश्य डेटासेट को अधिक भाषाओं, विविध छवि स्थितियों और समृद्ध एनोटेशन के साथ विस्तारित करना है। फिर भी, VizWiz पहुँच संदर्भों में AI प्रणालियों के मूल्यांकन के लिए एक मौलिक संसाधन बना हुआ है, और वास्तविक उपयोगकर्ता प्रश्नों पर इसका जोर मानव-केंद्रित AI के डिजाइन को प्रभावित करना जारी रखता है।
भविष्य की दिशाएँ
जैसे-जैसे जनरेटिव एआई और बहुविध मॉडल विकसित होते हैं, VizWiz एक महत्वपूर्ण परीक्षण मंच बने रहने की संभावना है। बड़े भाषा मॉडलों का दृष्टि एन्कोडरों के साथ एकीकरण पहले ही उत्तर गुणवत्ता में सुधार कर चुका है, और चल रहे शोध शोर इनपुट के प्रति इन प्रणालियों को अधिक मजबूत बनाने और उत्तर देने योग्य प्रश्नों को बेहतर ढंग से संभालने पर केंद्रित है। बेंचमार्क उन मॉडलों के विकास को भी प्रोत्साहित करता है जो अपने तर्क को समझा सकते हैं, जो उन उपयोगकर्ताओं के साथ विश्वास बनाने के लिए महत्वपूर्ण है जो दैनिक कार्यों के लिए AI पर निर्भर हैं।
शिक्षा और उद्योग के बीच सहयोग, जैसे कि कार्नेगी मेलन विश्वविद्यालय और माइक्रोसॉफ्ट रिसर्च से जुड़े, पहुँच AI में सुधार को आगे बढ़ाना जारी रखते हैं। VizWiz एक अनुस्मारक के रूप में कार्य करता है कि AI बेंचमार्क को वास्तविक मानव आवश्यकताओं को प्रतिबिंबित करना चाहिए, न कि केवल तकनीकी नवीनता, और इसने अन्य डोमेनों में समान प्रयासों को प्रेरित किया है, जैसे ऑडियो कैप्शनिंग और स्पर्श संवेदन। 2025 तक, VizWiz सहायक उद्देश्यों के लिए दृश्य प्रश्न उत्तर में प्रगति को मापने के लिए एक मानक संदर्भ बिंदु बना हुआ है।