कॉन्सेप्चुअल कैप्शन्स एक बड़े पैमाने का डेटासेट है जिसमें 3 मिलियन से अधिक इमेज-कैप्शन जोड़े शामिल हैं, जिसे विज़न-लैंग्वेज मॉडल के प्रशिक्षण और मूल्यांकन का समर्थन करने के लिए पेश किया गया था। यह डेटासेट Google के शोधकर्ताओं द्वारा बनाया गया था, जिसका प्राथमिक ध्यान विविध, वास्तविक-विश्व छवि विवरण प्रदान करने पर था, जो पहले के डेटासेट की सीमित शब्दावली और शैली से परे जाते हैं। यह छवि कैप्शनिंग, दृश्य प्रश्न उत्तर, और मल्टीमॉडल प्रतिनिधित्व सीखने जैसे कार्यों के लिए एक आधारभूत संसाधन के रूप में कार्य करता है।
कॉन्सेप्चुअल कैप्शन्स में कैप्शन वेब छवियों की alt-text विशेषताओं से प्राप्त होते हैं, जो वेब लेखकों द्वारा लिखे गए स्वाभाविक रूप से होने वाले विवरण हैं। यह सोर्सिंग रणनीति मानव-एनोटेटेड डेटासेट की तुलना में भाषाई अभिव्यक्तियों का एक व्यापक और अधिक विविध सेट उत्पन्न करती है, जो अक्सर एनोटेटरों के एक छोटे समूह और एक सीमित शब्दावली पर निर्भर करते हैं। डेटासेट को गहरे तंत्रिका नेटवर्क को प्रभावी ढंग से प्रशिक्षित करने के लिए पर्याप्त बड़ा बनाया गया था, जबकि शोर और विविधता का एक उचित स्तर बनाए रखा गया था, जो वास्तविक-विश्व वेब सामग्री की चुनौतियों को दर्शाता है।
निर्माण और फ़िल्टरिंग
कॉन्सेप्चुअल कैप्शन्स के निर्माण में गुणवत्ता और प्रासंगिकता सुनिश्चित करने के लिए एक बहु-चरणीय पाइपलाइन शामिल थी। प्रारंभ में, वेब पृष्ठों का एक बड़ा कॉर्पस क्रॉल किया गया था, और संबंधित alt-text वाली छवियों को निकाला गया था। Alt-text ने कच्चे कैप्शन के रूप में कार्य किया, लेकिन ऐसा सभी पाठ उपयुक्त नहीं था। बहुत छोटे, बहुत लंबे, या हैशटैग, URL, या प्रचार भाषा जैसी गैर-वर्णनात्मक सामग्री वाले कैप्शन को हटाने के लिए फ़िल्टरिंग चरणों की एक श्रृंखला लागू की गई थी। इसके अतिरिक्त, पाइपलाइन ने उन छवियों को फ़िल्टर करने के लिए एक पूर्व-प्रशिक्षित छवि क्लासिफायर का उपयोग किया जो तस्वीरें नहीं थीं या जिनमें अनुचित सामग्री थी। अंतिम डेटासेट में लगभग 3.3 मिलियन प्रशिक्षण जोड़े और लगभग 158,000 जोड़े का एक अलग रखा गया सत्यापन सेट शामिल है, जिसमें बेंचमार्किंग के लिए एक अलग परीक्षण सेट भी है।
अन्य डेटासेट के साथ तुलना
कॉन्सेप्चुअल कैप्शन्स पहले के डेटासेट जैसे COCO (कॉमन ऑब्जेक्ट्स इन कॉन्टेक्स्ट) से काफी भिन्न है, जिसमें मानव-लिखित कैप्शन के साथ लगभग 330,000 छवियां हैं। जबकि COCO उच्च-गुणवत्ता, मैन्युअल रूप से सत्यापित एनोटेशन प्रदान करता है, इसकी शब्दावली और वाक्य संरचनाएं अपेक्षाकृत सीमित हैं। इसके विपरीत, कॉन्सेप्चुअल कैप्शन्स परिमाण के क्रम में अधिक डेटा प्रदान करता है, जिसमें एक अधिक समृद्ध और अधिक विविध भाषाई वितरण होता है। यह विविधता उन मॉडलों को प्रशिक्षित करने के लिए फायदेमंद है जिन्हें वास्तविक-विश्व अनुप्रयोगों में अनदेखी छवि विवरणों को सामान्यीकृत करने की आवश्यकता होती है। हालांकि, व्यापार-बंद यह है कि कैप्शन अधिक शोर वाले होते हैं और उनमें कभी-कभी अशुद्धियाँ या अप्रासंगिक पाठ हो सकते हैं, जो वेब alt-text की असंसाधित प्रकृति को दर्शाता है।
विज़न-लैंग्वेज मॉडल में अनुप्रयोग
कॉन्सेप्चुअल कैप्शन्स विज़न और भाषा को जोड़ने वाले एआई मॉडल के प्रशिक्षण और मूल्यांकन के लिए एक मानक बेंचमार्क बन गया है। इसका उपयोग अक्सर Transformer (architecture)-आधारित आर्किटेक्चर के विकास में किया जाता है, जैसे कि Encoder-Decoder Architecture मॉडल जो छवियों से कैप्शन उत्पन्न करते हैं। डेटासेट का उपयोग Machine learning अनुसंधान में छवि-पाठ पुनर्प्राप्ति और शून्य-शॉट वर्गीकरण जैसे कार्यों के लिए भी किया गया है। कई अत्याधुनिक मॉडल, जिनमें OpenAI और Google DeepMind के मॉडल शामिल हैं, ने अपने मूल्यांकन सूट के हिस्से के रूप में कॉन्सेप्चुअल कैप्शन्स पर परिणाम रिपोर्ट किए हैं। डेटासेट का पैमाना और विविधता इसे Deep learning दृष्टिकोणों के लिए विशेष रूप से उपयुक्त बनाती है जिन्हें मजबूत प्रतिनिधित्व सीखने के लिए बड़ी मात्रा में डेटा की आवश्यकता होती है।
सीमाएँ और विचार
अपने फायदों के बावजूद, कॉन्सेप्चुअल कैप्शन्स में ज्ञात सीमाएँ हैं। Alt-text स्रोत पूर्वाग्रहों को पेश कर सकता है, क्योंकि वेब लेखक छवियों का वर्णन उन तरीकों से कर सकते हैं जो सांस्कृतिक या जनसांख्यिकीय झुकाव को दर्शाते हैं। इसके अतिरिक्त, फ़िल्टरिंग प्रक्रिया, हालांकि स्वचालित है, अनजाने में कुछ प्रकार की छवियों या कैप्शन को बाहर कर सकती है, जिससे दृश्य अवधारणाओं का अधूरा प्रतिनिधित्व हो सकता है। शोधकर्ताओं ने नोट किया है कि कॉन्सेप्चुअल कैप्शन्स पर प्रशिक्षित मॉडल अधिक नियंत्रित डेटासेट पर अलग तरह से प्रदर्शन कर सकते हैं, और संतुलित प्रदर्शन प्राप्त करने के लिए इसे अक्सर अन्य डेटासेट के साथ संयोजन में उपयोग किया जाता है। डेटासेट स्थिर भी है, जिसका अर्थ है कि यह समय के साथ वेब सामग्री में परिवर्तन को प्रतिबिंबित नहीं करता है, जो चल रहे अनुसंधान के लिए एक सीमा हो सकती है।
प्रभाव और विरासत
कॉन्सेप्चुअल कैप्शन्स की शुरूआत ने विज़न-लैंग्वेज समझ के क्षेत्र पर महत्वपूर्ण प्रभाव डाला है। इसने एक बड़े पैमाने का, स्वतंत्र रूप से उपलब्ध संसाधन प्रदान किया जिसने छवि कैप्शनिंग और मल्टीमॉडल सीखने में प्रगति को तेज किया। वेब alt-text का लाभ उठाने के इसके दृष्टिकोण ने बाद के डेटासेट, जैसे LAION-400M और अन्य को प्रेरित किया है, जो और भी बड़े कॉर्पस बनाने के लिए समान स्क्रैपिंग और फ़िल्टरिंग तकनीकों का उपयोग करते हैं। डेटासेट शैक्षणिक साहित्य में एक व्यापक रूप से उद्धृत संदर्भ बना हुआ है और नए मॉडल के लिए आधार रेखा के रूप में उपयोग किया जाता रहा है। इसके निर्माण ने पैमाने पर स्वाभाविक रूप से होने वाले डेटा का उपयोग करने के मूल्य को उजागर किया, एक सिद्धांत जो आधुनिक Generative AI अनुसंधान का केंद्रीय हिस्सा बन गया है।
यह भी देखें
संदर्भ
- Sharma, P., Ding, N., Goodman, S., & Soricut, R. (2018). Conceptual Captions: A Cleaned, Hypernymed, Image Alt-text Dataset For Automatic Image Captioning. Proceedings of ACL.
- Chen, X., et al. (2015). Microsoft COCO Captions: Data Collection and Evaluation Server.
बाहरी लिंक
- कॉन्सेप्चुअल कैप्शन्स प्रोजेक्ट पेज (Google Research)
- डेटासेट टूल्स के लिए GitHub रिपॉजिटरी