CLIP (कंट्रास्टिव लैंग्वेज-इमेज प्री-ट्रेनिंग) एक विज़न-लैंग्वेज मॉडल है जिसे OpenAI द्वारा जनवरी 2021 में जारी किया गया था। छवियों को लेबलों के एक निश्चित सेट में वर्गीकृत करने के लिए प्रशिक्षित किए जाने के बजाय, CLIP इंटरनेट से एकत्रित छवि-कैप्शन जोड़ों के एक बड़े डेटासेट पर प्रशिक्षण द्वारा छवियों को मुक्त-रूप पाठ विवरणों के साथ जोड़ना सीखता है, जो लगभग 400 मिलियन जोड़े बताए गए हैं।
विधि
CLIP में दो एन्कोडर होते हैं जिन्हें संयुक्त रूप से प्रशिक्षित किया जाता है: एक छवि एन्कोडर और एक पाठ एन्कोडर, दोनों अपने संबंधित इनपुट को एक साझा एम्बेडिंग स्थान में मैप करते हैं। प्रशिक्षण एक कंट्रास्टिव उद्देश्य का उपयोग करता है: छवि-पाठ जोड़ों के एक बैच को देखते हुए, मॉडल को उस स्थान में एक मिलान वाली छवि और कैप्शन के एम्बेडिंग को एक साथ खींचने के लिए प्रशिक्षित किया जाता है, जबकि गैर-मिलान वाले जोड़ों को अलग धकेल दिया जाता है। यह दृष्टिकोण, पहले के कंट्रास्टिव प्रतिनिधित्व-सीखने के विचारों पर आधारित, CLIP को वेब टेक्स्ट और ऑल्ट-टेक्स्ट में मौजूद प्राकृतिक-भाषा पर्यवेक्षण से सीधे सामान्य-उद्देश्यीय दृश्य अवधारणाओं को सीखने देता है, बजाय इमेजनेट जैसे हाथ-लेबल वाले वर्गीकरण डेटासेट की आवश्यकता के।
परिणामी मॉडल उम्मीदवार पाठ लेबलों के एम्बेडिंग के खिलाफ एक छवि के एम्बेडिंग की तुलना करके "शून्य-शॉट" छवि वर्गीकरण, शून्य-शॉट सीखने का एक रूप, कर सकता था, बिना उन श्रेणियों पर स्पष्ट रूप से प्रशिक्षित किए। यह पिछले दशक के प्रमुख कन्वोल्यूशनल नेटवर्क-आधारित छवि क्लासिफायर से एक उल्लेखनीय विचलन था, जिसे आमतौर पर कार्य-विशिष्ट फाइन-ट्यूनिंग की आवश्यकता होती थी।
छवि निर्माण में भूमिका
CLIP का सबसे महत्वपूर्ण प्रभाव वर्गीकरण से नहीं, बल्कि जनरेटिव छवि मॉडल के लिए एक मार्गदर्शन संकेत के रूप में इसके उपयोग से आया। रिलीज़ के तुरंत बाद, स्वतंत्र शोधकर्ताओं और शौकीनों ने CLIP को मौजूदा छवि-निर्माण तकनीकों के साथ जोड़ा, जिसमें प्रारंभिक GAN-आधारित तरीके और बाद में डिफ्यूजन मॉडल शामिल थे, और एक दिए गए प्रॉम्प्ट से मेल खाने वाली छवियों की ओर निर्माण को निर्देशित करने के लिए CLIP के पाठ-छवि समानता स्कोर का उपयोग किया। यह "CLIP-निर्देशित" दृष्टिकोण उद्देश्य-निर्मित प्रणालियों के आने से पहले प्रारंभिक ओपन टेक्स्ट-टू-इमेज कला समुदाय की नींव बन गया।
CLIP के पाठ एन्कोडर को बाद में सीधे प्रमुख टेक्स्ट-टू-इमेज प्रणालियों में शामिल किया गया, विशेष रूप से स्टेबल डिफ्यूजन में एक कंडीशनिंग घटक के रूप में, और इसकी अंतर्निहित वास्तुकला और प्रशिक्षण विधि ने उद्योग भर में अन्य मल्टीमॉडल मॉडल को प्रभावित किया, जिसमें डाल-ई के संस्करण और उत्तराधिकारी विज़न-लैंग्वेज सिस्टम शामिल हैं। क्योंकि CLIP के एम्बेडिंग छवियों और पाठ के बीच अर्थ संबंधी समानता को पकड़ते हैं, मॉडल का उपयोग सामग्री-आधारित छवि खोज, छवि संग्रह पर अर्थ संबंधी खोज, और एक स्वचालित मीट्रिक के रूप में यह मूल्यांकन करने के लिए भी किया गया है कि एक उत्पन्न छवि उसके प्रॉम्प्ट से कितनी अच्छी तरह मेल खाती है।
महत्व और सीमाएँ
CLIP को अक्सर शोर, वेब-स्केल डेटा पर कंट्रास्टिव प्रीट्रेनिंग को बढ़ाने के एक प्रारंभिक और प्रभावशाली उदाहरण के रूप में उद्धृत किया जाता है, बजाय क्यूरेटेड लेबल पर निर्भर रहने के, एक रणनीति जो बाद में मल्टीमॉडल एआई अनुसंधान में गूंजती है। इसका अध्ययन इंटरनेट प्रशिक्षण डेटा से विरासत में मिले एल्गोरिदमिक पूर्वाग्रह के मामले के रूप में भी किया गया है, जिसमें शोधकर्ताओं ने नस्ल, लिंग और अन्य सामाजिक श्रेणियों के साथ तिरछे जुड़ावों का दस्तावेजीकरण किया है जो अंतर्निहित वेब-स्क्रैप किए गए कैप्शन में मौजूद पूर्वाग्रहों को दर्शाते हैं। OpenAI ने CLIP के वजन को खुले तौर पर जारी किया, कंपनी के बाद के, अधिकतर बंद रिलीज़ के विपरीत, जिसने इसे ओपन-सोर्स जनरेटिव एआई पारिस्थितिकी तंत्र में व्यापक रूप से पुन: उपयोग किया जाने वाला निर्माण खंड बनने में मदद की।