अंग्रेज़ी से अनुवादित

कंट्रास्टिव लैंग्वेज-इमेज प्री-ट्रेनिंग, जनवरी 2021 में OpenAI द्वारा जारी एक तंत्रिका नेटवर्क है जो छवियों और पाठ के संयुक्त प्रतिनिधित्व सीखता है, और जो कई बाद की टेक्स्ट-टू-इमेज जनरेशन प्रणालियों का एक मूलभूत घटक बन गया।

CLIP (कंट्रास्टिव लैंग्वेज-इमेज प्री-ट्रेनिंग) एक विज़न-लैंग्वेज मॉडल है जिसे OpenAI द्वारा जनवरी 2021 में जारी किया गया था। छवियों को लेबलों के एक निश्चित सेट में वर्गीकृत करने के लिए प्रशिक्षित किए जाने के बजाय, CLIP इंटरनेट से एकत्रित छवि-कैप्शन जोड़ों के एक बड़े डेटासेट पर प्रशिक्षण द्वारा छवियों को मुक्त-रूप पाठ विवरणों के साथ जोड़ना सीखता है, जो लगभग 400 मिलियन जोड़े बताए गए हैं।

विधि

CLIP में दो एन्कोडर होते हैं जिन्हें संयुक्त रूप से प्रशिक्षित किया जाता है: एक छवि एन्कोडर और एक पाठ एन्कोडर, दोनों अपने संबंधित इनपुट को एक साझा एम्बेडिंग स्थान में मैप करते हैं। प्रशिक्षण एक कंट्रास्टिव उद्देश्य का उपयोग करता है: छवि-पाठ जोड़ों के एक बैच को देखते हुए, मॉडल को उस स्थान में एक मिलान वाली छवि और कैप्शन के एम्बेडिंग को एक साथ खींचने के लिए प्रशिक्षित किया जाता है, जबकि गैर-मिलान वाले जोड़ों को अलग धकेल दिया जाता है। यह दृष्टिकोण, पहले के कंट्रास्टिव प्रतिनिधित्व-सीखने के विचारों पर आधारित, CLIP को वेब टेक्स्ट और ऑल्ट-टेक्स्ट में मौजूद प्राकृतिक-भाषा पर्यवेक्षण से सीधे सामान्य-उद्देश्यीय दृश्य अवधारणाओं को सीखने देता है, बजाय इमेजनेट जैसे हाथ-लेबल वाले वर्गीकरण डेटासेट की आवश्यकता के।

परिणामी मॉडल उम्मीदवार पाठ लेबलों के एम्बेडिंग के खिलाफ एक छवि के एम्बेडिंग की तुलना करके "शून्य-शॉट" छवि वर्गीकरण, शून्य-शॉट सीखने का एक रूप, कर सकता था, बिना उन श्रेणियों पर स्पष्ट रूप से प्रशिक्षित किए। यह पिछले दशक के प्रमुख कन्वोल्यूशनल नेटवर्क-आधारित छवि क्लासिफायर से एक उल्लेखनीय विचलन था, जिसे आमतौर पर कार्य-विशिष्ट फाइन-ट्यूनिंग की आवश्यकता होती थी।

छवि निर्माण में भूमिका

CLIP का सबसे महत्वपूर्ण प्रभाव वर्गीकरण से नहीं, बल्कि जनरेटिव छवि मॉडल के लिए एक मार्गदर्शन संकेत के रूप में इसके उपयोग से आया। रिलीज़ के तुरंत बाद, स्वतंत्र शोधकर्ताओं और शौकीनों ने CLIP को मौजूदा छवि-निर्माण तकनीकों के साथ जोड़ा, जिसमें प्रारंभिक GAN-आधारित तरीके और बाद में डिफ्यूजन मॉडल शामिल थे, और एक दिए गए प्रॉम्प्ट से मेल खाने वाली छवियों की ओर निर्माण को निर्देशित करने के लिए CLIP के पाठ-छवि समानता स्कोर का उपयोग किया। यह "CLIP-निर्देशित" दृष्टिकोण उद्देश्य-निर्मित प्रणालियों के आने से पहले प्रारंभिक ओपन टेक्स्ट-टू-इमेज कला समुदाय की नींव बन गया।

CLIP के पाठ एन्कोडर को बाद में सीधे प्रमुख टेक्स्ट-टू-इमेज प्रणालियों में शामिल किया गया, विशेष रूप से स्टेबल डिफ्यूजन में एक कंडीशनिंग घटक के रूप में, और इसकी अंतर्निहित वास्तुकला और प्रशिक्षण विधि ने उद्योग भर में अन्य मल्टीमॉडल मॉडल को प्रभावित किया, जिसमें डाल-ई के संस्करण और उत्तराधिकारी विज़न-लैंग्वेज सिस्टम शामिल हैं। क्योंकि CLIP के एम्बेडिंग छवियों और पाठ के बीच अर्थ संबंधी समानता को पकड़ते हैं, मॉडल का उपयोग सामग्री-आधारित छवि खोज, छवि संग्रह पर अर्थ संबंधी खोज, और एक स्वचालित मीट्रिक के रूप में यह मूल्यांकन करने के लिए भी किया गया है कि एक उत्पन्न छवि उसके प्रॉम्प्ट से कितनी अच्छी तरह मेल खाती है।

महत्व और सीमाएँ

CLIP को अक्सर शोर, वेब-स्केल डेटा पर कंट्रास्टिव प्रीट्रेनिंग को बढ़ाने के एक प्रारंभिक और प्रभावशाली उदाहरण के रूप में उद्धृत किया जाता है, बजाय क्यूरेटेड लेबल पर निर्भर रहने के, एक रणनीति जो बाद में मल्टीमॉडल एआई अनुसंधान में गूंजती है। इसका अध्ययन इंटरनेट प्रशिक्षण डेटा से विरासत में मिले एल्गोरिदमिक पूर्वाग्रह के मामले के रूप में भी किया गया है, जिसमें शोधकर्ताओं ने नस्ल, लिंग और अन्य सामाजिक श्रेणियों के साथ तिरछे जुड़ावों का दस्तावेजीकरण किया है जो अंतर्निहित वेब-स्क्रैप किए गए कैप्शन में मौजूद पूर्वाग्रहों को दर्शाते हैं। OpenAI ने CLIP के वजन को खुले तौर पर जारी किया, कंपनी के बाद के, अधिकतर बंद रिलीज़ के विपरीत, जिसने इसे ओपन-सोर्स जनरेटिव एआई पारिस्थितिकी तंत्र में व्यापक रूप से पुन: उपयोग किया जाने वाला निर्माण खंड बनने में मदद की।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:computer-vision·multimodal-ai·openai-models
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास