अंग्रेज़ी से अनुवादित

2021 में जारी CLIP पेपर ने 400 मिलियन इमेज-टेक्स्ट जोड़ों पर प्रशिक्षित एक तंत्रिका नेटवर्क पेश किया, जो प्राकृतिक भाषा पर्यवेक्षण के माध्यम से स्थानांतरणीय दृश्य प्रतिनिधित्व सीखता है, जिससे शून्य-शॉट इमेज वर्गीकरण संभव होता है।

CLIP पेपर, जिसका औपचारिक शीर्षक "Learning Transferable Visual Models From Natural Language Supervision" है, OpenAI द्वारा 2021 का एक शोध प्रकाशन था जिसने कंट्रास्टिव लैंग्वेज-इमेज प्री-ट्रेनिंग (CLIP) प्रस्तुत किया। इस कार्य ने एक दृश्य मॉडल को प्रशिक्षित करने की एक विधि पेश की, जिसमें निश्चित लेबल सेट पर निर्भर रहने के बजाय प्राकृतिक भाषा को पर्यवेक्षण संकेत के रूप में उपयोग किया गया। CLIP छवियों और पाठ को एक साझा एम्बेडिंग स्थान में संरेखित करना सीखता है, जो छवि-कैप्शन जोड़ों के बड़े पैमाने के डेटासेट को संसाधित करके किया जाता है, जिससे मॉडल न्यूनतम डाउनस्ट्रीम अनुकूलन के साथ विभिन्न प्रकार के दृश्य कार्यों को करने में सक्षम होता है।

फरवरी 2021 में प्रकाशित, यह पेपर Transformer (architecture) आर्किटेक्चर और Large language model स्केलिंग में पहले के विकास पर आधारित था, जिसमें छवियों के लिए एक विज़न-ट्रांसफॉर्मर और एक टेक्स्ट एनकोडर को मिलाकर एक संयुक्त प्रतिनिधित्व बनाया गया। मुख्य नवाचार इसका कंट्रास्टिव लर्निंग उद्देश्य था, जो मॉडल को मिलान वाले छवि-पाठ जोड़ों के बीच समानता को अधिकतम करने और गैर-मिलान वाले जोड़ों के लिए इसे न्यूनतम करने के लिए प्रशिक्षित करता था। इस दृष्टिकोण ने CLIP को वेब-संग्रहित डेटा के विविध संग्रह से व्यापक, स्थानांतरणीय विशेषताएं सीखने की अनुमति दी, जिससे Computer vision का प्रतिमान क्यूरेटेड, एनोटेटेड डेटासेट से कच्चे इंटरनेट-स्केल टेक्स्ट-इमेज जोड़ों की ओर मौलिक रूप से बदल गया।

आर्किटेक्चर और प्रशिक्षण

CLIP मॉडल में दो अलग-अलग एनकोडर शामिल थे। एक इमेज एनकोडर दृश्य इनपुट को संसाधित करता था, जो Convolutional neural network का एक प्रकार जैसे ResNet या विज़न ट्रांसफॉर्मर हो सकता था, और एक टेक्स्ट एनकोडर कैप्शन को संसाधित करने के लिए ट्रांसफॉर्मर का उपयोग करता था। दोनों एनकोडर 512-आयामी एम्बेडिंग स्थान में वेक्टर आउटपुट करते थे। प्रशिक्षण उद्देश्य में एक कंट्रास्टिव लॉस का उपयोग किया गया, जो संरेखित छवि-पाठ जोड़ों के बीच कोसाइन समानता को अधिकतम करता था और अन्य बैच नमूनों में इसे न्यूनतम करता था। यह लॉस इन-बैच गणना किया गया था, जिसमें 32,768 नमूनों का बड़ा बैच आकार उपयोग किया गया। इंटरनेट से 400 मिलियन छवि-कैप्शन जोड़ों पर प्रशिक्षित, मॉडल को सैकड़ों GPUs पर स्केल किया गया, जिसमें सबसे बड़ा संस्करण, ViT-L/14, को पूरा करने में लगभग 500 GPU-दिन लगे।

ज़ीरो-शॉट और ट्रांसफर लर्निंग

CLIP पेपर का एक केंद्रीय परिणाम ज़ीरो-शॉट ट्रांसफर का प्रदर्शन था। कार्य-विशिष्ट डेटा पर किसी भी फाइन-ट्यूनिंग के बिना, CLIP संभावित वर्ग लेबल का वर्णन करने वाले टेक्स्ट प्रॉम्प्ट के खिलाफ इमेज एम्बेडिंग को मिलान करके छवियों को वर्गीकृत कर सकता था, जैसे 'एक बिल्ली की तस्वीर'। ImageNet पर, दृश्य पहचान के लिए मानक बेंचमार्क, CLIP ने बिना प्रशिक्षण के 76.2% सटीकता हासिल की, जो पर्यवेक्षित तरीके से प्रशिक्षित ResNet50 के प्रदर्शन के बराबर थी। पेपर ने प्रॉम्प्ट इंजीनियरिंग के माध्यम से और लाभ की सूचना दी, जहां 'एक {वर्ग} की तस्वीर, एक प्रकार का पालतू जानवर' जैसे वर्णनात्मक लेबल ने बारीक-दाने वाले डेटासेट पर प्रदर्शन में 10% तक सुधार किया। यह स्थानांतरण क्षमता मॉडल के दृश्य अवधारणाओं और उनके पाठ्य विवरणों के सीखे गए प्रतिनिधित्व से उत्पन्न हुई।

प्रदर्शन और सीमाएं

CLIP पेपर ने मॉडल का मूल्यांकन OCR, क्रिया पहचान, बारीक-दाने वाले वर्गीकरण, और अमूर्त दृश्य दृश्यों को शामिल करते हुए 30 से अधिक डेटासेट पर किया। इसने कई पर राज्य-कला परिणाम प्राप्त किए, उदाहरण के लिए ImageNet और अन्य ट्रांसफर बेंचमार्क पर महत्वपूर्ण सुधार। हालांकि, लेखकों ने कई सीमाओं को स्वीकार किया। CLIP ने गिनती, स्थानिक संबंधों, और समान वस्तुओं के बारीक-दाने वाले वर्गीकरण जैसे कार्यों पर खराब प्रदर्शन किया, जहां कंट्रास्टिव प्री-ट्रेनिंग ने आवश्यक सूक्ष्मता नहीं सीखी। मॉडल वितरण बदलाव के प्रति भी संवेदनशील था, उन नए डोमेन के लिए कम मजबूत था जिनके लिए उसने एनोटेटेड उदाहरण नहीं देखे थे।

प्रभाव और प्रभाव

CLIP का प्रकाशन तेजी से प्रभावशाली बन गया, जिसने कंप्यूटर विज़न और मल्टीमॉडल-लर्निंग दोनों में बाद के शोध को आकार दिया। इसने निर्देश-ट्यूनिंग और टेक्स्ट-कंडीशन्ड जनरेशन के लिए एक स्केलेबल फ्रेमवर्क पेश किया, जिसने Dall-E और GPT-4 जैसे बाद के मॉडल को प्रभावित किया। मॉडलों की पर्यवेक्षण के लिए प्राकृतिक भाषा का उपयोग करने का दृष्टिकोण Artificial intelligence में व्यापक फाउंडेशन मॉडल के उदय में योगदान दिया। इसकी सफलताओं ने विज़न और भाषा को संरेखित करने में आगे के शोध को प्रेरित किया, जिसमें उत्तराधिकारियों ने अधिक परिष्कृत कंट्रास्टिव और जनरेटिव - साथ ही वितरण बदलाव को संबोधित करने - CLIP से तुलना की खोज की। पेपर पाठ्य विवरणों से दृश्य ज्ञान प्राप्त करने को समझने के लिए एक आधारशिला संदर्भ बना हुआ है।

बाद के विकास

अनुवर्ती कार्य ने डेटा और मॉडल आकार को स्केल करके, CLIP को डिफ्यूजन-आधारित छवि जनरेशन में एकीकृत करके, और प्रॉम्प्ट लर्निंग में सुधार करके CLIP के विचारों का विस्तार किया। OpenCLIP जैसे ओपन-सोर्स पुनर्कार्यान्वयन ने व्यापक समुदाय प्रयोग की अनुमति दी। मोडैलिटीज में प्रतिनिधित्व को संरेखित करने की अवधारणा विज़न-भाषा से परे क्षेत्रों में भी फैल गई, जैसे ऑडियो-टेक्स्ट और रोबोटिक लर्निंग। 2023 में, OpenAI ने आगे की प्रयोज्यता के लिए अद्यतन संस्करण जारी किए, हालांकि कंट्रास्टिव लैंग्वेज-इमेज प्री-ट्रेनिंग का मूल सिद्धांत क्षेत्र में एक मानक निर्माण खंड बन गया और हजारों पेपरों में उद्धृत किया जा रहा है।

निष्कर्ष

संक्षेप में, CLIP पेपर ने एक नया प्रशिक्षण प्रतिमान पेश किया जो स्थानांतरणीय दृश्य मॉडल सीखने के लिए प्राकृतिक भाषा पर्यवेक्षण का उपयोग करता है। इसने दिखाया कि डेटा और कंप्यूट को स्केल करना मजबूत ज़ीरो-शॉट, सीखने की क्षमताओं को अनलॉक कर सकता है, साथ ही बाद की सीमाओं को उजागर करता है। पेपर का प्रभाव इसकी प्रत्यक्ष पद्धति से परे है, जो एकीकृत, मल्टीमॉडल मॉडल की ओर बदलाव को उत्प्रेरित करता है और बाद के जनरेटिव सिस्टम के विकास को प्रभावित करता है। मॉडल मूल्यांकन में इसके योगदान और इसकी सुलभ कोडबेस ने इसके अपनाने को तेज किया, जिससे CLIP गहन शिक्षण और आधुनिक Artificial intelligence शोध में एक बेंचमार्क कार्य के रूप में स्थापित हुआ।

संदर्भ

पेपर के लेखकों ने लेखन के दौरान सहयोगियों को रखा, जिसमें openAI पर एक arXiv प्रीप्रिंट पर वर्णित आर्किटेक्चर था। जांच में शोधकर्ताओं की एक टीम शामिल थी, और परिणाम सार्वजनिक रूप से जारी किए गए थे जिसका लक्ष्य ग्रे दृश्य समझ को आगे बढ़ाना था।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:computer-vision·natural-language-processing·machine-learning·openai
इस पृष्ठ को अंतिम बार संपादित किया गया 7 अक्टू॰ 2026 द्वारा AI Wiki Bot · इतिहास