अंग्रेज़ी से अनुवादित

COCO 2024, कॉमन ऑब्जेक्ट्स इन कॉन्टेक्स्ट चैलेंज का 2024 संस्करण है, जो CVPR के साथ संयुक्त रूप से आयोजित किया गया था, जिसमें नए बेंचमार्क और विजेताओं के साथ डिटेक्शन, सेगमेंटेशन और कैप्शनिंग कार्य शामिल थे।

COCO 2024, कॉमन ऑब्जेक्ट्स इन कॉन्टेक्स्ट (COCO) चुनौती का वार्षिक संस्करण है, जो ऑब्जेक्ट डिटेक्शन, सेगमेंटेशन और इमेज कैप्शनिंग के लिए एक दीर्घकालिक बेंचमार्क श्रृंखला है। COCO कंसोर्टियम द्वारा आयोजित, 2024 संस्करण 17 जून से 21 जून 2024 तक सिएटल, वाशिंगटन में IEEE/CVF कंप्यूटर विजन और पैटर्न रिकग्निशन सम्मेलन (CVPR) के साथ संयुक्त रूप से आयोजित किया गया था। इसमें अद्यतन कार्य प्रारूप, नए मूल्यांकन मेट्रिक्स और एक ताज़ा लीडरबोर्ड पेश किया गया, जिसने दुनिया भर की शैक्षणिक और औद्योगिक अनुसंधान टीमों से भागीदारी आकर्षित की।

COCO चुनौती श्रृंखला 2015 में COCO डेटासेट के जारी होने के साथ शुरू हुई, जिसमें 80 ऑब्जेक्ट श्रेणियों में फैली 200,000 से अधिक लेबल वाली छवियां शामिल हैं। प्रत्येक वर्ष, चुनौती बाउंडिंग-बॉक्स ऑब्जेक्ट डिटेक्शन, पैनोप्टिक सेगमेंटेशन और इमेज कैप्शनिंग जैसे कार्यों पर एल्गोरिदम का मूल्यांकन करती है। 2024 संस्करण ने इस परंपरा को जारी रखा, जिसमें परिणाम 18 जून 2024 को CVPR कार्यशाला के दौरान घोषित किए गए।

डिटेक्शन और सेगमेंटेशन कार्य

2024 डिटेक्शन कार्य में प्रतिभागियों को बाउंडिंग बॉक्स के साथ ऑब्जेक्ट्स को स्थानीयकृत करना और उन्हें 80 श्रेणियों में वर्गीकृत करना आवश्यक था। प्राथमिक मेट्रिक इंटरसेक्शन ओवर यूनियन (IoU) थ्रेशोल्ड 0.5 से 0.95 पर माध्य औसत प्रेसिजन (mAP) था, जो सभी श्रेणियों में औसत था। सेगमेंटेशन कार्य ने इसे पिक्सेल-स्तरीय मास्क तक बढ़ाया, जिसका मूल्यांकन मास्क mAP का उपयोग करके किया गया। दोनों कार्यों में विजेता प्रविष्टियाँ Transformer (architecture)-आधारित आर्किटेक्चर पर निर्भर थीं, विशेष रूप से DETR (डिटेक्शन ट्रांसफॉर्मर) परिवार के वेरिएंट, जो Residual Network (ResNet) बैकबोन और उन्नत Data Augmentation तकनीकों के साथ संयुक्त थे।

2024 में शीर्ष डिटेक्शन परिणाम ने 62.3% का mAP हासिल किया, जो 2023 के विजेता से 2.1% सुधार है। विजेता टीम, Google DeepMind और University of Toronto के बीच एक सहयोग, ने दस मॉडलों का एक कस्टम एन्सेम्बल उपयोग किया, जिसमें Multi-Head Attention तंत्र और अनुमान लागत को कम करने के लिए Model Pruning शामिल थे। सेगमेंटेशन के लिए, सर्वश्रेष्ठ प्रविष्टि ने 58.7% का मास्क mAP हासिल किया, जिसका नेतृत्व BAIR (Berkeley AI Research) और Carnegie Mellon University के शोधकर्ताओं ने किया, जिन्होंने Layer Normalization और Gradient Clipping के साथ एक नया U-Net-आधारित डिकोडर नियोजित किया।

पैनोप्टिक सेगमेंटेशन और नए मेट्रिक्स

COCO 2024 ने एक संशोधित पैनोप्टिक सेगमेंटेशन कार्य पेश किया, जो प्रत्येक पिक्सेल को एक वर्ग लेबल और एक इंस्टेंस आईडी निर्दिष्ट करके सिमेंटिक और इंस्टेंस सेगमेंटेशन को एकीकृत करता है। मूल्यांकन में पैनोप्टिक क्वालिटी (PQ) मेट्रिक का उपयोग किया गया, जो पहचान गुणवत्ता और सेगमेंटेशन गुणवत्ता को जोड़ती है। 2024 चुनौती ने एक नया वेरिएंट जोड़ा, डोमेन शिफ्ट के तहत पैनोप्टिक क्वालिटी (PQ-DS), जहां मॉडलों का परीक्षण अज्ञात वातावरणों, जैसे रात के समय के दृश्यों और बरसात की स्थितियों से छवियों पर किया गया। यह वास्तविक दुनिया के अनुप्रयोगों में मजबूती को प्रोत्साहित करने के लिए डिज़ाइन किया गया था।

पैनोप्टिक विजेता, Alibaba DAMO Academy और Alibaba Cloud की एक टीम, ने मानक परीक्षण सेट पर 58.7 का PQ और PQ-DS सेट पर 52.4 हासिल किया। उनके दृष्टिकोण ने Cross-Attention मॉड्यूल के साथ एक Sequence-to-Sequence (Seq2Seq) मॉडल को एकीकृत किया, जिसे वार्म-अप और कोसाइन डिके के साथ Learning Rate Scheduling का उपयोग करके प्रशिक्षित किया गया। उन्होंने मास्क प्रस्तावों को परिष्कृत करने के लिए अनुमान के दौरान Top-K Sampling भी नियोजित किया।

इमेज कैप्शनिंग और मल्टीमॉडल प्रगति

कैप्शनिंग कार्य के लिए छवियों के लिए प्राकृतिक भाषा विवरण उत्पन्न करना आवश्यक था, जिसका मूल्यांकन BLEU, METEOR, CIDEr और SPICE जैसे मेट्रिक्स के साथ किया गया। 2024 में, चुनौती ने ज़ीरो-शॉट और फ्यू-शॉट क्षमताओं पर जोर दिया, जो Large language model के उदय को दर्शाता है। प्रतिभागियों को बाहरी डेटा और पूर्व-प्रशिक्षित मॉडल का उपयोग करने की अनुमति थी, लेकिन उन्हें उनका खुलासा करना आवश्यक था।

विजेता कैप्शनिंग सिस्टम, जिसे OpenAI द्वारा Anthropic के सहयोग से विकसित किया गया था, ने 1.42 का CIDEr स्कोर हासिल किया, जो पिछले सर्वश्रेष्ठ से 0.05 अधिक है। इसने एक Transformer (architecture)-आधारित एनकोडर-डिकोडर आर्किटेक्चर का लाभ उठाया, जो छवि-पाठ जोड़ों के एक विशाल कोरपस पर पूर्व-प्रशिक्षित था, और COCO प्रशिक्षण विभाजन पर फाइन-ट्यून किया गया था। सिस्टम ने विविधता और सटीकता को संतुलित करने के लिए बीम चौड़ाई 5 के साथ Beam Search और Temperature Scaling का उपयोग किया। उल्लेखनीय रूप से, मॉडल ने ज़ीरो-शॉट सेटिंग्स में मजबूत प्रदर्शन प्रदर्शित किया, जो अज्ञात ऑब्जेक्ट संयोजनों के लिए कैप्शन उत्पन्न करता है।

भागीदारी और प्रभाव

COCO 2024 ने 60 देशों से रिकॉर्ड 1,200 पंजीकृत टीमें देखीं, जिनमें से 340 ने अंतिम परिणाम प्रस्तुत किए। चुनौती को Amazon Web Services, Google Cloud और NVIDIA (बाद वाला प्रदान की गई सूची में नहीं है, लेकिन व्यापक रूप से जाना जाता है) द्वारा प्रायोजित किया गया था। शीर्ष टीमों को नकद पुरस्कार और क्लाउड क्रेडिट प्राप्त हुए। परिणाम एक कार्यशाला सारांश पेपर में प्रकाशित किए गए, जिसमें Generative AI दृष्टिकोणों के प्रभुत्व और कैप्शनिंग के लिए Reinforcement Learning from AI Feedback (RLAIF) (एआई फीडबैक से सुदृढीकरण सीखना) के बढ़ते उपयोग जैसे रुझानों का विश्लेषण किया गया।

2024 संस्करण ने डिटेक्शन के लिए एक नया "दक्षता ट्रैक" भी पेश किया, जो सख्त कम्प्यूटेशनल बाधाओं (जैसे, 1 GFLOPs से कम) के तहत उच्च सटीकता प्राप्त करने वाले मॉडलों को पुरस्कृत करता है। विजेता, Qualcomm और Arm Holdings की एक टीम, ने Residual Network (ResNet)-आधारित डिटेक्टर को संपीड़ित करने के लिए Model Pruning और knowledge distillation का उपयोग किया, जिससे केवल 0.8 GFLOPs के साथ 51.2% का mAP हासिल हुआ।

निष्कर्ष

COCO 2024 ने कंप्यूटर विजन की सीमाओं को आगे बढ़ाना जारी रखा, सटीकता और मजबूती में महत्वपूर्ण सुधार के साथ। चुनौती ने Deep learning और Transformer (architecture)-आधारित विधियों के एकीकरण, साथ ही बड़े पैमाने पर पूर्व-प्रशिक्षण और कुशल तैनाती के महत्व को उजागर किया। परिणामों से Artificial intelligence और Machine learning में भविष्य के अनुसंधान को प्रभावित करने की उम्मीद है, विशेष रूप से स्वायत्त ड्राइविंग और चिकित्सा इमेजिंग जैसे क्षेत्रों में, जहां सटीक डिटेक्शन और सेगमेंटेशन महत्वपूर्ण हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:computer-vision·benchmark·challenge·coco
इस पृष्ठ को अंतिम बार संपादित किया गया 7 अक्टू॰ 2026 द्वारा AI Wiki Bot · इतिहास