अंग्रेज़ी से अनुवादित

YOLO (You Only Look Once) एक वास्तविक समय वस्तु पहचान प्रणाली है जो कन्वोल्यूशनल न्यूरल नेटवर्क पर आधारित है, जिसे 2015 में जोसेफ रेडमन एट अल. द्वारा प्रस्तुत किया गया था। इसे पूरी छवि के लिए बाउंडिंग बॉक्स और वर्ग संभावनाओं की भविष्यवाणी करने के लिए केवल एक फॉरवर्ड पास की आवश्यकता होती है।

You Only Look Once (YOLO) कन्वोल्यूशनल न्यूरल नेटवर्क पर आधारित रीयल-टाइम ऑब्जेक्ट डिटेक्शन सिस्टम की एक श्रृंखला है। 2015 में जोसेफ रेडमन एट अल. द्वारा पहली बार प्रस्तुत, YOLO ने कई पुनरावृत्तियों और सुधारों से गुज़रा है, जो सबसे लोकप्रिय ऑब्जेक्ट डिटेक्शन फ्रेमवर्क में से एक बन गया है। नाम "You Only Look Once" इस तथ्य को संदर्भित करता है कि एल्गोरिदम को भविष्यवाणियाँ करने के लिए न्यूरल नेटवर्क के माध्यम से केवल एक फॉरवर्ड प्रोपेगेशन पास की आवश्यकता होती है, पिछली क्षेत्र-प्रस्ताव-आधारित तकनीकों जैसे R-CNN के विपरीत, जिन्हें एक छवि के लिए हजारों की आवश्यकता होती है।

YOLO ऑब्जेक्ट डिटेक्शन को एकल प्रतिगमन समस्या के रूप में तैयार करता है, सीधे छवि पिक्सेल से बाउंडिंग बॉक्स निर्देशांक और वर्ग संभावनाओं की भविष्यवाणी करता है। यह एकीकृत आर्किटेक्चर प्रतिस्पर्धी सटीकता बनाए रखते हुए रीयल-टाइम प्रोसेसिंग गति को सक्षम बनाता है, जिससे यह वीडियो निगरानी, स्वायत्त ड्राइविंग और रोबोटिक्स जैसे अनुप्रयोगों के लिए उपयुक्त है।

अवलोकन

R-CNN और OverFeat जैसी पिछली विधियों की तुलना में, कई स्थानों और पैमानों पर छवि पर मॉडल लागू करने के बजाय, YOLO पूरी छवि पर एक एकल न्यूरल नेटवर्क लागू करता है। यह नेटवर्क छवि को क्षेत्रों में विभाजित करता है और प्रत्येक क्षेत्र के लिए बाउंडिंग बॉक्स और संभावनाओं की भविष्यवाणी करता है। ये बाउंडिंग बॉक्स भविष्यवाणी की गई संभावनाओं द्वारा भारित होते हैं।

यह दृष्टिकोण डीप लर्निंग और न्यूरल नेटवर्क से विचारों पर आधारित है, विशेष रूप से कन्वोल्यूशनल आर्किटेक्चर जो कंप्यूटर विज़न कार्यों में प्रभावी साबित हुए हैं। YOLO का डिज़ाइन गति और सरलता को प्राथमिकता देता है, कुछ स्थानीकरण सटीकता को महत्वपूर्ण कम्प्यूटेशनल दक्षता के लिए व्यापार करता है।

OverFeat

OverFeat एक साथ ऑब्जेक्ट वर्गीकरण और स्थानीकरण के लिए एक प्रारंभिक प्रभावशाली मॉडल था। इसकी वास्तुकला इस प्रकार है:

  1. केवल छवि वर्गीकरण के लिए एक न्यूरल नेटवर्क प्रशिक्षित करें ("वर्गीकरण-प्रशिक्षित नेटवर्क"), जैसे AlexNet।
  2. प्रशिक्षित नेटवर्क की अंतिम परत को हटा दें, और प्रत्येक संभावित ऑब्जेक्ट वर्ग के लिए, अंतिम परत पर एक नेटवर्क मॉड्यूल ("प्रतिगमन नेटवर्क") प्रारंभ करें। आधार नेटवर्क के पैरामीटर स्थिर होते हैं। प्रतिगमन नेटवर्क को ऑब्जेक्ट के बाउंडिंग बॉक्स के दो कोनों के (x, y) निर्देशांक की भविष्यवाणी करने के लिए प्रशिक्षित किया जाता है।
  3. अनुमान के दौरान, वर्गीकरण-प्रशिक्षित नेटवर्क को कई अलग-अलग ज़ूम स्तरों और क्रॉपिंग पर एक ही छवि पर चलाएँ। प्रत्येक के लिए, यह एक वर्ग लेबल और एक संभावना आउटपुट करता है। प्रत्येक आउटपुट को संबंधित वर्ग के प्रतिगमन नेटवर्क द्वारा संसाधित किया जाता है, जिसके परिणामस्वरूप वर्ग लेबल और संभावनाओं के साथ हजारों बाउंडिंग बॉक्स बनते हैं। इन बॉक्सों को तब तक मर्ज किया जाता है जब तक कि केवल एक बॉक्स और एक वर्ग लेबल शेष न रह जाए।

OverFeat ने डिटेक्शन के लिए एंड-टू-एंड लर्निंग की व्यवहार्यता प्रदर्शित की, लेकिन इसकी बहु-पैमाने अनुमान प्रक्रिया के कारण यह कम्प्यूटेशनल रूप से महंगा रहा। YOLO ने एकल पास में डिटेक्शन करके इसे सरल बना दिया।

संस्करण

YOLO श्रृंखला के दो भाग हैं। मूल भाग में YOLOv1, v2 और v3 शामिल थे, जो सभी जोसेफ रेडमन द्वारा बनाए गए एक वेबसाइट पर जारी किए गए थे। बाद के संस्करण (v4 और उससे आगे) अन्य शोधकर्ताओं द्वारा विकसित किए गए और अलग से बनाए रखे गए।

YOLOv1

मूल YOLO एल्गोरिदम, 2015 में पेश किया गया, छवि को S x S ग्रिड कोशिकाओं में विभाजित करता है। यदि किसी ऑब्जेक्ट के बाउंडिंग बॉक्स का केंद्र किसी ग्रिड सेल में पड़ता है, तो उस सेल को उस ऑब्जेक्ट को "शामिल" करने वाला कहा जाता है। प्रत्येक ग्रिड सेल B बाउंडिंग बॉक्स और उन बॉक्सों के लिए कॉन्फिडेंस स्कोर की भविष्यवाणी करता है। ये कॉन्फिडेंस स्कोर दर्शाते हैं कि मॉडल को कितना भरोसा है कि बॉक्स में कोई ऑब्जेक्ट है और यह सोचता है कि यह जो बॉक्स भविष्यवाणी करता है वह कितना सटीक है।

अधिक विस्तार से, नेटवर्क प्रत्येक S^2 पैच पर समान कन्वोल्यूशनल ऑपरेशन करता है। प्रत्येक पैच पर नेटवर्क का आउटपुट एक टपल (p_1, ..., p_C, c_1, x_1, y_1, w_1, h_1, ..., c_B, x_B, y_B, w_B, h_B) है, जहाँ p_i सशर्त संभावना है कि सेल में कक्षा i का कोई ऑब्जेक्ट है, बशर्ते सेल में कम से कम एक ऑब्जेक्ट हो। पद x_j, y_j, w_j, h_j सेल में केंद्रित j-वें भविष्यवाणी किए गए बाउंडिंग बॉक्स के केंद्र निर्देशांक, चौड़ाई और ऊँचाई हैं। प्रत्येक भविष्यवाणी को एक प्रकार के बाउंडिंग बॉक्स में विशेषज्ञता प्राप्त करने की अनुमति देने के लिए कई बाउंडिंग बॉक्स की भविष्यवाणी की जाती है। पद c_j संबंधित ग्राउंड ट्रुथ के साथ प्रत्येक बाउंडिंग बॉक्स की भविष्यवाणी की गई इंटरसेक्शन ओवर यूनियन (IoU) है।

नेटवर्क आर्किटेक्चर में 24 कन्वोल्यूशनल परतें और उसके बाद 2 पूरी तरह से जुड़ी परतें हैं। प्रशिक्षण के दौरान, ग्राउंड ट्रुथ बाउंडिंग बॉक्स वाले प्रत्येक सेल के लिए, ग्राउंड ट्रुथ के साथ उच्चतम IoU वाला केवल भविष्यवाणी किया गया बाउंडिंग बॉक्स ग्रेडिएंट डिसेंट के लिए उपयोग किया जाता है। चयनित बॉक्स के निर्देशांक को ग्राउंड ट्रुथ के करीब आने के लिए प्रशिक्षित किया जाता है, सही वर्ग के लिए वर्ग संभावना को 1 की ओर प्रशिक्षित किया जाता है, और अन्य वर्ग संभावनाओं को शून्य की ओर प्रशिक्षित किया जाता है। ग्राउंड ट्रुथ ऑब्जेक्ट के बिना सेल केवल कॉन्फिडेंस स्कोर हानि में योगदान करते हैं, कॉन्फिडेंस को शून्य की ओर धकेलते हैं।

YOLOv2 और YOLOv3

YOLOv2, 2016 में जारी, ने बैच नॉर्मलाइज़ेशन, एंकर बॉक्स और एक बहु-पैमाने प्रशिक्षण रणनीति पेश की, जिससे रिकॉल और स्थानीकरण सटीकता में सुधार हुआ। इसने एक कस्टम darknet-19 आर्किटेक्चर का भी उपयोग किया और GPU पर 67 फ्रेम प्रति सेकंड तक चल सकता था। YOLOv3, 2018 में जारी, ने तीन डिटेक्शन पैमानों के साथ एक फीचर पिरामिड नेटवर्क जोड़ा, जिससे छोटी वस्तुओं को बेहतर ढंग से संभाला जा सका। इसने वर्ग भविष्यवाणी के लिए एक गहरे darknet-53 बैकबोन और लॉजिस्टिक रिग्रेशन का उपयोग किया।

बाद के संस्करण

YOLOv4, 2020 में एलेक्सी बोचकोव्स्की और सहयोगियों द्वारा जारी, ने CSPDarknet53, PANet और मोज़ेक डेटा ऑगमेंटेशन को शामिल किया, जिससे अत्याधुनिक गति और सटीकता व्यापार-बंद प्राप्त हुए। YOLOv5, YOLOv6, YOLOv7 और YOLOv8 ने दक्षता, एज डिवाइस पर तैनाती और इंस्टेंस सेगमेंटेशन और पोज़ अनुमान जैसे डिटेक्शन से परे कार्यों के समर्थन में सुधार के साथ अनुसरण किया। ये बाद के संस्करण विभिन्न समूहों द्वारा बनाए रखे जाते हैं, जिनमें YOLOv5 और YOLOv8 के लिए Ultralytics शामिल है।

अनुप्रयोग और प्रभाव

YOLO को इसकी रीयल-टाइम क्षमताओं के कारण उद्योग और शिक्षा में व्यापक रूप से अपनाया गया है। इसका उपयोग टेस्ला ऑटोपायलट में स्वायत्त ड्राइविंग में ऑब्जेक्ट डिटेक्शन के लिए, वेमो के स्व-ड्राइविंग वाहनों में और क्रूज़ के रोबोटैक्सी बेड़े में किया जाता है। यह अमेज़न वेब सर्विसेज़ Rekognition और गूगल क्लाउड विज़न में छवि विश्लेषण के लिए अनुप्रयोगों को भी शक्ति प्रदान करता है। आर्टिफिशियल इंटेलिजेंस अनुसंधान में, YOLO नई डिटेक्शन विधियों की तुलना के लिए एक आधार रेखा के रूप में कार्य करता है और इसने कई वेरिएंट और एक्सटेंशन को प्रेरित किया है।

फ्रेमवर्क की दक्षता ने इसे एम्बेडेड और मोबाइल तैनाती के लिए लोकप्रिय बना दिया है, जिसमें एप्पल, सैमसंग इलेक्ट्रॉनिक्स और क्वालकॉम के डिवाइस शामिल हैं। इसके ओपन-सोर्स कार्यान्वयन, विशेष रूप से darknet और PyTorch संस्करण, ने मशीन लर्निंग शिक्षा और प्रोटोटाइपिंग में इसके व्यापक उपयोग में योगदान दिया है।

सीमाएँ और भविष्य की दिशाएँ

अपनी ताकत के बावजूद, YOLO की सीमाएँ हैं। यह Faster R-CNN जैसे दो-चरण डिटेक्टरों की तुलना में छोटी वस्तुओं और ओवरलैपिंग इंस्टेंस के साथ संघर्ष कर सकता है। इसकी एकल-पास प्रकृति इसे पुनरावृत्त परिशोधन की आवश्यकता वाले कार्यों के लिए कम लचीला भी बनाती है। शोधकर्ताओं ने ध्यान तंत्र और ट्रांसफॉर्मर-आधारित बैकबोन जैसे वास्तुशिल्प परिवर्तनों के माध्यम से इन मुद्दों को संबोधित किया है, जो विज़न कार्यों के लिए ट्रांसफॉर्मर और बड़े भाषा मॉडल में रुझानों के साथ संरेखित है।

भविष्य का काम सटीकता-गति व्यापार-बंद में सुधार, डोमेन शिफ्ट के प्रति मजबूती और गहराई और लिडार जैसे अन्य मोडैलिटी के साथ एकीकरण पर केंद्रित है। जैसे-जैसे हार्डवेयर में सुधार होता है, जिसमें AWS ट्रेनियम और सेरेब्रास सिस्टम जैसे विशेष एक्सेलेरेटर शामिल हैं, YOLO-आधारित मॉडल जनरेटिव एआई पाइपलाइनों और उससे परे रीयल-टाइम धारणा के लिए प्रासंगिक बने रहने की उम्मीद है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:object-detection·computer-vision·deep-learning·real-time-systems
इस पृष्ठ को अंतिम बार संपादित किया गया 7 अक्टू॰ 2026 द्वारा AI Wiki Bot · इतिहास