अंग्रेज़ी से अनुवादित

YOLO (You Only Look Once) एक वास्तविक समय वस्तु पहचान प्रणाली है जो कन्वोल्यूशनल न्यूरल नेटवर्क का उपयोग करती है, जिसे 2015 में जोसेफ रेडमन एट अल. द्वारा पेश किया गया था। इसे बाउंडिंग बॉक्स और वर्ग संभावनाओं की भविष्यवाणी करने के लिए केवल एक फॉरवर्ड पास की आवश्यकता होती है।

YOLO (You Only Look Once) वास्तविक समय में वस्तु पहचान प्रणालियों का एक परिवार है, जो कन्वोल्यूशनल न्यूरल नेटवर्क पर आधारित है। 2015 में जोसेफ रेडमन और उनके सहयोगियों द्वारा पहली बार प्रस्तुत, YOLO ने कई पुनरावृत्तियों से गुजरा है और सबसे व्यापक रूप से उपयोग किए जाने वाले वस्तु पहचान ढांचों में से एक बन गया है। यह नाम एल्गोरिदम के मूल डिजाइन को दर्शाता है: इसे पूर्वानुमान लगाने के लिए न्यूरल नेटवर्क के माध्यम से केवल एक फॉरवर्ड प्रोपेगेशन पास की आवश्यकता होती है, जबकि पहले की क्षेत्र-प्रस्ताव-आधारित तकनीकों जैसे R-CNN को एक छवि के लिए हजारों पास की आवश्यकता होती थी।

पिछले तरीकों के विपरीत, जो एक छवि पर कई स्थानों और पैमानों पर मॉडल लागू करते थे, YOLO पूरी छवि पर एक एकल न्यूरल नेटवर्क लागू करता है। नेटवर्क छवि को क्षेत्रों के ग्रिड में विभाजित करता है और प्रत्येक क्षेत्र के लिए बाउंडिंग बॉक्स और वर्ग संभावनाओं की भविष्यवाणी करता है। ये भविष्यवाणियां विश्वास स्कोर द्वारा भारित होती हैं, जिससे एक ही मूल्यांकन में तेज और सटीक पहचान संभव होती है।

अवलोकन

YOLO की वास्तुकला एक कन्वोल्यूशनल न्यूरल नेटवर्क के चारों ओर बनाई गई है जो पूरी छवि को एक पास में संसाधित करती है। छवि को S × S ग्रिड में विभाजित किया जाता है, जहां प्रत्येक सेल बाउंडिंग बॉक्स और विश्वास स्कोर की भविष्यवाणी के लिए जिम्मेदार होता है। यदि किसी वस्तु के बाउंडिंग बॉक्स का केंद्र किसी सेल के भीतर आता है, तो उस सेल को वस्तु को "समाहित" करने वाला माना जाता है। प्रत्येक सेल B बाउंडिंग बॉक्स की भविष्यवाणी करता है, साथ ही विश्वास स्कोर जो वस्तु के मौजूद होने की संभावना और भविष्यवाणी किए गए बॉक्स की सटीकता दोनों को दर्शाते हैं।

प्रत्येक सेल के लिए नेटवर्क आउटपुट में सशर्त वर्ग संभावनाएं (संभावना कि सेल में किसी दिए गए वर्ग की वस्तु है, बशर्ते उसमें कम से कम एक वस्तु हो) और बाउंडिंग बॉक्स पैरामीटर (केंद्र निर्देशांक, चौड़ाई और ऊंचाई) शामिल हैं। प्रति सेल कई बाउंडिंग बॉक्स मॉडल को विभिन्न वस्तु आकृतियों, जैसे पतली बनाम मोटी वस्तुओं, में विशेषज्ञता प्राप्त करने की अनुमति देते हैं। मूल YOLO वास्तुकला में 24 कन्वोल्यूशनल परतें और उसके बाद 2 पूरी तरह से जुड़ी परतें शामिल थीं।

प्रशिक्षण के दौरान, प्रत्येक सेल के लिए जिसमें एक ग्राउंड ट्रुथ बाउंडिंग बॉक्स होता है, केवल वह भविष्यवाणी किया गया बॉक्स जिसका ग्राउंड ट्रुथ के साथ सबसे अधिक इंटरसेक्शन ओवर यूनियन (IoU) होता है, ग्रेडिएंट डिसेंट के लिए उपयोग किया जाता है। लॉस फ़ंक्शन मॉडल को भविष्यवाणी किए गए बॉक्स निर्देशांक को ग्राउंड ट्रुथ के साथ संरेखित करने, सही वर्ग संभावनाएं निर्धारित करने और झूठी सकारात्मकताओं को दबाने के लिए प्रोत्साहित करता है।

पूर्ववर्ती और संदर्भ

YOLO से पहले, R-CNN और OverFeat जैसी वस्तु पहचान प्रणालियां क्षेत्र प्रस्ताव या बहु-पैमाने स्कैनिंग दृष्टिकोण पर निर्भर थीं। OverFeat, एक प्रारंभिक प्रभावशाली मॉडल, ने वर्गीकरण के लिए एक न्यूरल नेटवर्क प्रशिक्षित किया और फिर बाउंडिंग बॉक्स कोनों की भविष्यवाणी के लिए एक प्रतिगमन नेटवर्क जोड़ा। अनुमान के समय, यह कई ज़ूम स्तरों और क्रॉपिंग पर वर्गीकरण नेटवर्क चलाता था, जिससे हजारों उम्मीदवार बॉक्स उत्पन्न होते थे जिन्हें बाद में विलय कर दिया जाता था। यह प्रक्रिया कम्प्यूटेशनल रूप से महंगी और धीमी थी।

YOLO ने पहचान को एक एकल प्रतिगमन समस्या के रूप में सुधार कर इन अक्षमताओं को संबोधित किया। छवि को कई बार स्कैन करने के बजाय, YOLO पूरी छवि को एक फॉरवर्ड पास में संसाधित करता है, जिससे यह प्रतिस्पर्धी सटीकता बनाए रखते हुए काफी तेज हो जाता है। इस बदलाव ने वीडियो विश्लेषण, रोबोटिक्स और स्वायत्त ड्राइविंग में वास्तविक समय अनुप्रयोगों को सक्षम किया।

संस्करण

YOLO श्रृंखला को दो भागों में विभाजित किया जा सकता है। मूल भाग, जोसेफ रेडमन द्वारा बनाए रखा गया, में YOLOv1, YOLOv2 और YOLOv3 शामिल हैं। ये संस्करण एक समर्पित वेबसाइट पर जारी किए गए थे और अनुसंधान और उद्योग दोनों में व्यापक रूप से अपनाए गए।

YOLOv1

YOLOv1, 2015 में पेश किया गया, ने मूल ढांचा स्थापित किया। इसने छवि को S × S ग्रिड में विभाजित किया, जिसमें प्रत्येक सेल B बाउंडिंग बॉक्स और विश्वास स्कोर की भविष्यवाणी करता था। प्रत्येक सेल के लिए नेटवर्क आउटपुट में वर्ग संभावनाएं और बॉक्स निर्देशांक शामिल थे। मूल कार्यान्वयन में S = 7 और B = 2 का उपयोग किया गया, जिसके परिणामस्वरूप प्रति छवि 98 बाउंडिंग बॉक्स बने। अपनी गति के बावजूद, YOLOv1 में छोटी वस्तुओं का पता लगाने और ओवरलैपिंग वस्तुओं को संभालने में सीमाएं थीं, जिन्हें बाद के संस्करणों ने संबोधित किया।

YOLOv2 और YOLOv3

YOLOv2, जिसे YOLO9000 के रूप में भी जाना जाता है, ने बैच नॉर्मलाइजेशन, एंकर बॉक्स और बहु-पैमाने प्रशिक्षण जैसे सुधार पेश किए। यह पदानुक्रमित वर्गीकरण का लाभ उठाकर 9,000 से अधिक वस्तु श्रेणियों का पता लगा सकता था। YOLOv3 ने अवशिष्ट कनेक्शन और बहु-पैमाने भविष्यवाणियों के साथ एक गहरी वास्तुकला का उपयोग करके सटीकता को और बढ़ाया, जिससे छोटी वस्तुओं का बेहतर पता लगाना संभव हुआ। इन संस्करणों ने YOLO की प्रतिष्ठा को एक अत्याधुनिक वास्तविक समय डिटेक्टर के रूप में मजबूत किया।

प्रभाव और अनुप्रयोग

YOLO की गति और दक्षता ने इसे वास्तविक समय अनुप्रयोगों, जैसे वीडियो निगरानी, स्वायत्त वाहनों और रोबोटिक्स के लिए एक लोकप्रिय विकल्प बना दिया है। इसका एकल-पास डिजाइन विशेष रूप से एज डिवाइसों और एम्बेडेड सिस्टम के लिए उपयुक्त है, जहां कम्प्यूटेशनल संसाधन सीमित होते हैं। इस ढांचे ने बाद के वस्तु पहचान अनुसंधान को भी प्रभावित किया है, कई विविधताओं और अनुकूलनों को प्रेरित किया है।

2020 के दशक की शुरुआत तक, YOLO अनुसंधान समुदाय द्वारा सक्रिय रूप से विकसित किया जा रहा है, जिसमें YOLOv4, YOLOv5 और बाद की पुनरावृत्तियों जैसे नए संस्करण आगे के अनुकूलन पेश कर रहे हैं। ये संस्करण अक्सर गहन शिक्षण और तंत्रिका नेटवर्क अनुसंधान से तकनीकों को शामिल करते हैं, जैसे ध्यान तंत्र और बेहतर प्रशिक्षण रणनीतियां। YOLO की विरासत इस प्रदर्शन में निहित है कि सटीकता का त्याग किए बिना वास्तविक समय पहचान प्राप्त करना संभव है, जिससे यह आधुनिक कंप्यूटर विज़न का एक आधारशिला बन गया है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:computer-vision·object-detection·deep-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास