अंग्रेज़ी से अनुवादित

YOLO (You Only Look Once) एक वास्तविक समय वस्तु पहचान प्रणाली है, जिसे 2015 में जोसेफ रेडमन और अन्य द्वारा पेश किया गया था। यह एक एकल कन्वोल्यूशनल न्यूरल नेटवर्क का उपयोग करके पूर्ण छवियों से सीधे बाउंडिंग बॉक्स और क्लास संभावनाओं की भविष्यवाणी करता है।

You Only Look Once (YOLO) वास्तविक समय में वस्तु पहचान प्रणालियों की एक श्रृंखला है जो कन्वोल्यूशनल न्यूरल नेटवर्क पर आधारित है। 2015 में जोसेफ रेडमन और उनके सहयोगियों द्वारा पहली बार प्रस्तुत, YOLO ने कई पुनरावृत्तियों और सुधारों से गुजरा है, जो सबसे लोकप्रिय वस्तु पहचान ढांचों में से एक बन गया है। नाम "You Only Look Once" इस तथ्य को संदर्भित करता है कि एल्गोरिदम को पूर्वानुमान लगाने के लिए न्यूरल नेटवर्क के माध्यम से केवल एक फॉरवर्ड प्रसार पास की आवश्यकता होती है, पिछली क्षेत्र-प्रस्ताव-आधारित तकनीकों जैसे R-CNN के विपरीत, जिन्हें एक छवि के लिए हजारों पास की आवश्यकता होती है।

YOLO वस्तु पहचान को एक एकल प्रतिगमन समस्या के रूप में तैयार करता है, सीधे छवि पिक्सेल से बाउंडिंग बॉक्स निर्देशांक और वर्ग संभावनाओं की भविष्यवाणी करता है। यह दृष्टिकोण पहले के तरीकों के विपरीत है जो कई छवि क्षेत्रों और पैमानों पर क्लासिफायर लागू करते थे, जिससे YOLO काफी तेज हो जाता है जबकि प्रतिस्पर्धी सटीकता बनाए रखता है।

अवलोकन

R-CNN और OverFeat जैसे पिछले तरीकों की तुलना में, YOLO कई स्थानों और पैमानों पर मॉडल चलाने के बजाय पूरी छवि पर एक एकल न्यूरल नेटवर्क लागू करता है। नेटवर्क छवि को क्षेत्रों के ग्रिड में विभाजित करता है और प्रत्येक क्षेत्र के लिए बाउंडिंग बॉक्स और वर्ग संभावनाओं की भविष्यवाणी करता है। ये बाउंडिंग बॉक्स अनुमानित संभावनाओं द्वारा भारित होते हैं, जिससे मॉडल एक पास में अंतिम पहचान आउटपुट कर सकता है।

OverFeat

OverFeat एक साथ वस्तु वर्गीकरण और स्थानीयकरण के लिए एक प्रारंभिक प्रभावशाली मॉडल था, और इसने YOLO के अग्रदूत के रूप में कार्य किया। इसकी वास्तुकला में केवल छवि वर्गीकरण के लिए एक न्यूरल नेटवर्क प्रशिक्षित करना शामिल था, जैसे कि AlexNet। प्रशिक्षित नेटवर्क की अंतिम परत को तब हटा दिया गया था, और प्रत्येक संभावित वस्तु वर्ग के लिए, अंतिम परत पर एक प्रतिगमन नेटवर्क आरंभ किया गया था। आधार नेटवर्क के पैरामीटर स्थिर थे, और प्रतिगमन नेटवर्क को वस्तु के बाउंडिंग बॉक्स के दो कोनों के निर्देशांक की भविष्यवाणी करने के लिए प्रशिक्षित किया गया था।

अनुमान के दौरान, वर्गीकरण-प्रशिक्षित नेटवर्क को कई अलग-अलग ज़ूम स्तरों और क्रॉपिंग पर एक ही छवि पर चलाया गया था। प्रत्येक के लिए, इसने एक वर्ग लेबल और एक संभावना आउटपुट की। प्रत्येक आउटपुट को तब संबंधित वर्ग के प्रतिगमन नेटवर्क द्वारा संसाधित किया गया था, जिसके परिणामस्वरूप वर्ग लेबल और संभावनाओं के साथ हजारों बाउंडिंग बॉक्स प्राप्त हुए। इन बॉक्सों को तब तक विलय किया गया जब तक कि एक एकल वर्ग लेबल वाला केवल एक बॉक्स नहीं रह गया। यह बहु-पैमाने दृष्टिकोण कम्प्यूटेशनल रूप से महंगा था, जिसने YOLO जैसी अधिक कुशल विधि की आवश्यकता को प्रेरित किया।

संस्करण

YOLO श्रृंखला में दो भाग होते हैं। मूल भाग में YOLOv1, v2 और v3 शामिल थे, जो सभी जोसेफ रेडमन द्वारा बनाई गई वेबसाइट पर जारी किए गए थे। बाद के संस्करण, जिनमें YOLOv4 और उससे आगे शामिल हैं, अन्य शोधकर्ताओं द्वारा विकसित किए गए और ढांचे की क्षमताओं का विस्तार किया।

YOLOv1

मूल YOLO एल्गोरिदम, जो 2015 में पेश किया गया था, छवि को S × S कोशिकाओं के ग्रिड में विभाजित करता है। यदि किसी वस्तु के बाउंडिंग बॉक्स का केंद्र एक ग्रिड सेल में आता है, तो उस सेल को उस वस्तु को "शामिल" करने वाला कहा जाता है। प्रत्येक ग्रिड सेल B बाउंडिंग बॉक्स और उन बॉक्सों के लिए विश्वास स्कोर की भविष्यवाणी करता है। ये विश्वास स्कोर दर्शाते हैं कि मॉडल कितना आश्वस्त है कि बॉक्स में एक वस्तु है और यह सोचता है कि बॉक्स कितना सटीक है।

अधिक विवरण में, नेटवर्क प्रत्येक S² पैच पर समान कन्वोल्यूशनल ऑपरेशन करता है। प्रत्येक पैच के लिए आउटपुट एक टपल है जिसमें सशर्त वर्ग संभावनाएं, बाउंडिंग बॉक्स निर्देशांक और विश्वास स्कोर शामिल हैं। विशेष रूप से, प्रत्येक सेल के लिए, नेटवर्क p_i आउटपुट करता है, जो सशर्त संभावना है कि सेल में कक्षा i की वस्तु है, यह देखते हुए कि इसमें कम से कम एक वस्तु है। यह प्रत्येक B बॉक्स के लिए केंद्र निर्देशांक (x_j, y_j), चौड़ाई w_j, ऊंचाई h_j, और एक विश्वास स्कोर c_j भी आउटपुट करता है जो ग्राउंड ट्रुथ के साथ अनुमानित इंटरसेक्शन ओवर यूनियन (IoU) का प्रतिनिधित्व करता है।

प्रति सेल कई बाउंडिंग बॉक्स की भविष्यवाणी की जाती है ताकि प्रत्येक भविष्यवाणी एक विशेष आकार में विशेषज्ञ हो सके। उदाहरण के लिए, पतली वस्तुओं की भविष्यवाणी एक बॉक्स द्वारा की जा सकती है जबकि मोटी वस्तुओं की भविष्यवाणी दूसरे द्वारा की जाती है। नेटवर्क वास्तुकला में 24 कन्वोल्यूशनल परतें और उसके बाद 2 पूरी तरह से जुड़ी परतें हैं।

प्रशिक्षण के दौरान, प्रत्येक सेल के लिए जिसमें ग्राउंड ट्रुथ बाउंडिंग बॉक्स होता है, केवल ग्राउंड ट्रुथ के साथ उच्चतम IoU वाला अनुमानित बॉक्स ग्रेडिएंट डिसेंट के लिए उपयोग किया जाता है। निर्देशांक को ग्राउंड ट्रुथ तक पहुंचने के लिए प्रशिक्षित किया जाता है, सही वर्ग के लिए वर्ग संभावना को 1 की ओर धकेला जाता है, और अन्य वर्ग संभावनाओं को शून्य की ओर धकेला जाता है। यदि एक सेल में कोई ग्राउंड ट्रुथ वस्तु नहीं है, तो इसके विश्वास स्कोर शून्य की ओर प्रशिक्षित होते हैं, जिससे झूठी सकारात्मकताएं कम हो जाती हैं।

प्रभाव और विरासत

YOLO के एकल-पास डिजाइन ने इसे वास्तविक समय वस्तु पहचान में एक सफलता बना दिया, जिससे वीडियो निगरानी, स्वायत्त ड्राइविंग और रोबोटिक्स में अनुप्रयोग सक्षम हुए। इसकी गति और सरलता ने कई अनुवर्ती कार्यों और वेरिएंट को प्रेरित किया, जिससे कंप्यूटर विज़न में एक मौलिक मॉडल के रूप में इसकी जगह मजबूत हुई। मूल YOLO पेपर को व्यापक रूप से उद्धृत किया गया है, और ढांचा वास्तविक समय पहचान प्रणालियों के लिए एक बेंचमार्क बना हुआ है।

संबंधित अवधारणाएं

YOLO कन्वोल्यूशनल न्यूरल नेटवर्क पर बनाया गया है और बाद के संस्करणों में बैच सामान्यीकरण और डेटा संवर्धन जैसी तकनीकों से लाभान्वित होता है। इसका विकास गहन शिक्षण और मशीन लर्निंग के व्यापक क्षेत्र का हिस्सा है, जिसमें अन्य विज़न कार्यों के लिए अवशिष्ट नेटवर्क और U-Net भी शामिल हैं। YOLO की दक्षता ने एज डिवाइस और क्लाउड प्लेटफार्मों में कृत्रिम बुद्धिमत्ता अनुप्रयोगों को भी प्रभावित किया है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:object-detection·computer-vision·deep-learning·convolutional-neural-networks
इस पृष्ठ को अंतिम बार संपादित किया गया 9 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास