अंग्रेज़ी से अनुवादित

AlexNet एक गहरा कन्वोल्यूशनल न्यूरल नेटवर्क है, जिसे 2012 में टोरंटो विश्वविद्यालय में एलेक्स क्रिज़ेव्स्की, इल्या सुत्स्केवर और जेफ्री हिंटन द्वारा विकसित किया गया था। इसने ImageNet लार्ज स्केल विज़ुअल रिकग्निशन चैलेंज में 15.3% की टॉप-5 त्रुटि दर के साथ जीत हासिल की, जिससे कंप्यूटर विज़न के लिए गहन शिक्षण में महत्वपूर्ण प्रगति हुई।

AlexNet एक कन्वोल्यूशनल न्यूरल नेटवर्क आर्किटेक्चर है जिसे छवि वर्गीकरण के लिए डिज़ाइन किया गया है, जिसे 2012 में एलेक्स क्रिज़ेव्स्की, इल्या सुत्स्केवर और जेफ्री हिंटन द्वारा टोरंटो विश्वविद्यालय में विकसित किया गया था। यह छवियों को 1,000 अलग-अलग वस्तु श्रेणियों में वर्गीकृत करता है और इसे दृश्य पहचान में गहरे कन्वोल्यूशनल नेटवर्क के पहले बड़े पैमाने पर प्रदर्शन के रूप में व्यापक रूप से मान्यता प्राप्त है। मॉडल में 60 मिलियन पैरामीटर और 650,000 न्यूरॉन्स हैं, और इसकी गहराई इसके उच्च प्रदर्शन के लिए आवश्यक थी, जो प्रशिक्षण के दौरान ग्राफिक्स प्रोसेसिंग यूनिट्स (GPU) का उपयोग करके संभव हुई।

तीन शोधकर्ताओं ने टीम सुपरविज़न का गठन किया और 30 सितंबर, 2012 को इमेजनेट लार्ज स्केल विज़ुअल रिकग्निशन चैलेंज (ILSVRC) में AlexNet प्रस्तुत किया। नेटवर्क ने 15.3% की शीर्ष-5 त्रुटि दर हासिल की, जिससे उपविजेता से 10.8% से अधिक के अंतर से प्रतियोगिता जीती। यह परिणाम गहन शिक्षण के लिए एक महत्वपूर्ण मोड़ था, जिसने कंप्यूटर विज़न और कृत्रिम बुद्धिमत्ता में बाद के बड़े पैमाने पर कार्यों को प्रभावित किया।

आर्किटेक्चर

AlexNet में आठ परतें होती हैं: पहली पाँच कन्वोल्यूशनल परतें हैं, कुछ के बाद मैक्स-पूलिंग परतें होती हैं, और अंतिम तीन पूरी तरह से जुड़ी हुई परतें हैं। नेटवर्क, अंतिम परत को छोड़कर, दो प्रतियों में विभाजित है, प्रत्येक एक GPU पर चलता है, क्योंकि यह एकल Nvidia GTX 580 के 3GB VRAM में फिट नहीं होता था। संरचना को (CONV → RN → MP)2 → (CONV3 → MP) → (FC → DO)2 → Linear → softmax के रूप में लिखा जा सकता है, जहाँ CONV ReLU सक्रियण के साथ एक कन्वोल्यूशनल परत है, RN स्थानीय प्रतिक्रिया सामान्यीकरण है, MP मैक्स-पूलिंग है, FC ReLU के साथ एक पूरी तरह से जुड़ी परत है, Linear बिना सक्रियण के एक पूरी तरह से जुड़ी परत है, और DO ड्रॉपआउट है।

विशेष रूप से, कन्वोल्यूशनल परतें 3, 4 और 5 बिना पूलिंग या सामान्यीकरण के जुड़ी हुई हैं। AlexNet ने गैर-संतृप्त ReLU सक्रियण फ़ंक्शन का उपयोग किया, जो tanh और sigmoid से बेहतर प्रशिक्षित हुआ। यह विकल्प इसकी प्रशिक्षण दक्षता में एक प्रमुख कारक था।

प्रशिक्षण

इमेजनेट प्रशिक्षण सेट में 1.2 मिलियन छवियाँ थीं। मॉडल को दो Nvidia GTX 580 GPU (3GB प्रत्येक) का उपयोग करके पाँच से छह दिनों में 90 युगों के लिए प्रशिक्षित किया गया था, जिनकी सैद्धांतिक प्रदर्शन float32 में 1.581 TFLOPS थी और रिलीज़ पर US$500 मूल्य थे। प्रत्येक फॉरवर्ड पास के लिए लगभग 1.43 GFLOPs की आवश्यकता थी, इसलिए दो GPU आदर्श परिस्थितियों में सैद्धांतिक रूप से प्रति सेकंड 2,200 से अधिक फॉरवर्ड पास कर सकते थे।

डेटासेट छवियाँ JPEG प्रारूप में संग्रहीत थीं, जो 27GB डिस्क स्थान लेती थीं। न्यूरल नेटवर्क ने प्रशिक्षण के दौरान प्रत्येक GPU पर 2GB RAM और लगभग 5GB सिस्टम RAM का उपयोग किया। GPU ने प्रशिक्षण संभाला, जबकि CPU ने डिस्क से छवियाँ लोड कीं और डेटा संवर्धन किया।

AlexNet को 128 उदाहरणों के बैच आकार, 0.9 की गति और 0.0005 के वजन क्षय के साथ गति ग्रेडिएंट डिसेंट के साथ प्रशिक्षित किया गया था। सीखने की दर 10−2 से शुरू हुई और जब भी सत्यापन त्रुटि कम होना बंद लगती थी, मैन्युअल रूप से 10 गुना घटाई जाती थी, तीन बार घटाकर 10−5 पर समाप्त हुई। डेटा संवर्धन के दो रूप CPU पर तुरंत गणना किए गए, जिससे वे "कम्प्यूटेशनल रूप से मुक्त" हो गए: पहले, प्रत्येक छवि को स्केल किया गया ताकि इसकी छोटी भुजा 256 पिक्सेल हो, फिर केंद्रीय 256×256 पैच को क्रॉप और सामान्यीकृत किया गया; दूसरे, यादृच्छिक 224×224 पैच (और उनके क्षैतिज प्रतिबिंब) निकाले गए, जिससे प्रशिक्षण सेट का आकार 2048 गुना बढ़ गया। इसके अतिरिक्त, RGB मानों को पिक्सेल मानों की मुख्य दिशाओं के साथ यादृच्छिक रूप से स्थानांतरित किया गया।

रिज़ॉल्यूशन 224×224 चुना गया क्योंकि 256 - 16 - 16 = 224, जिसका अर्थ है कि 256×256 छवि के प्रत्येक तरफ 16 पिक्सेल फ्रेम करने से 224×224 छवि प्राप्त होती है। AlexNet ने स्थानीय प्रतिक्रिया सामान्यीकरण और 0.5 की ड्रॉप संभावना के साथ ड्रॉपआउट नियमितीकरण का उपयोग किया। सभी वजनों को माध्य 0 और मानक विचलन 0.01 के साथ गाऊसी के रूप में प्रारंभ किया गया था, और कन्वोल्यूशनल परतों 2, 4, 5 और सभी पूरी तरह से जुड़ी परतों में बायस को मरते हुए ReLU समस्या से बचने के लिए स्थिरांक 1 पर प्रारंभ किया गया था।

परीक्षण के समय, एक छवि को स्केल किया जाता है ताकि इसकी छोटी भुजा 256 हो, केंद्रीय 256×256 पैच क्रॉप किया जाता है, और फिर पाँच 224×224 पैच (चार कोने और केंद्र) और उनके क्षैतिज प्रतिबिंब गणना किए जाते हैं, जिससे 10 पैच मिलते हैं। अंतिम भविष्यवाणी उत्पन्न करने के लिए सभी 10 पैच पर नेटवर्क की भविष्यवाणी की संभावनाओं का औसत लिया जाता है।

इमेजनेट प्रतियोगिता

2012 इमेजनेट प्रतियोगिता के लिए उपयोग किया गया संस्करण सात AlexNets का एक समूह था। मानक आर्किटेक्चर के पाँच AlexNets को ILSVRC-2012 प्रशिक्षण सेट पर प्रशिक्षित किया गया था। दो संस्करण AlexNets भी प्रशिक्षित किए गए थे, प्रत्येक में अंतिम पूलिंग परत पर एक अतिरिक्त कन्वोल्यूशनल परत थी, पहले पूरे इमेजनेट फॉल 2011 रिलीज़ (22K श्रेणियों में 15 मिलियन छवियाँ) पर और फिर ILSVRC-2012 प्रशिक्षण सेट पर बारीक-ट्यून किया गया। अंतिम प्रणाली ने सभी सात नेटवर्कों की भविष्यवाणी की संभावनाओं का औसत लिया।

इतिहास

पिछला कार्य

1980 में, कुनिहिको फुकुशिमा ने नियोकॉग्निट्रॉन नामक एक प्रारंभिक CNN प्रस्तावित किया, जिसे अनुपर्यवेक्षित शिक्षण द्वारा प्रशिक्षित किया गया था। LeNet-5, जिसे 1989 में यान लेकुन एट अल. द्वारा विकसित किया गया था, ने बैकप्रॉपैगेशन के साथ पर्यवेक्षित शिक्षण का उपयोग किया और छोटे पैमाने पर मूल रूप से AlexNet के समान आर्किटेक्चर था। मैक्स पूलिंग का उपयोग 1990 में भाषण प्रसंस्करण के लिए और पहली बार 1992 के क्रेसेप्ट्रॉन में छवि प्रसंस्करण के लिए किया गया था।

2000 के दशक के दौरान, जैसे-जैसे GPU हार्डवेयर में सुधार हुआ, शोधकर्ताओं ने GPU को सामान्य-उद्देश्यीय कंप्यूटिंग के लिए अनुकूलित किया, जिसमें न्यूरल नेटवर्क प्रशिक्षण शामिल था। 2006 में, के. चेल्लापिल्ला एट अल. ने GPU पर एक CNN प्रशिक्षित किया जो समकक्ष CPU कार्यान्वयन से 4 गुना तेज था। 2009 में, रैना एट अल. ने Nvidia GeForce GTX 280 पर 100 मिलियन पैरामीटर के साथ एक गहरा विश्वास नेटवर्क प्रशिक्षित किया, जो CPU से 70 गुना तक तेज था। 2011 में IDSIA में डैन सिरेसन एट अल. द्वारा एक गहरा CNN समकक्ष CPU कार्यान्वयन से 60 गुना तेज था, और 15 मई, 2011 और 10 सितंबर, 2012 के बीच, उनके CNN ने चार छवि प्रतियोगिताएं जीतीं और कई डेटाबेस पर अत्याधुनिक परिणाम प्राप्त किए। AlexNet पेपर के अनुसार, सिरेसन का पहले का नेटवर्क AlexNet के "कुछ हद तक समान" है, और दोनों GPU पर चलाने के लिए CUDA के साथ लिखे गए थे।

कंप्यूटर विज़न

1990–2010 की अवधि के दौरान, न्यूरल नेटवर्क कर्नेल रिग्रेशन और सपोर्ट वेक्टर मशीनों जैसे अन्य मशीन लर्निंग तरीकों से बेहतर नहीं थे। 2012 में AlexNet की सफलता ने कंप्यूटर विज़न के लिए गहन शिक्षण की शक्ति का प्रदर्शन किया, जिससे CNN का व्यापक रूप से अपनाना और अवशिष्ट नेटवर्क जैसे बाद के आर्किटेक्चर का विकास हुआ। इसने मशीन लर्निंग के लिए GPU-आधारित कंप्यूटिंग में रुचि भी बढ़ाई और AI में एक प्रमुख दृष्टिकोण के रूप में गहन शिक्षण के उदय में योगदान दिया।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:deep-learning·computer-vision·neural-network·image-classification
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास