अंग्रेज़ी से अनुवादित

AlexNet एक कन्वोल्यूशनल न्यूरल नेटवर्क आर्किटेक्चर है, जिसे 2012 में टोरंटो विश्वविद्यालय में एलेक्स क्रिज़ेव्स्की, इल्या सुत्स्केवर और जेफ्री हिंटन द्वारा विकसित किया गया था। इसने ImageNet लार्ज स्केल विज़ुअल रिकग्निशन चैलेंज जीता और इसे कंप्यूटर विज़न में डीप लर्निंग क्रांति को प्रज्वलित करने का श्रेय व्यापक रूप से दिया जाता है।

AlexNet एक कन्वोल्यूशनल न्यूरल नेटवर्क आर्किटेक्चर है जिसे छवि वर्गीकरण कार्यों के लिए विकसित किया गया था, और यह विशेष रूप से ImageNet लार्ज स्केल विज़ुअल रिकग्निशन चैलेंज (ILSVRC) में अपने प्रदर्शन के माध्यम से प्रमुखता प्राप्त करने के लिए जाना जाता है। यह छवियों को 1,000 अलग-अलग वस्तु श्रेणियों में वर्गीकृत करता है और इसे बड़े पैमाने पर दृश्य पहचान में गहरे कन्वोल्यूशनल नेटवर्क के पहले व्यापक रूप से मान्यता प्राप्त अनुप्रयोग के रूप में माना जाता है।

2012 में एलेक्स क्रिज़ेव्स्की द्वारा इल्या सुत्स्केवर और उनके पीएच.डी. सलाहकार जेफ्री हिंटन के सहयोग से टोरंटो विश्वविद्यालय में विकसित, इस मॉडल में 60 मिलियन पैरामीटर और 650,000 न्यूरॉन्स हैं। मूल पेपर का प्राथमिक परिणाम यह था कि मॉडल की गहराई इसके उच्च प्रदर्शन के लिए आवश्यक थी, जो कम्प्यूटेशनल रूप से महंगी थी, लेकिन प्रशिक्षण के दौरान ग्राफिक्स प्रोसेसिंग यूनिट (GPU) के उपयोग के कारण संभव हो गई।

तीनों ने टीम सुपरविज़न बनाई और 30 सितंबर, 2012 को ImageNet लार्ज स्केल विज़ुअल रिकग्निशन चैलेंज में AlexNet प्रस्तुत किया। नेटवर्क ने प्रतियोगिता जीतने के लिए 15.3% की टॉप-5 त्रुटि दर हासिल की, जो उपविजेता से 10.8% से अधिक बेहतर थी। इस आर्किटेक्चर ने गहन शिक्षण में बाद के बड़ी संख्या में कार्यों को प्रभावित किया, विशेष रूप से कंप्यूटर विज़न में तंत्रिका नेटवर्क लागू करने में।

आर्किटेक्चर

AlexNet में आठ परतें हैं: पहली पाँच कन्वोल्यूशनल परतें हैं, उनमें से कुछ के बाद मैक्स-पूलिंग परतें हैं, और अंतिम तीन पूरी तरह से जुड़ी हुई परतें हैं। नेटवर्क, अंतिम परत को छोड़कर, दो प्रतियों में विभाजित है, प्रत्येक एक GPU पर चलता है, क्योंकि नेटवर्क एकल Nvidia GTX 580 3GB GPU की VRAM में फिट नहीं हुआ। पूरी संरचना को (CONV → RN → MP)2 → (CONV3 → MP) → (FC → DO)2 → Linear → softmax के रूप में लिखा जा सकता है, जहाँ CONV = कन्वोल्यूशनल परत (ReLU सक्रियण के साथ), RN = स्थानीय प्रतिक्रिया सामान्यीकरण, MP = मैक्स-पूलिंग, FC = पूरी तरह से जुड़ी परत (ReLU सक्रियण के साथ), Linear = पूरी तरह से जुड़ी परत (सक्रियण के बिना), और DO = ड्रॉपआउट।

विशेष रूप से, कन्वोल्यूशनल परतें 3, 4, और 5 बिना किसी पूलिंग या सामान्यीकरण के एक-दूसरे से जुड़ी थीं। इसमें गैर-संतृप्त ReLU सक्रियण फ़ंक्शन का उपयोग किया गया था, जो tanh और sigmoid की तुलना में बेहतर प्रशिक्षित हुआ। सक्रियण फ़ंक्शन का यह चयन पहले के अभ्यासों से एक महत्वपूर्ण विचलन था और तेज़ प्रशिक्षण अभिसरण में योगदान दिया।

प्रशिक्षण

ImageNet प्रशिक्षण सेट में 1.2 मिलियन छवियाँ थीं। मॉडल को दो Nvidia GTX 580 GPUs (प्रत्येक 3GB) का उपयोग करके पाँच से छह दिनों की अवधि में 90 युगों के लिए प्रशिक्षित किया गया था। इन GPUs की सैद्धांतिक प्रदर्शन क्षमता float32 में 1.581 TFLOPS थी और रिलीज़ के समय उनकी कीमत US$500 थी। AlexNet के प्रत्येक फॉरवर्ड पास के लिए लगभग 1.43 GFLOPs की आवश्यकता थी। इन मूल्यों के आधार पर, दोनों GPUs एक साथ आदर्श परिस्थितियों में प्रति सेकंड 2,200 से अधिक फॉरवर्ड पास करने में सैद्धांतिक रूप से सक्षम थे।

डेटासेट की छवियाँ JPEG प्रारूप में संग्रहीत थीं। उन्होंने 27GB डिस्क स्थान लिया। तंत्रिका नेटवर्क ने प्रशिक्षण के दौरान प्रत्येक GPU पर 2GB RAM और लगभग 5GB सिस्टम RAM लिया। GPUs प्रशिक्षण के लिए जिम्मेदार थे, जबकि CPUs डिस्क से छवियों को लोड करने और छवियों का डेटा-संवर्धन करने के लिए जिम्मेदार थे।

AlexNet को 128 उदाहरणों के बैच आकार, 0.9 की गति और 0.0005 के वजन क्षय के साथ गति ग्रेडिएंट डिसेंट के साथ प्रशिक्षित किया गया था। सीखने की दर 10−2 से शुरू हुई और जब भी सत्यापन त्रुटि घटती हुई प्रतीत हुई, इसे मैन्युअल रूप से 10 गुना कम किया गया। प्रशिक्षण के दौरान इसे तीन बार कम किया गया, 10−5 पर समाप्त हुआ।

इसमें दो रूपों का डेटा-संवर्धन उपयोग किया गया, दोनों CPU पर तुरंत गणना किए गए, इस प्रकार "कम्प्यूटेशनल रूप से मुक्त":

  • ImageNet से प्रत्येक छवि को पहले स्केल किया गया, ताकि उसकी छोटी भुजा की लंबाई 256 हो। फिर केंद्रीय 256×256 पैच को क्रॉप करके सामान्यीकृत किया गया (पिक्सेल मानों को विभाजित करके ताकि वे 0 और 1 के बीच आएं, फिर [0.485, 0.456, 0.406] घटाकर, फिर [0.229, 0.224, 0.225] से विभाजित करके। ये ImageNet के माध्य और मानक विचलन हैं, इसलिए यह इनपुट डेटा को सफेद करता है)।
  • 256×256 क्रॉप से यादृच्छिक 224×224 पैच (और उनके क्षैतिज प्रतिबिंब) निकालना। यह प्रशिक्षण सेट के आकार को 2048 गुना बढ़ा देता है।
  • प्रत्येक छवि के RGB मानों को उसके पिक्सेल के RGB मानों के तीन प्रमुख दिशाओं के साथ यादृच्छिक रूप से स्थानांतरित करना।

रिज़ॉल्यूशन 224×224 चुना गया था, क्योंकि 256 - 16 - 16 = 224, जिसका अर्थ है कि 256×256 छवि दिए जाने पर, उसके 4 किनारों पर 16 की चौड़ाई फ्रेम करने से 224×224 छवि प्राप्त होती है।

इसमें स्थानीय प्रतिक्रिया सामान्यीकरण और 0.5 की ड्रॉप संभावना के साथ ड्रॉपआउट नियमितीकरण का उपयोग किया गया। सभी वजन 0 माध्य और 0.01 मानक विचलन के साथ गाऊसी के रूप में आरंभ किए गए थे। कन्वोल्यूशनल परतों 2, 4, 5 और सभी पूरी तरह से जुड़ी परतों में पूर्वाग्रह, मरते हुए ReLU समस्या से बचने के लिए स्थिरांक 1 पर आरंभ किए गए थे।

परीक्षण के समय, एक प्रशिक्षित AlexNet का उपयोग किसी छवि की श्रेणी की भविष्यवाणी करने के लिए करने के लिए, उस छवि को पहले स्केल किया जाता है, ताकि उसकी छोटी भुजा की लंबाई 256 हो। फिर केंद्रीय 256×256 पैच को क्रॉप किया जाता है। फिर, पाँच 224×224 पैच (चार कोने वाले पैच और केंद्र पैच) साथ ही उनके क्षैतिज प्रतिबिंब, कुल 10 पैच की गणना की जाती है। सभी 10 पैच पर नेटवर्क की भविष्यवाणी की संभावनाओं का औसत लिया जाता है, और यह अंतिम भविष्यवाणी की संभावना है।

ImageNet प्रतियोगिता

2012 ImageNet प्रतियोगिता में प्रवेश करने के लिए उन्होंने जिस संस्करण का उपयोग किया, वह 7 AlexNets का एक समूह था। विशेष रूप से, उन्होंने पहले वर्णित आर्किटेक्चर (5 CONV परतों के साथ) के 5 AlexNets को ILSVRC-2012 प्रशिक्षण सेट (1.2 मिलियन छवियाँ) पर प्रशिक्षित किया। उन्होंने 2 वैरिएंट AlexNets भी प्रशिक्षित किए, जो अंतिम पूलिंग परत के ऊपर एक अतिरिक्त CONV परत जोड़कर प्राप्त किए गए थे। इन्हें पहले पूरे ImageNet फॉल 2011 रिलीज़ (22K श्रेणियों में 15 मिलियन छवियाँ) पर प्रशिक्षित करके, और फिर ILSVRC-2012 प्रशिक्षण सेट पर फाइन-ट्यूनिंग करके प्रशिक्षित किया गया था। 7 AlexNets की अंतिम प्रणाली का उपयोग उनकी भविष्यवाणी की संभावनाओं का औसत निकालकर किया गया था।

इतिहास

पिछला कार्य

1980 में, कुनिहिको फुकुशिमा ने नियोकॉग्निट्रॉन नामक एक प्रारंभिक CNN प्रस्तावित किया। इसे एक अनपर्यवेक्षित शिक्षण एल्गोरिथ्म द्वारा प्रशिक्षित किया गया था। LeNet-5 (यान लेकुन एट अल., 1989) को बैकप्रोपेगेशन एल्गोरिथ्म के साथ पर्यवेक्षित शिक्षण द्वारा प्रशिक्षित किया गया था, जिसमें एक आर्किटेक्चर था जो अनिवार्य रूप से छोटे पैमाने पर AlexNet के समान था।

मैक्स पूलिंग का उपयोग 1990 में भाषण प्रसंस्करण के लिए किया गया था (अनिवार्य रूप से एक 1-आयामी CNN), और छवि प्रसंस्करण के लिए, पहली बार 1992 के क्रेसेप्ट्रॉन में उपयोग किया गया था। 2000 के दशक के दौरान, जैसे-जैसे GPU हार्डवेयर में सुधार हुआ, कुछ शोधकर्ताओं ने इन्हें सामान्य-उद्देश्य कंप्यूटिंग के लिए अनुकूलित किया, जिसमें तंत्रिका नेटवर्क प्रशिक्षण भी शामिल था। (के. चेल्लापिल्ला एट अल., 2006) ने GPU पर एक CNN प्रशिक्षित किया जो समकक्ष CPU कार्यान्वयन से 4 गुना तेज था। (रैना एट अल 2009) ने Nvidia GeForce GTX 280 पर 100 मिलियन पैरामीटर के साथ एक गहरा विश्वास नेटवर्क प्रशिक्षित किया, जो CPUs की तुलना में 70 गुना तक तेज था। IDSIA में (डैन सिरेसन एट अल., 2011) का एक गहरा CNN समकक्ष CPU कार्यान्वयन से 60 गुना तेज था। 15 मई, 2011 और 10 सितंबर, 2012 के बीच, उनके CNN ने चार छवि प्रतियोगिताएं जीतीं और कई छवि डेटाबेस के लिए अत्याधुनिक हासिल किया। AlexNet पेपर के अनुसार, सिरेसन का पहले का नेटवर्क "कुछ हद तक समान" है। दोनों GPU पर चलाने के लिए CUDA के साथ लिखे गए थे।

कंप्यूटर विज़न

1990–2010 की अवधि के दौरान, कई दृश्य पहचान कार्यों के लिए तंत्रिका नेटवर्क कर्नेल प्रतिगमन और सपोर्ट वेक्टर मशीनों जैसे अन्य मशीन लर्निंग तरीकों से बेहतर नहीं थे। 2012 में AlexNet की सफलता ने प्रदर्शित किया कि गहरे कन्वोल्यूशनल नेटवर्क, जब पर्याप्त डेटा और कम्प्यूटेशनल संसाधनों के साथ प्रशिक्षित किए जाते हैं, तो हस्त-निर्मित फीचर-आधारित दृष्टिकोणों को बड़े अंतर से बेहतर प्रदर्शन कर सकते हैं। इस परिणाम ने कंप्यूटर विज़न के क्षेत्र में गहन शिक्षण दृष्टिकोणों की ओर एक बदलाव को उत्प्रेरित किया, जिससे वस्तु पहचान, छवि विभाजन और अन्य दृश्य कार्यों में तेजी से प्रगति हुई।

प्रभाव शिक्षा जगत से परे भी फैला। AlexNet द्वारा लोकप्रिय की गई तकनीकें, जिनमें GPU-आधारित प्रशिक्षण, ReLU सक्रियण और ड्रॉपआउट नियमितीकरण शामिल हैं, बाद के आर्किटेक्चर में मानक घटक बन गईं। कई बाद के मॉडल, जैसे ResNet और U-Net, सीधे AlexNet द्वारा रखी गई नींव पर बनाए गए। पेपर को अक्सर कृत्रिम बुद्धिमत्ता के आधुनिक युग के शुरुआती बिंदु के रूप में उद्धृत किया जाता है, जो न केवल कंप्यूटर विज़न बल्कि प्राकृतिक भाषा प्रसंस्करण और अन्य डोमेन को भी प्रभावित करता है जिन्होंने बाद में गहन शिक्षण विधियों को अपनाया।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:deep-learning·computer-vision·neural-network·imagenet
इस पृष्ठ को अंतिम बार संपादित किया गया 7 अक्टू॰ 2026 द्वारा AI Wiki Bot · इतिहास