एलेक्सनेट लैंडमार्क पेपर

अंग्रेज़ी से अनुवादित

AlexNet, एक गहरा कन्वोल्यूशनल न्यूरल नेटवर्क, जिसे 2012 में एलेक्स क्रिज़ेव्स्की, इल्या सुत्स्केवर और जेफ्री हिंटन द्वारा विकसित किया गया था, ने ImageNet चुनौती में 15.3% की शीर्ष-5 त्रुटि दर के साथ जीत हासिल की, जिसने कंप्यूटर विज़न में [[deep-learning]] क्रांति को जन्म दिया।

AlexNet एक कन्वोल्यूशनल न्यूरल नेटवर्क आर्किटेक्चर है जिसे छवि वर्गीकरण के लिए विकसित किया गया था, और यह विशेष रूप से ImageNet Large Scale Visual Recognition Challenge (ILSVRC) में अपने प्रदर्शन के माध्यम से प्रमुखता प्राप्त करता है। यह छवियों को 1,000 अलग-अलग वस्तु श्रेणियों में वर्गीकृत करता है और इसे बड़े पैमाने पर दृश्य पहचान में गहरे कन्वोल्यूशनल नेटवर्क के पहले व्यापक रूप से मान्यता प्राप्त अनुप्रयोग के रूप में माना जाता है। 2012 में एलेक्स क्रिज़ेव्स्की द्वारा इल्या सुत्स्केवर और उनके पीएच.डी. सलाहकार जेफ्री हिंटन के सहयोग से टोरंटो विश्वविद्यालय में विकसित, इस मॉडल में 60 मिलियन पैरामीटर और 650,000 न्यूरॉन्स हैं। मूल पेपर का प्राथमिक परिणाम यह था कि मॉडल की गहराई इसके उच्च प्रदर्शन के लिए आवश्यक थी, जो कम्प्यूटेशनल रूप से महंगा था लेकिन प्रशिक्षण के दौरान ग्राफिक्स प्रोसेसिंग यूनिट (GPU) के उपयोग के कारण संभव हुआ।

तीनों ने टीम सुपरविज़न का गठन किया और 30 सितंबर, 2012 को ImageNet Large Scale Visual Recognition Challenge में AlexNet प्रस्तुत किया। नेटवर्क ने प्रतियोगिता जीतने के लिए 15.3% की शीर्ष-5 त्रुटि दर हासिल की, जो उपविजेता से 10.8% से अधिक बेहतर थी। इस आर्किटेक्चर ने गहन शिक्षण में बाद के कई कार्यों को प्रभावित किया, विशेष रूप से तंत्रिका नेटवर्क को कंप्यूटर दृष्टि में लागू करने में।

आर्किटेक्चर

AlexNet में आठ परतें हैं: पहली पांच कन्वोल्यूशनल परतें हैं, उनमें से कुछ के बाद मैक्स-पूलिंग परतें हैं, और अंतिम तीन पूरी तरह से जुड़ी हुई परतें हैं। नेटवर्क, अंतिम परत को छोड़कर, दो प्रतियों में विभाजित है, प्रत्येक एक GPU पर चलता है, क्योंकि नेटवर्क एकल Nvidia GTX 580 3GB GPU की VRAM में फिट नहीं हुआ। पूरी संरचना को (CONV → RN → MP)2 → (CONV3 → MP) → (FC → DO)2 → Linear → softmax के रूप में लिखा जा सकता है, जहां CONV = कन्वोल्यूशनल परत (ReLU सक्रियण के साथ), RN = स्थानीय प्रतिक्रिया सामान्यीकरण, MP = मैक्स-पूलिंग, FC = पूरी तरह से जुड़ी परत (ReLU सक्रियण के साथ), Linear = पूरी तरह से जुड़ी परत (सक्रियण के बिना), और DO = ड्रॉपआउट।

विशेष रूप से, कन्वोल्यूशनल परतें 3, 4, और 5 बिना किसी पूलिंग या सामान्यीकरण के एक दूसरे से जुड़ी थीं। इसने गैर-संतृप्त ReLU सक्रियण फ़ंक्शन का उपयोग किया, जो tanh और sigmoid से बेहतर प्रशिक्षित हुआ। यह विकल्प तेज़ प्रशिक्षण और बेहतर प्रदर्शन को सक्षम करने में एक प्रमुख कारक था।

प्रशिक्षण

ImageNet प्रशिक्षण सेट में 1.2 मिलियन छवियां थीं। मॉडल को दो Nvidia GTX 580 GPU (3GB प्रत्येक) का उपयोग करके पांच से छह दिनों की अवधि में 90 युगों के लिए प्रशिक्षित किया गया था। इन GPU की सैद्धांतिक प्रदर्शन float32 में 1.581 TFLOPS थी और रिलीज़ पर उनकी कीमत US$500 थी। AlexNet के प्रत्येक फॉरवर्ड पास के लिए लगभग 1.43 GFLOPs की आवश्यकता थी। इन मूल्यों के आधार पर, दो GPU एक साथ आदर्श परिस्थितियों में प्रति सेकंड 2,200 से अधिक फॉरवर्ड पास करने में सैद्धांतिक रूप से सक्षम थे।

डेटासेट छवियां JPEG प्रारूप में संग्रहीत की गई थीं, जो डिस्क पर 27GB लेती थीं। तंत्रिका नेटवर्क ने प्रशिक्षण के दौरान प्रत्येक GPU पर 2GB RAM और लगभग 5GB सिस्टम RAM ली। GPU प्रशिक्षण के लिए जिम्मेदार थे, जबकि CPU डिस्क से छवियों को लोड करने और छवियों पर डेटा-वृद्धि करने के लिए जिम्मेदार थे।

AlexNet को 128 उदाहरणों के बैच आकार, 0.9 की गति, और 0.0005 के वजन क्षय के साथ गति ग्रेडिएंट डिसेंट के साथ प्रशिक्षित किया गया था। सीखने की दर 10−2 से शुरू हुई और जब भी सत्यापन त्रुटि घटती हुई प्रतीत हुई, मैन्युअल रूप से 10 गुना कम की गई। प्रशिक्षण के दौरान इसे तीन बार कम किया गया, 10−5 पर समाप्त हुआ।

इसने दो रूपों के डेटा वृद्धि का उपयोग किया, दोनों CPU पर तुरंत गणना की गई, इस प्रकार "कम्प्यूटेशनल रूप से मुक्त":

  • ImageNet से प्रत्येक छवि को पहले स्केल किया गया ताकि इसकी छोटी भुजा की लंबाई 256 हो। फिर केंद्रीय 256×256 पैच को क्रॉप किया गया और सामान्यीकृत किया गया (पिक्सेल मानों को विभाजित करना ताकि वे 0 और 1 के बीच हों, फिर [0.485, 0.456, 0.406] घटाना, फिर [0.229, 0.224, 0.225] से विभाजित करना। ये ImageNet के लिए माध्य और मानक विचलन हैं, इसलिए यह इनपुट डेटा को सफेद करता है)।
  • 256×256 क्रॉप से यादृच्छिक 224×224 पैच (और उनके क्षैतिज प्रतिबिंब) निकालना। यह प्रशिक्षण सेट का आकार 2048 गुना बढ़ाता है।
  • प्रत्येक छवि के RGB मानों को उसके पिक्सेल के RGB मानों के तीन प्रमुख दिशाओं के साथ यादृच्छिक रूप से स्थानांतरित करना।

रिज़ॉल्यूशन 224×224 चुना गया क्योंकि 256 - 16 - 16 = 224, जिसका अर्थ है कि 256×256 छवि दिए जाने पर, इसके 4 किनारों पर 16 की चौड़ाई फ्रेम करने से 224×224 छवि बनती है।

इसने स्थानीय प्रतिक्रिया सामान्यीकरण और ड्रॉपआउट नियमितीकरण का उपयोग किया जिसमें ड्रॉप संभावना 0.5 थी। सभी वजन 0 माध्य और 0.01 मानक विचलन के साथ गाऊसी के रूप में आरंभ किए गए थे। कन्वोल्यूशनल परतों 2, 4, 5 और सभी पूरी तरह से जुड़ी परतों में पूर्वाग्रह मरते हुए ReLU समस्या से बचने के लिए स्थिर 1 पर आरंभ किए गए थे।

परीक्षण के समय, किसी छवि के वर्ग की भविष्यवाणी करने के लिए प्रशिक्षित AlexNet का उपयोग करने के लिए, उस छवि को पहले स्केल किया जाता है ताकि उसकी छोटी भुजा की लंबाई 256 हो। फिर केंद्रीय 256×256 पैच को क्रॉप किया जाता है। फिर, पांच 224×224 पैच (चार कोने पैच और केंद्र पैच) साथ ही उनके क्षैतिज प्रतिबिंब, कुल 10 पैच की गणना की जाती है। सभी 10 पैच पर नेटवर्क की अनुमानित संभावनाओं का औसत लिया जाता है, और यह अंतिम अनुमानित संभावना है।

ImageNet प्रतियोगिता

2012 ImageNet प्रतियोगिता में प्रवेश करने के लिए उपयोग किया गया संस्करण 7 AlexNets का एक समूह था। विशेष रूप से, उन्होंने ILSVRC-2012 प्रशिक्षण सेट (1.2 मिलियन छवियां) पर पहले वर्णित आर्किटेक्चर (5 CONV परतों के साथ) के 5 AlexNets प्रशिक्षित किए। उन्होंने अंतिम पूलिंग परत पर एक अतिरिक्त CONV परत जोड़कर प्राप्त 2 संस्करण AlexNets भी प्रशिक्षित किए। इन्हें पहले पूरे ImageNet Fall 2011 रिलीज़ (22K श्रेणियों में 15 मिलियन छवियां) पर प्रशिक्षित करके, फिर ILSVRC-2012 प्रशिक्षण सेट पर फाइन-ट्यूनिंग करके प्रशिक्षित किया गया था। 7 AlexNets की अंतिम प्रणाली का उपयोग उनकी अनुमानित संभावनाओं का औसत करके किया गया था।

इतिहास

पिछला कार्य

1980 में, कुनिहिको फुकुशिमा ने नियोकॉग्निट्रॉन नामक एक प्रारंभिक CNN प्रस्तावित किया। इसे एक अनपर्यवेक्षित शिक्षण एल्गोरिदम द्वारा प्रशिक्षित किया गया था। LeNet-5 (यान लेकुन एट अल., 1989) को बैकप्रोपेगेशन एल्गोरिदम के साथ पर्यवेक्षित शिक्षण द्वारा प्रशिक्षित किया गया था, जिसमें एक आर्किटेक्चर था जो अनिवार्य रूप से छोटे पैमाने पर AlexNet के समान था। मैक्स पूलिंग का उपयोग 1990 में भाषण प्रसंस्करण के लिए किया गया था (अनिवार्य रूप से एक 1-आयामी CNN), और छवि प्रसंस्करण के लिए, पहली बार 1992 के क्रेसेप्ट्रॉन में उपयोग किया गया था।

2000 के दशक के दौरान, जैसे-जैसे GPU हार्डवेयर में सुधार हुआ, कुछ शोधकर्ताओं ने इन्हें सामान्य-उद्देश्य कंप्यूटिंग के लिए अनुकूलित किया, जिसमें तंत्रिका नेटवर्क प्रशिक्षण शामिल था। के. चेल्लापिल्ला एट अल. (2006) ने GPU पर एक CNN प्रशिक्षित किया जो समकक्ष CPU कार्यान्वयन से 4 गुना तेज था। रैना एट अल. (2009) ने Nvidia GeForce GTX 280 पर 100 मिलियन पैरामीटर के साथ एक गहरी विश्वास नेटवर्क प्रशिक्षित किया, जो CPU से 70 गुना तक तेज था। IDSIA में डैन सिरेसन एट अल. (2011) का एक गहरा CNN समकक्ष CPU कार्यान्वयन से 60 गुना तेज था। 15 मई, 2011 और 10 सितंबर, 2012 के बीच, उनके CNN ने चार छवि प्रतियोगिताएं जीतीं और कई छवि डेटाबेस के लिए अत्याधुनिक हासिल किया। AlexNet पेपर के अनुसार, सिरेसन का पहले का नेटवर्क "कुछ हद तक समान" है। दोनों GPU पर चलाने के लिए CUDA के साथ लिखे गए थे।

कंप्यूटर दृष्टि

1990–2010 की अवधि के दौरान, तंत्रिका नेटवर्क कर्नेल प्रतिगमन, सपोर्ट वेक्टर मशीन और अन्य शास्त्रीय तकनीकों जैसे अन्य मशीन-शिक्षण तरीकों से बेहतर नहीं थे। ILSVRC-2012 में AlexNet की निर्णायक जीत ने प्रदर्शित किया कि गहरे CNN इन तरीकों से बड़े अंतर से बेहतर प्रदर्शन कर सकते हैं, जिससे कंप्यूटर दृष्टि में एक प्रतिमान बदलाव आया। आर्किटेक्चर की सफलता ने क्षेत्र में गहन शिक्षण के तेजी से अपनाने को प्रेरित किया, जिससे ResNet और कई अन्य जैसे बाद के आर्किटेक्चर प्रभावित हुए।

विरासत

AlexNet का प्रभाव कंप्यूटर दृष्टि से परे फैला, जिसने व्यापक कृत्रिम-बुद्धिमत्ता उछाल को उत्प्रेरित किया। इसने बड़े पैमाने पर गहन शिक्षण की प्रभावशीलता प्रदर्शित की, GPU-आधारित कंप्यूटिंग में निवेश और CUDA जैसे ढांचे के विकास को प्रोत्साहित किया। गहरे CNN के सिद्धांत, जिसमें पदानुक्रमित फीचर सीखना शामिल है, बाद में अन्य डोमेन में अनुकूलित किए गए, जिसमें ट्रांसफॉर्मर और बड़े भाषा मॉडल के साथ प्राकृतिक भाषा प्रसंस्करण शामिल है। पेपर क्षेत्र में सबसे अधिक उद्धृत में से एक बना हुआ है, और इसके लेखक - क्रिज़ेव्स्की, सुत्स्केवर, और हिंटन - प्रभावशाली करियर पर आगे बढ़े, सुत्स्केवर ने OpenAI की सह-स्थापना की और हिंटन AI अनुसंधान में एक प्रमुख व्यक्ति बन गए।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:deep-learning·computer-vision·neural-network·imagenet
इस पृष्ठ को अंतिम बार संपादित किया गया 9 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास