अंग्रेज़ी से अनुवादित

AlexNet एक गहरा कन्वोल्यूशनल न्यूरल नेटवर्क है, जिसे 2012 में टोरंटो विश्वविद्यालय में एलेक्स क्रिज़ेव्स्की, इल्या सुत्स्केवर और जेफ्री हिंटन द्वारा विकसित किया गया था। इसने ImageNet लार्ज स्केल विज़ुअल रिकग्निशन चैलेंज में 15.3% की टॉप-5 त्रुटि दर के साथ जीत हासिल की, जिसने कंप्यूटर विज़न के लिए गहन शिक्षण को महत्वपूर्ण रूप से आगे बढ़ाया।

AlexNet एक कन्वोल्यूशनल न्यूरल नेटवर्क वास्तुकला है जिसे छवि वर्गीकरण के लिए डिज़ाइन किया गया है, जिसने विशेष रूप से ImageNet Large Scale Visual Recognition Challenge (ILSVRC) में अपने प्रदर्शन के माध्यम से प्रमुखता प्राप्त की। यह छवियों को 1,000 विशिष्ट वस्तु श्रेणियों में वर्गीकृत करता है और इसे बड़े पैमाने पर दृश्य पहचान में गहरे कन्वोल्यूशनल नेटवर्क का पहला व्यापक रूप से मान्यता प्राप्त अनुप्रयोग माना जाता है।

2012 में एलेक्स क्रिज़ेव्स्की द्वारा इल्या सुत्स्केवर और उनके पीएच.डी. सलाहकार जेफ्री हिंटन के सहयोग से टोरंटो विश्वविद्यालय में विकसित, इस मॉडल में 60 मिलियन पैरामीटर और 650,000 न्यूरॉन हैं। मूल पेपर का प्राथमिक परिणाम यह था कि मॉडल की गहराई इसके उच्च प्रदर्शन के लिए आवश्यक थी, जो कम्प्यूटेशनल रूप से महंगी थी लेकिन प्रशिक्षण के दौरान ग्राफिक्स प्रोसेसिंग यूनिट (GPU) का उपयोग करके संभव बनाई गई।

Architecture

AlexNet में आठ परतें हैं: पहली पाँच कन्वोल्यूशनल परतें हैं, कुछ के बाद मैक्स-पूलिंग परतें हैं, और अंतिम तीन पूरी तरह से जुड़ी हुई परतें हैं। नेटवर्क, अंतिम परत को छोड़कर, दो प्रतियों में विभाजित है, प्रत्येक एक GPU पर चलता है, क्योंकि नेटवर्क एकल Nvidia GTX 580 3GB GPU की VRAM में फिट नहीं हुआ। पूरी संरचना को (CONV → RN → MP)2 → (CONV3 → MP) → (FC → DO)2 → Linear → softmax के रूप में लिखा जा सकता है, जहाँ CONV = कन्वोल्यूशनल परत (ReLU सक्रियण के साथ), RN = स्थानीय प्रतिक्रिया सामान्यीकरण, MP = मैक्स-पूलिंग, FC = पूरी तरह से जुड़ी परत (ReLU सक्रियण के साथ), Linear = पूरी तरह से जुड़ी परत (सक्रियण के बिना), और DO = ड्रॉपआउट।

विशेष रूप से, कन्वोल्यूशनल परतें 3, 4, और 5 एक दूसरे से बिना किसी पूलिंग या सामान्यीकरण के जुड़ी हुई थीं। इसने गैर-संतृप्त ReLU सक्रियण फ़ंक्शन का उपयोग किया, जो tanh और sigmoid से बेहतर प्रशिक्षित हुआ। इस वास्तुकला ने गहन शिक्षण में बाद के बड़ी संख्या में कार्यों को प्रभावित किया, विशेष रूप से कंप्यूटर विज़न में न्यूरल नेटवर्क लागू करने में।

Training

ImageNet प्रशिक्षण सेट में 1.2 मिलियन छवियाँ थीं। मॉडल को दो Nvidia GTX 580 GPUs (प्रत्येक 3GB) का उपयोग करके पाँच से छह दिनों की अवधि में 90 युगों के लिए प्रशिक्षित किया गया था। इन GPUs की float32 में सैद्धांतिक प्रदर्शन 1.581 TFLOPS है और रिलीज़ के समय इनकी कीमत US$500 थी। AlexNet के प्रत्येक फॉरवर्ड पास के लिए लगभग 1.43 GFLOPs की आवश्यकता थी। इन मूल्यों के आधार पर, दो GPUs सैद्धांतिक रूप से आदर्श परिस्थितियों में प्रति सेकंड 2,200 से अधिक फॉरवर्ड पास करने में सक्षम थे।

डेटासेट की छवियाँ JPEG प्रारूप में संग्रहीत थीं, जो डिस्क पर 27GB लेती थीं। प्रशिक्षण के दौरान न्यूरल नेटवर्क प्रत्येक GPU पर 2GB RAM और लगभग 5GB सिस्टम RAM लेता था। GPUs प्रशिक्षण के लिए जिम्मेदार थे, जबकि CPUs डिस्क से छवियाँ लोड करने और छवियों का डेटा-वर्धन करने के लिए जिम्मेदार थे।

AlexNet को 128 उदाहरणों के बैच आकार, 0.9 के संवेग, और 0.0005 के वेट डेके के साथ संवेग ग्रेडिएंट डिसेंट के साथ प्रशिक्षित किया गया था। सीखने की दर 10−2 से शुरू हुई और जब भी सत्यापन त्रुटि घटती हुई प्रतीत हुई, इसे मैन्युअल रूप से 10 गुना घटाया गया; प्रशिक्षण के दौरान इसे तीन बार घटाया गया, 10−5 पर समाप्त हुआ।

इसने दो प्रकार के डेटा वर्धन का उपयोग किया, दोनों CPU पर तुरंत गणना किए गए, इस प्रकार "कम्प्यूटेशनल रूप से मुफ्त":

  • ImageNet की प्रत्येक छवि को पहले इस प्रकार स्केल किया गया कि उसकी छोटी भुजा की लंबाई 256 हो। फिर केंद्रीय 256×256 पैच को क्रॉप करके सामान्यीकृत किया गया (पिक्सेल मानों को विभाजित करके ताकि वे 0 और 1 के बीच आएं, फिर [0.485, 0.456, 0.406] घटाकर, फिर [0.229, 0.224, 0.225] से विभाजित करके)। ये ImageNet के माध्य और मानक विचलन हैं, इसलिए यह इनपुट डेटा को सफेद करता है।
  • 256×256 क्रॉप से यादृच्छिक 224×224 पैच (और उनके क्षैतिज प्रतिबिंब) निकालने से प्रशिक्षण सेट का आकार 2048 गुना बढ़ जाता है।
  • प्रत्येक छवि के RGB मान को उसके पिक्सेल के RGB मानों की तीन प्रमुख दिशाओं के साथ यादृच्छिक रूप से स्थानांतरित करना।

रिज़ॉल्यूशन 224×224 इसलिए चुना गया क्योंकि 256 - 16 - 16 = 224, जिसका अर्थ है कि 256×256 छवि दी गई, इसके 4 किनारों पर 16 की चौड़ाई फ्रेम करने से 224×224 छवि प्राप्त होती है।

इसने स्थानीय प्रतिक्रिया सामान्यीकरण और ड्रॉपआउट नियमितीकरण का उपयोग 0.5 की ड्रॉप संभावना के साथ किया। सभी वेट्स को 0 माध्य और 0.01 मानक विचलन के साथ गाऊसी के रूप में आरंभ किया गया। कन्वोल्यूशनल परतों 2, 4, 5 और सभी पूरी तरह से जुड़ी परतों में बायस को मरते हुए ReLU समस्या से बचने के लिए स्थिरांक 1 पर आरंभ किया गया।

परीक्षण के समय, प्रशिक्षित AlexNet का उपयोग किसी छवि की श्रेणी की भविष्यवाणी करने के लिए करने के लिए, उस छवि को पहले इस प्रकार स्केल किया जाता है कि उसकी छोटी भुजा की लंबाई 256 हो। फिर केंद्रीय 256×256 पैच को क्रॉप किया जाता है। फिर, पाँच 224×224 पैच (चार कोने वाले पैच और केंद्र पैच) और साथ ही उनके क्षैतिज प्रतिबिंब, कुल 10 पैच, की गणना की जाती है। सभी 10 पैच पर नेटवर्क की भविष्यवाणी की संभावनाओं का औसत लिया जाता है, और यही अंतिम भविष्यवाणी की संभावना है।

ImageNet competition

2012 ImageNet प्रतियोगिता में प्रवेश करने के लिए उपयोग किया गया संस्करण 7 AlexNets का एक समूह था। विशेष रूप से, उन्होंने पहले वर्णित वास्तुकला (5 CONV परतों के साथ) के 5 AlexNets को ILSVRC-2012 प्रशिक्षण सेट (1.2 मिलियन छवियाँ) पर प्रशिक्षित किया। उन्होंने 2 भिन्न AlexNets भी प्रशिक्षित किए, जो अंतिम पूलिंग परत के ऊपर एक अतिरिक्त CONV परत जोड़कर प्राप्त किए गए थे। इन्हें पहले पूरे ImageNet Fall 2011 रिलीज़ (22K श्रेणियों में 15 मिलियन छवियाँ) पर प्रशिक्षित करके, और फिर इसे ILSVRC-2012 प्रशिक्षण सेट पर फाइन-ट्यून करके प्रशिक्षित किया गया। 7 AlexNets की अंतिम प्रणाली का उपयोग उनकी भविष्यवाणी की संभावनाओं का औसत लेकर किया गया।

तीनों ने टीम SuperVision बनाई और 30 सितंबर, 2012 को ImageNet Large Scale Visual Recognition Challenge में AlexNet प्रस्तुत किया। नेटवर्क ने प्रतियोगिता जीतने के लिए 15.3% की शीर्ष-5 त्रुटि दर हासिल की, जो उपविजेता से 10.8% से अधिक बेहतर थी।

History

Previous work

1980 में, कुनिहिको फुकुशिमा ने नियोकॉग्निट्रॉन नामक एक प्रारंभिक CNN प्रस्तावित किया, जिसे एक अनुपयोगी शिक्षण एल्गोरिथ्म द्वारा प्रशिक्षित किया गया था। LeNet-5 (यान लेकुन एट अल., 1989) को बैकप्रोपेगेशन एल्गोरिथ्म के साथ पर्यवेक्षित शिक्षण द्वारा प्रशिक्षित किया गया था, जिसकी वास्तुकला अनिवार्य रूप से छोटे पैमाने पर AlexNet के समान थी। मैक्स पूलिंग का उपयोग 1990 में भाषण प्रसंस्करण के लिए (अनिवार्य रूप से 1-आयामी CNN) किया गया था, और छवि प्रसंस्करण के लिए, पहली बार 1992 के क्रेस्सेप्ट्रॉन में उपयोग किया गया था।

2000 के दशक के दौरान, जैसे-जैसे GPU हार्डवेयर में सुधार हुआ, कुछ शोधकर्ताओं ने इन्हें सामान्य-उद्देश्यीय कंप्यूटिंग के लिए अनुकूलित किया, जिसमें न्यूरल नेटवर्क प्रशिक्षण भी शामिल था। के. चेल्लापिल्ला एट अल. (2006) ने GPU पर एक CNN प्रशिक्षित किया जो समकक्ष CPU कार्यान्वयन से 4 गुना तेज था। रैना एट अल. (2009) ने Nvidia GeForce GTX 280 पर 100 मिलियन पैरामीटर के साथ एक गहरा विश्वास नेटवर्क प्रशिक्षित किया, जो CPUs से 70 गुना तक तेज था। IDSIA में डैन सिरेसन एट अल. (2011) का एक गहरा CNN समकक्ष CPU कार्यान्वयन से 60 गुना तेज था। 15 मई, 2011 और 10 सितंबर, 2012 के बीच, उनके CNN ने चार छवि प्रतियोगिताएं जीतीं और कई छवि डेटाबेस के लिए अत्याधुनिक हासिल किया। AlexNet पेपर के अनुसार, सिरेसन का पहले का नेटवर्क "कुछ हद तक समान" है। दोनों GPU पर चलाने के लिए CUDA में लिखे गए थे।

Computer vision

1990–2010 की अवधि के दौरान, न्यूरल नेटवर्क कर्नेल प्रतिगमन और सपोर्ट वेक्टर मशीनों जैसे अन्य मशीन लर्निंग तरीकों से बेहतर नहीं थे। 2012 ILSVRC में AlexNet की सफलता ने एक महत्वपूर्ण मोड़ चिह्नित किया, यह प्रदर्शित करते हुए कि गहरे CNNs पारंपरिक दृष्टिकोणों से बड़े अंतर से बेहतर प्रदर्शन कर सकते हैं, जिससे कंप्यूटर विज़न और उससे परे गहन शिक्षण का व्यापक रूप से अपनाना हुआ।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:convolutional-neural-networks·deep-learning·computer-vision·imagenet
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास