AlexNet एक कन्वोल्यूशनल न्यूरल नेटवर्क आर्किटेक्चर है जो छवि वर्गीकरण के लिए है, जिसे 2012 में एलेक्स क्रिज़ेव्स्की, इल्या सुत्स्केवर, और जेफ्री हिंटन द्वारा टोरंटो विश्वविद्यालय में विकसित किया गया था। यह छवियों को 1,000 वस्तु श्रेणियों में वर्गीकृत करता है और इसे दृश्य पहचान में गहरे कन्वोल्यूशनल नेटवर्क के पहले बड़े पैमाने के प्रदर्शन के रूप में व्यापक रूप से माना जाता है। ImageNet Large Scale Visual Recognition Challenge (ILSVRC) 2012 में इसकी निर्णायक जीत ने मशीन लर्निंग में एक महत्वपूर्ण मोड़ चिह्नित किया, जिसने डीप लर्निंग को आर्टिफिशियल इंटेलिजेंस अनुसंधान और उद्योग में तेजी से अपनाने को उत्प्रेरित किया।
मॉडल में 60 मिलियन पैरामीटर और 650,000 न्यूरॉन्स हैं। इसकी आर्किटेक्चर में आठ परतें हैं: पांच कन्वोल्यूशनल परतें (कुछ के बाद मैक्स-पूलिंग) और तीन पूरी तरह से जुड़ी परतें। नेटवर्क ने गैर-संतृप्त ReLU सक्रियण फ़ंक्शन का उपयोग किया, जिसने पारंपरिक tanh और sigmoid सक्रियणों की तुलना में प्रशिक्षण गति में सुधार किया। मेमोरी सीमाओं के कारण, नेटवर्क को दो GPUs में विभाजित किया गया था, जिसमें प्रत्येक प्रति आधे न्यूरॉन्स को संसाधित करती थी। अंतिम पूरी तरह से जुड़ी परत ने दोनों GPUs से आउटपुट को संयुक्त किया।
आर्किटेक्चर
AlexNet की संरचना को इस प्रकार संक्षेपित किया जा सकता है: (CONV → RN → MP)2 → (CONV3 → MP) → (FC → DO)2 → Linear → softmax। यहाँ, CONV ReLU सक्रियण के साथ एक कन्वोल्यूशनल परत को दर्शाता है, RN स्थानीय प्रतिक्रिया सामान्यीकरण है, MP मैक्स-पूलिंग है, FC ReLU के साथ एक पूरी तरह से जुड़ी परत है, Linear बिना सक्रियण के एक पूरी तरह से जुड़ी परत है, और DO ड्रॉपआउट है। विशेष रूप से, कन्वोल्यूशनल परतें 3, 4, और 5 बीच में पूलिंग या सामान्यीकरण के बिना अनुक्रमिक रूप से जुड़ी हुई थीं।
नेटवर्क ने ओवरफिटिंग को कम करने के लिए स्थानीय प्रतिक्रिया सामान्यीकरण और 0.5 की ड्रॉप संभावना के साथ ड्रॉपआउट नियमितीकरण का उपयोग किया। सभी वज़न को माध्य 0 और मानक विचलन 0.01 के साथ गाऊसी वितरण के रूप में प्रारंभ किया गया था। कन्वोल्यूशनल परतों 2, 4, 5 और सभी पूरी तरह से जुड़ी परतों में बायस को 1 पर प्रारंभ किया गया था ताकि मृत ReLU समस्या से बचा जा सके।
प्रशिक्षण
मॉडल को 1.2 मिलियन छवियों वाले ImageNet प्रशिक्षण सेट पर प्रशिक्षित किया गया था। प्रशिक्षण दो Nvidia GTX 580 GPUs (प्रत्येक 3GB) का उपयोग करके पांच से छह दिनों में 90 युगों तक चला, जिसका float32 में सैद्धांतिक प्रदर्शन 1.581 TFLOPS था। प्रत्येक फॉरवर्ड पास के लिए लगभग 1.43 GFLOPs की आवश्यकता थी। JPEG प्रारूप में संग्रहीत डेटासेट छवियों ने डिस्क स्थान के 27GB पर कब्जा कर लिया; नेटवर्क ने प्रशिक्षण के दौरान प्रत्येक GPU पर 2GB RAM और लगभग 5GB सिस्टम RAM का उपयोग किया। GPUs ने प्रशिक्षण संभाला जबकि CPUs ने छवि लोडिंग और डेटा वृद्धि की।
प्रशिक्षण ने 128 के बैच आकार, 0.9 के संवेग, और 0.0005 के वज़न क्षय के साथ संवेग ग्रेडिएंट डिसेंट का उपयोग किया। सीखने की दर 10⁻² पर शुरू हुई और जब भी सत्यापन त्रुटि स्थिर हो गई, इसे मैन्युअल रूप से 10 के कारक से कम किया गया, जो 10⁻⁵ पर समाप्त हुई। डेटा वृद्धि के दो रूप CPU पर तुरंत लागू किए गए, प्रभावी रूप से मुफ्त: पहले, छवियों को स्केल किया गया ताकि उनकी छोटी भुजा 256 पिक्सेल हो, फिर एक केंद्रीय 256×256 फसल ली गई और सामान्यीकृत की गई; दूसरे, 256×256 फसल से यादृच्छिक 224×224 पैच (और उनके क्षैतिज प्रतिबिंब) निकाले गए, जिससे प्रशिक्षण सेट का आकार 2048 गुना बढ़ गया। इसके अतिरिक्त, प्रत्येक छवि के RGB मानों को पिक्सेल रंग वितरण के प्रमुख घटकों के साथ यादृच्छिक रूप से स्थानांतरित किया गया।
ImageNet प्रतियोगिता
सुपरविज़न नामक टीम ने 30 सितंबर, 2012 को ILSVRC-2012 प्रतियोगिता में सात AlexNets का एक समूह प्रस्तुत किया। पांच नेटवर्क ने मानक आर्किटेक्चर का उपयोग किया, जबकि दो वेरिएंट में एक अतिरिक्त कन्वोल्यूशनल परत थी और ILSVRC-2012 प्रशिक्षण सेट पर फाइन-ट्यूनिंग से पहले बड़े ImageNet Fall 2011 रिलीज़ (15 मिलियन छवियां, 22,000 श्रेणियां) पर पूर्व-प्रशिक्षित किए गए थे। अंतिम भविष्यवाणी सभी सात नेटवर्कों से संभावनाओं का औसत थी। समूह ने 15.3% की शीर्ष-5 त्रुटि दर हासिल की, जो उपविजेता से 10.8 प्रतिशत अंक से अधिक बेहतर थी, एक नाटकीय सुधार जिसने कंप्यूटर विज़न समुदाय को चकित कर दिया।
प्रभाव और विरासत
AlexNet की सफलता ने बड़े पैमाने पर दृश्य पहचान के लिए गहरे कन्वोल्यूशनल नेटवर्क की शक्ति का प्रदर्शन किया, जिसने ResNet और U-Net जैसी बाद की आर्किटेक्चर को सीधे प्रभावित किया। इसने गहरे नेटवर्क के प्रशिक्षण के लिए GPUs के उपयोग को भी लोकप्रिय बनाया, एक अभ्यास जो क्षेत्र में मानक बन गया। पेपर में गहराई पर जोर और ReLU, ड्रॉपआउट, और डेटा वृद्धि की प्रभावशीलता ने आधुनिक डीप लर्निंग अभ्यास को आकार दिया। AlexNet को अक्सर डीप लर्निंग क्रांति के उत्प्रेरक के रूप में उद्धृत किया जाता है, जिससे जनरेटिव AI में सफलताएं और बड़े भाषा मॉडल और ट्रांसफॉर्मर का विकास हुआ। इसका प्रभाव शिक्षा से परे फैला, जिसने OpenAI, Google DeepMind, और Anthropic जैसी कंपनियों में AI अनुसंधान में निवेश को प्रेरित किया।