2012 का इमेजनेट लार्ज स्केल विज़ुअल रिकग्निशन चैलेंज (ILSVRC), एक वार्षिक Computer vision प्रतियोगिता जो ImageNet डेटासेट पर आधारित थी, AlexNet द्वारा जीती गई थी, जो टोरंटो विश्वविद्यालय में एलेक्स क्रिज़ेव्स्की, इल्या सुत्स्केवर और जेफ्री हिंटन द्वारा विकसित एक गहरा कन्वोल्यूशनल न्यूरल नेटवर्क था। इस परिणाम को व्यापक रूप से वह एकमात्र घटना माना जाता है जिसने आधुनिक डीप लर्निंग युग की शुरुआत की।
प्रतियोगिता
ILSVRC, जो 2010 से वार्षिक रूप से चल रहा था, प्रतिभागियों को इमेजनेट के लगभग 1.2 मिलियन लेबल किए गए प्रशिक्षण फोटोग्राफों से छवियों को 1,000 वस्तु श्रेणियों में वर्गीकृत करने का कार्य देता था, और छवि पहचान में प्रगति के लिए मानक बेंचमार्क बन गया था। 2010 और 2011 की प्रविष्टियाँ मुख्य रूप से हाथ से इंजीनियर की गई फीचर निष्कर्षण विधियों और शास्त्रीय मशीन-लर्निंग क्लासिफायर पर निर्भर थीं, और साल-दर-साल त्रुटि दर में सुधार वृद्धिशील था, आम तौर पर कुछ प्रतिशत अंक।
एलेक्सनेट का परिणाम
एलेक्स क्रिज़ेव्स्की की प्रविष्टि, जिसे उनकी टीम ने लगभग एक सप्ताह में दो उपभोक्ता GPU का उपयोग करके प्रशिक्षित किया, ने 15.3% की शीर्ष-5 त्रुटि दर हासिल की, जो दूसरे स्थान की प्रविष्टि के 26.2% से नाटकीय सुधार था, लगभग दस प्रतिशत अंकों का अंतर जिसने कंप्यूटर-विज़न अनुसंधान समुदाय को चकित कर दिया, जिनमें से अधिकांश गहरे तंत्रिका नेटवर्क दृष्टिकोण का उपयोग नहीं कर रहे थे। एलेक्सनेट की वास्तुकला में कई कन्वोल्यूशनल परतें, ReLU सक्रियण फ़ंक्शन, ड्रॉपआउट नियमितीकरण और डेटा संवर्धन शामिल थे, ऐसी तकनीकें जो व्यक्तिगत रूप से ज्ञात थीं लेकिन पहले इस पैमाने पर संयुक्त नहीं की गई थीं और GPU हार्डवेयर पर सफलतापूर्वक प्रशिक्षित नहीं की गई थीं, जो आंशिक रूप से NVIDIA के CUDA प्लेटफ़ॉर्म द्वारा संभव हुआ।
परिणाम और प्रभाव
प्रतिस्पर्धी तरीकों पर एलेक्सनेट के अंतर के पैमाने ने लगभग दो वर्षों के भीतर एआई अनुसंधान की दिशा बदल दी: कंप्यूटर विज़न अनुसंधान लगभग पूरी तरह से तंत्रिका नेटवर्क दृष्टिकोणों की ओर स्थानांतरित हो गया, और बड़े लेबल किए गए डेटासेट, GPU कंप्यूट और गहरी वास्तुकला का प्रदर्शित संयोजन वह टेम्पलेट बन गया जिसका पालन प्राकृतिक भाषा प्रसंस्करण और अन्य डोमेन में बाद की प्रगति करेगी। बाद के ILSVRC विजेताओं ने बढ़ती गहराई के साथ गहरे कन्वोल्यूशनल नेटवर्क का उपयोग जारी रखा, और 2015 तक बेंचमार्क पर त्रुटि दर अनुमानित मानव प्रदर्शन से नीचे गिर गई थी, जिससे प्रतियोगिता के आयोजकों को वर्गीकरण ट्रैक को प्रभावी रूप से हल किए जाने के रूप में सेवानिवृत्त करने के लिए प्रेरित किया। 2012 का परिणाम आम तौर पर मूल Backpropagation कार्य और बाद के ट्रांसफॉर्मर पेपर के साथ, उन कुछ तकनीकी परिणामों में से एक के रूप में उद्धृत किया जाता है जो डीप लर्निंग बूम के लिए सबसे अधिक जिम्मेदार हैं जिसने 2020 के दशक के बड़े भाषा मॉडल का निर्माण किया, और इसने 2024 के नोबेल पुरस्कार से वर्षों पहले हिंटन की क्षेत्र के एक केंद्रीय व्यक्ति के रूप में प्रतिष्ठा को मजबूत किया।