Die ImageNet Large Scale Visual Recognition Challenge (ILSVRC) 2012, ein jährlicher Wettbewerb für maschinelles Sehen, der auf dem ImageNet-Datensatz aufbaut, wurde von AlexNet gewonnen, einem tiefen faltenden neuronalen Netzwerk, das von Alex Krizhevsky, Ilya Sutskever und Geoffrey Hinton an der Universität Toronto entwickelt wurde. Dieses Ergebnis wird weithin als das Ereignis angesehen, das die moderne Deep-Learning-Ära einleitete.
Der Wettbewerb
Die ILSVRC, die seit 2010 jährlich stattfindet, stellte die Teilnehmer vor die Aufgabe, Bilder aus den etwa 1,2 Millionen beschrifteten Trainingsfotos von ImageNet in eine von 1.000 Objektkategorien einzuordnen, und hatte sich zum Standard-Benchmark für Fortschritte in der Bilderkennung entwickelt. Die Beiträge von 2010 und 2011 stützten sich überwiegend auf manuell entwickelte Merkmalsextraktionsmethoden in Kombination mit klassischen maschinellen Lernklassifikatoren, und die Verbesserungen der Fehlerraten im Jahresvergleich waren inkrementell, in der Regel einige Prozentpunkte.
AlexNets Ergebnis
Der Beitrag von Alex Krizhevsky, der von seinem Team mit zwei handelsüblichen GPUs über etwa eine Woche trainiert wurde, erreichte eine Top-5-Fehlerrate von 15,3 %, eine dramatische Verbesserung gegenüber den 26,2 % des zweitplatzierten Beitrags, eine Lücke von fast zehn Prozentpunkten, die die Forschungsgemeinschaft für maschinelles Sehen verblüffte, die größtenteils keine Ansätze mit tiefen neuronalen Netzwerken verwendet hatte. Die Architektur von AlexNet kombinierte mehrere Faltungsschichten, die ReLU-Aktivierungsfunktion, Dropout-Regularisierung und Datenaugmentierung - Techniken, die einzeln bekannt waren, aber zuvor nicht in diesem Umfang kombiniert und erfolgreich auf GPU-Hardware trainiert worden waren, was teilweise durch die CUDA-Plattform von NVIDIA ermöglicht wurde.
Nachwirkungen und Einfluss
Das Ausmaß des Vorsprungs von AlexNet gegenüber konkurrierenden Methoden veränderte die Entwicklung der KI-Forschung innerhalb von etwa zwei Jahren: Die Forschung im Bereich des maschinellen Sehens verlagerte sich fast vollständig auf neuronale Netzwerk-Ansätze, und die demonstrierte Kombination aus großen beschrifteten Datensätzen, GPU-Rechenleistung und tiefen Architekturen wurde zur Vorlage, der spätere Fortschritte in der Verarbeitung natürlicher Sprache und anderen Bereichen folgen sollten. Nachfolgende ILSVRC-Gewinner verwendeten weiterhin tiefe faltende Netzwerke mit zunehmender Tiefe, und bis 2015 fielen die Fehlerraten auf dem Benchmark unter die geschätzte menschliche Leistung, was die Organisatoren des Wettbewerbs dazu veranlasste, die Klassifizierungsstrecke als praktisch gelöst zu beenden. Das Ergebnis von 2012 wird häufig zusammen mit der ursprünglichen Backpropagation-Arbeit und dem späteren Transformer-Paper als eines der wenigen technischen Ergebnisse genannt, die am meisten für den Deep-Learning-Boom verantwortlich sind, der die großen Sprachmodelle der 2020er-Jahre hervorbrachte, und es festigte Hintons Ruf als zentrale Figur des Feldes Jahre vor seinem Nobelpreis 2024.