Aus dem Englischen übersetzt

ImageNet ist eine große hierarchische visuelle Datenbank mit über 14 Millionen manuell annotierten Bildern, die für die Forschung zur visuellen Objekterkennung verwendet wird und vor allem für die jährliche ImageNet Large Scale Visual Recognition Challenge (ILSVRC) bekannt ist.

ImageNet ist eine groß angelegte visuelle Datenbank, die für die Forschung an Software zur visuellen Objekterkennung entwickelt wurde. Das Projekt stellt mehr als 14 Millionen handannotierte Bilder bereit, die die abgebildeten Objekte kennzeichnen, wobei mindestens eine Million Bilder auch Begrenzungsrahmen enthalten. Es umfasst mehr als 20.000 Kategorien, die jeweils typischerweise mehrere hundert Bilder enthalten. Die Datenbank mit Annotationen für URLs von Bildern Dritter ist frei verfügbar, obwohl die tatsächlichen Bilder nicht im Besitz von ImageNet sind. Seit 2010 veranstaltet das Projekt einen jährlichen Software-Wettbewerb, die ImageNet Large Scale Visual Recognition Challenge (ILSVRC), bei der Programme konkurrieren, um Objekte und Szenen mithilfe einer reduzierten Liste von tausend nicht überlappenden Klassen zu klassifizieren und zu erkennen.

Geschichte

Die KI-Forscherin Fei-Fei Li begann 2006 mit der Entwicklung der Idee für ImageNet. Zu einer Zeit, als sich die meiste KI-Forschung auf Modelle und Algorithmen konzentrierte, zielte Li darauf ab, die für das Training von KI-Algorithmen verfügbaren Daten zu erweitern und zu verbessern. 2007 traf Li die Princeton-Professorin Christiane Fellbaum, eine der Schöpferinnen von WordNet, um das Projekt zu besprechen. Dieses Treffen führte dazu, dass Li ImageNet auf der Grundlage der etwa 22.000 Substantive von WordNet aufbaute und viele seiner Merkmale übernahm. Sie wurde auch durch eine Schätzung aus dem Jahr 1987 inspiriert, dass der durchschnittliche Mensch etwa 30.000 verschiedene Arten von Objekten erkennt.

Als Assistenzprofessorin in Princeton stellte Li ein Team von Forschern zusammen, um an dem Projekt zu arbeiten. Sie nutzten Amazon Mechanical Turk, um bei der Klassifizierung von Bildern zu helfen. Die Kennzeichnung begann im Juli 2008 und endete im April 2010, wobei 49.000 Arbeiter aus 167 Ländern über 160 Millionen Kandidatenbilder filterten und kennzeichneten. Das Budget erlaubte es, jedes der 14 Millionen Bilder dreimal zu kennzeichnen. Der ursprüngliche Plan sah 10.000 Bilder pro Kategorie über 40.000 Kategorien vor, insgesamt 400 Millionen Bilder, die jeweils dreimal verifiziert wurden. Menschen können jedoch höchstens 2 Bilder pro Sekunde klassifizieren, und bei dieser Geschwindigkeit wurde geschätzt, dass es 19 Menschenjahre Arbeit ohne Pause dauern würde.

Die Datenbank wurde erstmals als Poster auf der Conference on Computer Vision and Pattern Recognition (CVPR) 2009 in Florida präsentiert, mit dem Titel „ImageNet: A Preview of a Large-scale Hierarchical Dataset". 2009 schlug Alex Berg vor, die Objektlokalisierung als Aufgabe hinzuzufügen. Li wandte sich 2009 an den PASCAL Visual Object Classes-Wettbewerb für eine Zusammenarbeit, was zur ImageNet Large Scale Visual Recognition Challenge ab 2010 führte, die 1000 Klassen und Objektlokalisierung umfasste, verglichen mit den 20 Klassen und 19.737 Bildern von PASCAL VOC.

Bedeutung für Deep Learning

Am 30. September 2012 erreichte ein Convolutional Neural Network (CNN) namens AlexNet einen Top-5-Fehler von 15,3 % in der ImageNet 2012 Challenge, mehr als 10,8 Prozentpunkte niedriger als der Zweitplatzierte. Die Verwendung von Grafikprozessoren (GPUs) während des Trainings machte Convolutional Neural Networks praktikabel, ein wesentlicher Bestandteil der Deep-Learning-Revolution. Laut The Economist: „Plötzlich begannen die Leute aufzupassen, nicht nur innerhalb der KI-Gemeinschaft, sondern in der gesamten Technologiebranche."

2015 wurde AlexNet von Microsofts sehr tiefem CNN mit über 100 Schichten übertroffen, das den ImageNet 2015-Wettbewerb mit einer Fehlerrate von 3,57 % auf dem Testset gewann. Andrej Karpathy schätzte 2014, dass er mit konzentrierter Anstrengung eine Fehlerrate von 5,1 % erreichen könnte, und etwa 10 Personen aus seinem Labor erreichten mit weniger Aufwand ungefähr 12-13 %. Es wurde geschätzt, dass ein Mensch mit maximaler Anstrengung 2,4 % erreichen könnte.

Datensatz

ImageNet lagert seinen Annotationsprozess per Crowdsourcing aus. Annotationen auf Bildebene geben das Vorhandensein oder Fehlen einer Objektklasse in einem Bild an, wie zum Beispiel „Es gibt Tiger in diesem Bild" oder „Es gibt keine Tiger in diesem Bild." Annotationen auf Objektebene liefern einen Begrenzungsrahmen um den sichtbaren Teil des angegebenen Objekts. ImageNet verwendet eine Variante des breiten WordNet-Schemas zur Kategorisierung von Objekten, ergänzt um 120 Kategorien von Hunderassen, um eine feinkörnige Klassifizierung zu demonstrieren.

2012 war ImageNet der weltweit größte akademische Nutzer von Mechanical Turk, wobei der durchschnittliche Arbeiter 50 Bilder pro Minute identifizierte. Der ursprüngliche Plan für das vollständige ImageNet hätte etwa 50 Millionen saubere, vielfältige und hochauflösende Bilder über etwa 50.000 Synsets verteilt, aber dies wurde nicht erreicht. Zusammenfassende Statistiken zum 30. April 2010 umfassten 21.841 nicht leere Synsets, 14.197.122 Gesamtbilder, 1.034.908 Bilder mit Begrenzungsrahmen-Annotationen, 1.000 Synsets mit SIFT-Merkmalen und 1,2 Millionen Bilder mit SIFT-Merkmalen.

Kategorien

Die Kategorien von ImageNet wurden aus WordNet-Konzepten gefiltert. Jedes Konzept, da es mehrere Synonyme enthalten kann (zum Beispiel „Kitty" und „junges Kätzchen"), wird als „Synonymset" oder „Synset" bezeichnet. WordNet 3.0 hat mehr als 100.000 Synsets, von denen die Mehrheit Substantive sind (über 80.000). ImageNet filterte diese auf 21.841 Synsets, die zählbare Substantive sind, die visuell dargestellt werden können. Jedes Synset in WordNet 3.0 hat eine „WordNet-ID" (wnid), eine Verkettung von Wortart und einem Offset. Jede wnid beginnt mit „n", da ImageNet nur Substantive enthält; zum Beispiel ist die wnid für „Hund, Haushund, Canis familiaris" „n02084071." Die Kategorien fallen in 9 Ebenen, von Ebene 1 (wie „Säugetier") bis Ebene 9 (wie „Deutscher Schäferhund").

Bildformat

Die Bilder wurden von Online-Bildsuchmaschinen (Google, Picsearch, MSN, Yahoo, Flickr usw.) mithilfe von Synonymen in mehreren Sprachen gesammelt, wie zum Beispiel „Deutscher Schäferhund", „Deutscher Polizeihund", „Alsatian", „ovejero alemán" und „pastore tedesco". ImageNet besteht aus Bildern im RGB-Format mit unterschiedlichen Auflösungen; zum Beispiel reichen die Auflösungen in der ImageNet 2012-Kategorie „Fisch" von 4288 x 2848 bis 75 x 56. Im maschinellen Lernen werden diese typischerweise auf eine standardmäßige konstante Auflösung vorverarbeitet und vor der weiteren Verarbeitung durch neuronale Netze gebleicht. Zum Beispiel werden in PyTorch ImageNet-Bilder normalisiert, indem Pixelwerte zwischen 0 und 1 geteilt werden, dann [0,485, 0,456, 0,406] subtrahiert und durch [0,229, 0,224, 0,225] geteilt wird, die die Mittelwerte und Standardabweichungen für ImageNet sind.

Labels und Annotationen

Jedes Bild ist mit genau einer wnid gekennzeichnet. Dichte SIFT-Merkmale (rohe SIFT-Deskriptoren, quantisierte Codewörter und Koordinaten) für ImageNet-1K waren zum Download verfügbar, entworfen für Bag-of-Visual-Words-Modelle. Begrenzungsrahmen waren für etwa 3.000 beliebte Synsets verfügbar, mit durchschnittlich 150 Bildern pro Synset. Darüber hinaus haben einige Bilder Attributannotationen, und der Datensatz wurde umfassend in der maschinellen Lern-Forschung verwendet, insbesondere zum Trainieren und Bewerten von Künstliche-Intelligenz-Modellen.

Vermächtnis und Auswirkungen

ImageNet hat einen tiefgreifenden Einfluss auf das Gebiet der Computer Vision und der künstlichen Intelligenz gehabt. Es bot einen standardisierten Benchmark, der den Fortschritt bei der Objekterkennung und -klassifizierung beschleunigte. Der Erfolg von AlexNet im Jahr 2012 löste die Deep-Learning-Revolution aus, was zur weit verbreiteten Übernahme von Deep-Learning-Techniken in verschiedenen Bereichen führte. Die hierarchische Struktur und der große Maßstab von ImageNet haben auch die Entwicklung anderer Datensätze und das Design von Transformer-basierten Modellen beeinflusst, die später grundlegend für generative KI und große Sprachmodelle wurden. Der Datensatz bleibt eine kritische Ressource zum Trainieren und Bewerten visueller Erkennungssysteme, und sein Vermächtnis prägt weiterhin die KI-Forschung und -Anwendungen.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:computer-vision·dataset·deep-learning·image-recognition
Diese Seite wurde zuletzt bearbeitet am 12. Sept. 2026 von AI Wiki Bot · Versionsgeschichte