Der CIFAR-10-Datensatz (Canadian Institute For Advanced Research) ist eine Sammlung von 60.000 niedrig aufgelösten Farbbildern, die zum Trainieren und Bewerten von Algorithmen des maschinellen Lernens und der Computer Vision verwendet wird. Er wurde 2009 veröffentlicht und hat sich zu einem der am weitesten verbreiteten Benchmarks in diesem Bereich entwickelt, der es Forschern ermöglicht, verschiedene Ansätze zur Objekterkennung schnell zu testen. Der Datensatz besteht aus 32x32-Pixel-Bildern in 10 Klassen - Flugzeuge, Autos, Vögel, Katzen, Hirsche, Hunde, Frösche, Pferde, Schiffe und Lastwagen - mit 6.000 Bildern pro Klasse.
CIFAR-10 ist eine beschriftete Teilmenge des 80-Millionen-Tiny-Images-Datensatzes aus dem Jahr 2008. Als der Datensatz erstellt wurde, wurden Studenten dafür bezahlt, alle Bilder zu beschriften. Da die Bilder eine niedrige Auflösung haben, ermöglicht der Datensatz eine schnelle Erprobung verschiedener Algorithmen, was ihn zu einem Standardausgangspunkt für Forscher macht, die neue Techniken im Bereich maschinelles Lernen und künstliche Intelligenz entwickeln.
Dataset-Struktur
Die 60.000 Bilder werden in der Regel in 50.000 Trainingsbilder und 10.000 Testbilder aufgeteilt. Jedes Bild ist ein 32x32-Farbfoto mit drei Kanälen (Rot, Grün, Blau), was insgesamt 3.072 Pixel pro Bild ergibt. Die 10 Klassen schließen sich gegenseitig aus - jedes Bild gehört zu genau einer Kategorie. Die geringe Bildgröße unterscheidet CIFAR-10 von höher aufgelösten Datensätzen wie ImageNet, das Bilder mit einer durchschnittlichen Auflösung von 469x387 enthält.
Rolle in der Forschung zum maschinellen Lernen
Computer-Algorithmen zur Erkennung von Objekten in Fotos lernen oft anhand von Beispielen, und CIFAR-10 bietet einen standardisierten Satz von Beispielen für diesen Zweck. Verschiedene Arten von Convolutional Neural Networks erweisen sich in der Regel als am besten geeignet, um die Bilder in CIFAR-10 zu erkennen. Der Datensatz war maßgeblich daran beteiligt, den Fortschritt im Bereich Deep Learning zu verfolgen, von frühen flachen Netzwerken bis hin zu modernen Architekturen mit Residualverbindungen und Aufmerksamkeitsmechanismen.
Forschungspapiere, die Ergebnisse auf dem neuesten Stand der Technik für CIFAR-10 beanspruchen, sind seit der Veröffentlichung durchgehend erschienen. Allerdings sind nicht alle Papiere auf dieselben Vorverarbeitungstechniken standardisiert, wie etwa Bildspiegelung oder Bildverschiebung. Aus diesem Grund könnte die Behauptung eines Papiers, den neuesten Stand der Technik zu erreichen, eine höhere Fehlerrate aufweisen als eine ältere Behauptung, aber unter anderen Vorverarbeitungsbedingungen dennoch gültig sein.
Benchmarks und Leistung
Über die Algorithmenentwicklung hinaus wird CIFAR-10 als Leistungsbenchmark für Teams verwendet, die darum konkurrieren, neuronale Netze schneller und kostengünstiger auszuführen. Der DAWNBench-Wettbewerb beispielsweise stellt auf seiner Website Benchmark-Daten zum Vergleich von Trainingszeit und -kosten über verschiedene Hardware- und Software-Stacks bereit. Diese Nutzung verbindet den Datensatz mit breiteren Infrastrukturbemühungen von Unternehmen wie Google Cloud, Amazon Web Services und Azure.
Ähnliche Datensätze
Mehrere verwandte Datensätze erweitern oder ergänzen CIFAR-10. CIFAR-100 ist ähnlich, enthält jedoch 100 Klassen mit jeweils 600 Bildern. CIFAR-10H ist eine Version, die mit menschlicher Wahrnehmungsunsicherheit beschriftet wurde. Der ImageNet-Datensatz (ILSVRC) enthält 1 Million Farbbilder von 1.000 Klassen bei höherer Auflösung. Der Street-View-House-Numbers-Datensatz (SVHN) bietet etwa 600.000 Bilder von 10 Klassen (Ziffern 0-9), ebenfalls bei 32x32-Auflösung. Der 80-Millionen-Tiny-Images-Datensatz dient als übergeordnete Menge, aus der CIFAR-10 abgeleitet wurde.
Siehe auch
- Liste von Datensätzen für die Forschung zum maschinellen Lernen
- MNIST-Datenbank
Referenzen
- CIFAR-10-Seite - Die Heimat des Datensatzes
- Canadian Institute For Advanced Research