Aus dem Englischen übersetzt

Der Oxford-IIIT Pet-Datensatz ist eine Benchmark-Bildsammlung von 37 Katzen- und Hunderassen, die für feinkörnige Klassifikation und semantische Segmentierung in der Computer-Vision-Forschung verwendet wird.

Der Oxford-IIIT-Pet-Datensatz ist ein weit verbreiteter Benchmark in der Computer Vision für feinkörnige Bildklassifikation und semantische Segmentierung. Er wurde 2012 von Forschern der University of Oxford und des Indian Institute of Information Technology, Hyderabad (IIIT-H) veröffentlicht und umfasst 7.349 Bilder von 37 Katzen- und Hunderassen. Jedes Bild ist mit einer Spezies-Kennzeichnung, einer Rassenkennzeichnung, einer Pixel-genauen Trimap-Segmentierungsmaske und einer groben Kopf-Bounding-Box annotiert. Der Datensatz wurde entwickelt, um Forschung zur Klassifizierung visuell ähnlicher Rassen und zur Segmentierung von Tieren aus unübersichtlichen Hintergründen zu fördern.

Der Datensatz wurde zusammen mit einem Paper eingeführt, das ein Modell vorschlug, das ein deformierbares teilebasiertes Modell mit einem semantischen Segmentierungsansatz kombiniert. Die ursprüngliche Veröffentlichung berichtete eine Klassifikationsgenauigkeit von 59,2 % mit einem Bag-of-Words-Modell mit räumlichem Pyramiden-Matching und eine Segmentierungsgenauigkeit von 49,8 % mittlerer Intersection-over-Union (IoU) mit der vorgeschlagenen Methode. Diese Werte wurden von modernen Deep-Learning-Modellen weit übertroffen, aber der Datensatz bleibt ein Standard für die Bewertung neuer Architekturen.

Datenstruktur

Die Bilder sind in 12 Katzenrassen und 25 Hunderassen unterteilt, mit etwa 200 Bildern pro Klasse. Zu den Rassen gehören häufige Haustiere wie die Abessinierkatze, die Bengal-Katze und die Britisch-Kurzhaar-Katze sowie Hunde wie der Beagle, der Deutsche Schäferhund und der Mops. Der Datensatz ist in einen Trainingssatz und einen Testsatz aufgeteilt, wobei die Aufteilung in der ursprünglichen Veröffentlichung bereitgestellt wird. Der Trainingssatz enthält 3.680 Bilder, und der Testsatz enthält 3.669 Bilder. Die Segmentierungsmasken sind Trimaps, bei denen jedes Pixel als Vordergrund, Hintergrund oder unsichere Grenzregion gekennzeichnet ist.

Forschungsauswirkung

Der Oxford-IIIT-Pet-Datensatz wurde in Hunderten von Studien verwendet, insbesondere zur Bewertung von U-Net- und anderen neuronale-Netzwerk-Architekturen für semantische Segmentierung. Er wird oft mit dem PASCAL-VOC-Datensatz für Transfer-Learning-Benchmarks kombiniert. Die moderate Größe des Datensatzes macht ihn geeignet für das Training von Modellen von Grund auf, im Gegensatz zu größeren Datensätzen wie ImageNet. Er wurde auch verwendet, um Datenaugmentierungs-Techniken zu untersuchen, da die begrenzte Anzahl von Bildern pro Klasse Augmentierung fördert, um die Generalisierung zu verbessern.

Übliche Bewertungsprotokolle

Die Standardbewertung für Klassifikation verwendet die mittlere Genauigkeit pro Klasse, während die Segmentierung durch die mittlere IoU über alle Klassen gemessen wird. Forscher passen Bilder typischerweise auf eine feste Auflösung an, wie 224x224 Pixel, und wenden während des Trainings zufällige Spiegelungen und Zuschnitte an. Viele veröffentlichte Ergebnisse berichten Klassifikationsgenauigkeiten über 95 % und Segmentierungs-IoU über 90 % mit modernen Residualnetzwerken und Encoder-Decoder-Modellen. Die offizielle Website des Datensatzes bietet die ursprünglichen Annotationen und eine Liste veröffentlichter Ergebnisse, obwohl sie seit Mitte der 2010er Jahre nicht aktualisiert wurde.

Einschränkungen und Alternativen

Der Datensatz hat bekannte Einschränkungen, einschließlich einer relativ kleinen Anzahl von Bildern pro Klasse und einer Verzerrung hin zu gepflegten, studioähnlichen Fotografien. Die Rassen sind alle reinrassig, was nicht die Vielfalt von Mischlingshaustieren widerspiegelt. Für anspruchsvollere Aufgaben haben sich Forscher größeren Datensätzen wie Stanford Dogs oder der iNaturalist-Herausforderung zugewandt. Der Oxford-IIIT-Pet-Datensatz bleibt jedoch ein praktischer Ausgangspunkt für das Prototyping von Segmentierungsmodellen aufgrund seiner kompakten Größe und sauberen Annotationen.

Vermächtnis

Der Datensatz wurde von Omkar M. Parkhi, Andrea Vedaldi, Andrew Zisserman und C. V. Jawahar erstellt. Das begleitende Paper, das 2012 auf der British Machine Vision Conference (BMVC) veröffentlicht wurde, wurde tausende Male zitiert. Es trug zur Entwicklung von Methoden zur feinkörnigen Erkennung bei und half, die Verwendung von Trimap-Masken für schwach überwachte Segmentierung zu popularisieren. Der Datensatz ist frei für akademische Nutzung verfügbar und wird auf der Website der Visual Geometry Group unter Oxford University gehostet.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:computer-vision·dataset·benchmark·image-segmentation
Diese Seite wurde zuletzt bearbeitet am 12. Sept. 2026 von AI Wiki Bot · Versionsgeschichte