CUB-200-2011, auch bekannt als der Caltech-UCSD Birds-200-2011-Datensatz, ist ein Benchmark-Datensatz für feinkörnige visuelle Klassifizierungsaufgaben im maschinellen Lernen und Computer Vision. Er wurde 2011 von Forschern am Caltech und an der UC San Diego veröffentlicht und soll Algorithmen herausfordern, visuell ähnliche Vogelarten zu unterscheiden, was über die generische Objekterkennung hinausgeht.
Der Datensatz enthält 11.788 Bilder von 200 Vogelarten, wobei jedes Bild mit einem Begrenzungsrahmen, einer binären Teilesegmentierungsmaske und den Positionen von 15 wichtigen Körperteilen (z. B. Schnabel, Flügel, Schwanz) annotiert ist. Zusätzlich ist jedem Bild ein Satz von 312 binären Attributlabels (z. B. „hat rote Brust“, „Flügelfarbe: blau“) und eine Textbeschreibung zugeordnet. Diese reichhaltige Annotationsstruktur macht CUB-200-2011 zu einem Standardtestfeld für die Bewertung von Modellen, die subtile visuelle Unterschiede lernen müssen.
Geschichte und Entstehung
CUB-200-2011 wurde als Erweiterung des ursprünglichen CUB-200-Datensatzes (2010) eingeführt, der 6.033 Bilder von 200 Arten enthielt. Die Version von 2011 fügte weitere Bilder, Teilannotationen und Attributlabels hinzu. Der Datensatz wurde von Catherine Wah, Steve Branson, Peter Welinder, Pietro Perona und Serge Belongie erstellt. Er wurde von der National Science Foundation und dem Office of Naval Research finanziert. Die Bilder stammen von Flickr und anderen Online-Repositorien und wurden anschließend von menschlichen Annotatoren über eine Crowdsourcing-Plattform gefiltert und beschriftet.
Struktur und Annotationen
Jedes Bild in CUB-200-2011 wird von einem Satz Annotationsdateien begleitet. Der Begrenzungsrahmen bietet einen engen Ausschnitt des Vogels. Die Teilpositionen werden als (x,y)-Koordinaten für 15 Teile angegeben, einschließlich Scheitel, Stirn, Auge, Schnabel, Kehle, Brust, Bauch, Flügel und Schwanz. Die binäre Segmentierungsmaske gibt an, welche Pixel zum Vogel gehören. Die Attributlabels sind binär (0 oder 1) und decken Farbmuster, Form und Verhalten ab. Der Datensatz enthält auch eine Trainings-/Test-Aufteilung: 5.994 Bilder für das Training und 5.794 für das Testen, wobei ungefähr die Hälfte der Arten in jeder Aufteilung enthalten ist.
Rolle in der feinkörnigen Erkennung
CUB-200-2011 ist ein Eckpfeiler der feinkörnigen visuellen Kategorisierung (FGVC), einem Teilgebiet des Computer Vision, das darauf abzielt, Objekte auf Unterkategorienebene (z. B. Arten, Rassen) zu klassifizieren. Im Gegensatz zur generischen Objekterkennung (z. B. ein Vogel von einem Auto zu unterscheiden) erfordert FGVC, dass Modelle sich auf subtile Unterschiede im Erscheinungsbild konzentrieren. CUB-200-2011 wurde verwendet, um zahlreiche Techniken zu entwickeln und zu bewerten, darunter teilbasierte Modelle, Aufmerksamkeitsmechanismen und Deep-Learning-Architekturen. Er wird häufig mit anderen FGVC-Datensätzen wie Stanford Dogs und Oxford Flowers kombiniert.
Auswirkungen auf die Deep-Learning-Forschung
Mit dem Aufkommen von neuronalen Netzen wurde CUB-200-2011 zu einem beliebten Benchmark für die Bewertung neuer Architekturen. Beispielsweise wurde er verwendet, um die Leistung von Residualnetzen und aufmerksamkeitsbasierten Modellen zu bewerten. Die Teilannotationen des Datensatzes haben Forschung zu Teillokalisierung und teilbasierter Klassifizierung ermöglicht, bei der Modelle zuerst Teile erkennen und dann deren Merkmale für die Klassifizierung nutzen. Er dient auch als Testfeld für Datenaugmentierung-Techniken und Verlustfunktionen, die speziell für feinkörnige Aufgaben entwickelt wurden. Ab Mitte der 2020er Jahre erreichen modernste Modelle eine Genauigkeit von über 90 % auf CUB-200-2011, eine deutliche Verbesserung gegenüber den frühen 2010er Jahren, als die Genauigkeit bei etwa 50-60 % lag.
Einschränkungen und Erweiterungen
Trotz seiner Beliebtheit hat CUB-200-2011 Einschränkungen. Die Bilder sind relativ klein (durchschnittliche Auflösung etwa 500x500 Pixel), und der Datensatz ist auf nordamerikanische Vogelarten ausgerichtet. Die Annotationen können trotz ihrer Detailgenauigkeit aufgrund von Crowdsourcing Inkonsistenzen aufweisen. Um einige dieser Probleme anzugehen, haben Forscher Erweiterungen wie CUB-200-2011 mit zusätzlichen Attributannotationen erstellt oder ihn für Cross-Dataset-Transferlernen verwendet. Der Datensatz bleibt ein Standard für die Bewertung feinkörniger Erkennung, und sein Design hat spätere Datensätze wie iNaturalist beeinflusst.
Siehe auch
Referenzen
- Wah, C., Branson, S., Welinder, P., Perona, P., & Belongie, S. (2011). The Caltech-UCSD Birds-200-2011 Dataset. California Institute of Technology.
- Welinder, P., et al. (2010). Caltech-UCSD Birds 200. California Institute of Technology.