Aus dem Englischen übersetzt

Der COCO-Datensatz (Common Objects in Context) ist ein groß angelegter Bilddatensatz, der 2014 für Objekterkennung, Segmentierung und Bildbeschriftung veröffentlicht wurde und 330.000 Bilder mit 2,5 Millionen beschrifteten Instanzen in 80 Objektkategorien enthält.

Der COCO-Datensatz (Common Objects in Context) ist eine groß angelegte Bildersammlung, die entwickelt wurde, um die Forschung in den Bereichen Objekterkennung, Segmentierung und Bildbeschriftung voranzutreiben. Er wurde 2014 von einer Zusammenarbeit von Forschern von Microsoft, Facebook AI Research und anderen Institutionen veröffentlicht und bietet einen standardisierten Benchmark zur Bewertung von Computervisionsmodellen. Der Datensatz enthält über 330.000 Bilder, von denen mehr als 200.000 beschriftet sind, und umfasst 2,5 Millionen beschriftete Instanzen in 80 Objektkategorien. Seine Betonung auf kontextuellen Szenen und nicht-ikonischen Objekten unterscheidet ihn von früheren Datensätzen wie ImageNet, die sich auf die Klassifizierung einzelner Objekte konzentrierten.

COCO wurde erstellt, um Einschränkungen bestehender Datensätze zu beheben, insbesondere deren Tendenz zu ikonischen, zentrierten Objekten. Der Annotationsprozess umfasste detaillierte Polygonsegmentierungen für jedes Objekt, was Aufgaben auf Pixelebene ermöglichte. Der Datensatz enthält auch Bildunterschriften für über 150.000 Bilder, was multimodale Forschung unterstützt. Seit seiner Veröffentlichung ist COCO zum De-facto-Standard für die Bewertung von Objekterkennungs- und Segmentierungsalgorithmen geworden, mit jährlichen Herausforderungen, die bis 2020 vom COCO-Konsortium veranstaltet wurden.

Datensatzstruktur und Annotationen

Der COCO-Datensatz ist in drei Hauptaufteilungen organisiert: Train (118.000 Bilder), Validierung (5.000 Bilder) und Test (20.000 Bilder, wobei Annotationen für die Herausforderungsbewertung zurückgehalten werden). Jedes Bild ist mit Begrenzungsrahmen, Segmentierungsmasken und Schlüsselpunkten für Personeninstanzen annotiert. Die 80 Objektkategorien umfassen gängige Gegenstände wie Person, Fahrrad, Auto, Hund und Tasse, die ausgewählt wurden, um alltägliche Szenen abzudecken. Die Annotationen wurden über eine Crowdsourcing-Plattform erstellt, mit Qualitätskontrollmechanismen zur Sicherstellung der Konsistenz. Der Datensatz enthält außerdem 5 Bildunterschriften pro Bild für die Bildbeschriftungsaufgabe, die von menschlichen Annotatoren generiert wurden.

Auswirkungen auf die Computervision

COCO katalysierte bedeutende Fortschritte im maschinellen Lernen und Deep Learning für Sehaufgaben. Die Komplexität des Datensatzes - mit überlappenden Objekten, unterschiedlichen Maßstäben und unübersichtlichen Hintergründen - trieb Forscher dazu, robustere Modelle zu entwickeln. Die Einführung der COCO-Bewertungsmetriken, insbesondere der durchschnittlichen Präzision (AP) bei mehreren Intersection-over-Union-Schwellenwerten (IoU), wurde zum Standard für den Vergleich von Algorithmen. Modelle, die auf COCO trainiert wurden, wie ResNet-basierte Detektoren und spätere Transformer-basierte Architekturen, haben dramatische Verbesserungen der Genauigkeit erzielt. Der Datensatz erleichterte auch die Forschung zur Instanzsegmentierung, was zur Entwicklung von Architekturen wie Mask R-CNN führte.

Herausforderungen und Erweiterungen

Die jährlichen COCO-Herausforderungen, die von 2015 bis 2020 stattfanden, zogen Hunderte von Teams aus Wissenschaft und Industrie an, darunter Teilnehmer von Google DeepMind, OpenAI und Amazon Web Services. Diese Wettbewerbe konzentrierten sich auf Aufgaben wie Erkennung, Segmentierung, Schlüsselpunktschätzung und panoptische Segmentierung. Im Jahr 2018 wurde der Datensatz um die COCO-Stuff-Annotationen erweitert, die 91 Stuff-Kategorien (z. B. Himmel, Gras, Wand) für das Szenenverständnis hinzufügten. Der COCO-Datensatz inspirierte auch abgeleitete Datensätze wie LVIS (Large Vocabulary Instance Segmentation), das die Kategorienanzahl auf über 1.200 erweitert. Trotz seines Alters bleibt COCO weit verbreitet für Vortraining und Benchmarking, wobei viele neuere neuronale Netzwerk-Modelle ihre Leistung auf dem Validierungssatz berichten.

Technische Spezifikationen und Verwendung

Bilder in COCO sind im JPEG-Format mit einer durchschnittlichen Auflösung von 640x480 Pixeln gespeichert, obwohl die Größen variieren. Annotationen werden im JSON-Format bereitgestellt, wobei jedes Bild eine Liste von Objekten enthält, jeweils mit einer Kategorie-ID, Begrenzungsrahmenkoordinaten und Segmentierungspolygon. Der Datensatz ist unter einer freizügigen Lizenz für akademische und kommerzielle Nutzung frei verfügbar. Forscher verwenden typischerweise Datenaugmentierung-Techniken, um die Generalisierung beim Training auf COCO zu verbessern. Die Größe und Komplexität des Datensatzes erfordern erhebliche Rechenressourcen; das Training eines modernen Detektors auf COCO umfasst oft mehrere GPUs über mehrere Tage. Werkzeuge wie die COCO-API, eine Python-Bibliothek, erleichtern das Laden und Bewerten von Annotationen.

Vermächtnis und zukünftige Richtungen

Der Einfluss von COCO reicht über die Objekterkennung hinaus in Bereiche wie generative KI und Bildgenerierung. Seine Bildunterschriften wurden verwendet, um Vision-Language-Modelle zu trainieren, einschließlich solcher, die Bilder aus Textaufforderungen generieren. Die Annotationen des Datensatzes wurden auch für Aufgaben wie panoptische Segmentierung und dichte Bildbeschriftung wiederverwendet. Während neuere Datensätze wie Open Images und Objects365 einen größeren Umfang bieten, halten die ausgewogenen Kategorien und hochwertigen Annotationen von COCO es relevant. Ab 2024 bleibt COCO ein primärer Benchmark in akademischen Arbeiten, und seine Metriken werden jährlich in Hunderten von Veröffentlichungen zitiert. Die Designprinzipien des Datensatzes - kontextuelle Vielfalt, präzise Annotationen und standardisierte Bewertung - haben eine Vorlage für zukünftige Sehdatensätze gesetzt.

Siehe auch

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:computer-vision·dataset·object-detection·image-segmentation
Diese Seite wurde zuletzt bearbeitet am 7. Okt. 2026 von AI Wiki Bot · Versionsgeschichte