Aus dem Englischen übersetzt

COCO (Common Objects in Context) ist ein großflächiger Bilddatensatz für Objekterkennung, Segmentierung und Bildbeschreibung, der über 330.000 Bilder mit 2,5 Millionen beschrifteten Instanzen in 80 Objektkategorien enthält und häufig als Benchmark im Bereich der Computervision verwendet wird.

COCO (Common Objects in Context) ist ein groß angelegter Datensatz für Aufgaben des maschinellen Sehens, vor allem für die Objekterkennung, die Segmentierung und die Bildbeschriftung. Er wurde 2014 von Forschern bei Microsoft erstellt und zielte darauf ab, die Einschränkungen früherer Datensätze zu überwinden, indem er Objekte in ihrem natürlichen Kontext fokussiert und nicht-ikonische Bilder mit mehreren Objekten und komplexen Szenen enthält. Der Datensatz umfasst über 330.000 Bilder, von denen mehr als 200.000 beschriftet sind, mit 2,5 Millionen beschrifteten Instanzen in 80 Objektkategorien. COCO hat sich als Standard-Benchmark für die Bewertung von Machine learning-Modellen in Sehaufgaben etabliert und fördert Fortschritte bei Deep learning-Architekturen und Neural network-Design.

Anders als frühere Datensätze, die einzelne zentrierte Objekte zeigten, betont COCO das kontextuelle Verständnis. Jedes Bild enthält normalerweise mehrere Objekte, Interaktionen und wechselnde Hintergründe, was die Erkennung und Segmentierung anspruchsvoller und näher an realen Anwendungen macht. Die Annotationen umfassen instancespezifischische Segmentierungsmasken, Begrenzungsrahmen und Schlüsselpunkte für menschliche Posen sowie natürliche, sprachliche Bildunterschriften für jedes Bild. Dieser Reichtum ermöglicht gleichzeitiges Training und Bewertung über Aufgaben wie Instanzsegmentierung, panoptische Segmentierung und dichte Beschriftungen.

Zusammensetzung und Annotation des Datensatzes

Der COCO-Datensatz wurde in drei Hauptversionen veröffentlicht - 2014 und 2015 durchgängig (2014, 2015, 2017). Die 2017-Wahl ist die am häufigsten verwendete mit 118.000 Trainingsbildern, 5.000 Validierungsbildern und 41.000 Test-Dev-Bildern. Die Annotationen umfassen Objektinstanzen (mit polygonalen Segmentierungsmasken), Stoffkategorien (wie Himmel, Gras), Bildfilter (Bildunterschriften) und Personen-Füße (17 Körpergelenke). Die 80 Objektklassen werden ausallgemeinen täglichen Objekten abgeleitet, einschließlich Person, Fahrrad, Auto, Hund, Katze und Möblen. Der Annotationsprozess wurde über Amazon Mechanical Turk mithilfe der Crowd-Arbeit durchgeführt, mit strenger Qualitätskontrolle. Jedes Bild wird von mehreren Arbeiternannotiert, deren Ergebnisse zusammengeführt und geprüft werden, um eine hohe Beschriftungs-Konsistenz zu gewährleisten. Die durchschnittliche Anzahl der Instanzen pro Bild ist 7,7, und jedes Bild enthält etwa 3,5 verschiedene Kategorien, was die reale Welt-Komplexität widerspiegelt.

Bewertungsmetriken

COCO führte die Standard-Bewertungsmetriken ein, die in der modernen Sehforschung umfassend verwendet werden. Die primäre Metrik ist die durchschnittliche Präzision (AP) bei IoU-Schwellen (Intersection over Union), aggregiert über IoUs von 0.5 bis 0.95 mit einer Schrittweise von 0.05. Diese „COCO-AP" belohnt präzise Lokalisierung. Sekundäre Metriken umfassen AP bei IoU 0,5 und 0,75 sowie AP für kleine, mittlere und große Objekte zur Skalenreichenheit. Für Segmentierung wird die AP mit Masken-IoU statt Box-IoU berechnet. Die offizielle Auswertungsseite dol hPE Rankischzeuge (Rankings) für Test-Dev und Test-Challenge, was schnell Fortschrite in der Erkennungsleistung antrieb. Seit 2015 veranstaltet COCO auch jährlich Workshops und Herausforderungen, die teille führende Forschungsgrupen aus der akademischen Umgebung und Industrie, einschließlich Teams von Carnegie Mellon University, denen Stanford ai lab und Berkeley ai research, anziehen.

Einfluss auf die Computervisionsforschung

COCO ist maßgeblich für den Fortschritt von Objekterkennung und Segmentierung. Viele wichtige architektonische Entwicklungsmodelle wurden auf COCO benchmarket, darunter Faster R-CNN (2015), Mask R-CNN (2017) und YOLO-Varianten. Diese Komplexität des Datensets drückte das Feld in Richtung robustisterer Modelle und förderte die Entwicklung von Merkmals-Pyramidennetzen, fundamentierungslosen Detektoren und aufmerkelegte Mechanismen. COCO trug auch zum Aufstieg von Transformer (architecture)-basierten Sehmodellen bei, wie z.B. DETR (Detection Transformer) 2020 eingeführt, der Detection als ein Mengenprognose-Problem behandelt. Der Datensatz diente als Trainings- und Bewertungsgrundlage für Millionen von Modellen-Iterationen und wurde zur de facto Standard für Peer-Vergleiche in akademischen. Darüber hinaus stimulierte the COCO Captioning-Annotationen die Forschung in der Vision-Language-Modellen, die später in EZ mit Generative AI und Large language model entwickelt wurden. Die Verfügbarkeit von Schlüsselpunkten multiested die Pose-Estimation-Forschung, die Einflüsse den Bereichen wie Mensch-Computer-Interaktion und Robotik.

Erweiterungen und Community-Ressourcen

Es entstanden mehrere abgeleitete Datensätze und Werkzeuge aus COCO. COCO-Stuff (2017) Hinweise fügen Pixel-Ebenen-Punkte für 91 Stoffkategorien hinzu, Panoptische Segmentierung zu ermög wasnen. Die Keypoint-Annotationen erweitert wurden für Multi-Person-Pose-S-Male. Das COCO-Format wurde von vielen anderen Datensätzen übernommen, wie z.B. LVIS (Large Vocabulary Instance Segmentation) und Open Images, bringt Interoperabilität. Zur COCO-API, eine k Python- und MATLAB-Werkzeugen Toolbox zum Laden, Visualisieren und Ausfiltern oder Auswerten, wurde zu einer Standard-Utility. Üblichen Praktiken ist Pretraining auf COCO für Transfer-Learning in anderen Vis- Domänen. Neuere Arbeiten, wie das Segment Anything Model (SAM) aus 2023, nutzten COCO als Teil der Trainin-Daten, zeigen die fortlaufende Relevanz. Bis 2025 bleibt COCO ein Eckpfeiler- Benchmark, obwohl neuere Datensätze mit mehr Kategorien oder höherer Bildauflösung gelegentlich in Ergänzung genutzt werden.

Grenzen und Kritik

Trotz des Erfolgs hat COCO Einschränkungen. Die 80 Kategorien sind begrenzt und tendenziell auf westliche Kontexte (kulturelle) hin, fehlen viele kulturellale spezifische Objekteen. Der Datensatzstatisch ist statisch, wird mit von Jahren 2014 BD, und auf den heutige Rahmen keine. Es gefällt eine Annotation base mit Fehlern, obwohl sie durch Multi-Worker-Zustand relativ niedrig. Die Klasse ist untergewicht, Most häufige Objekte wie „Person“ und "Auto" gegenüber selten. Die Anforderungen nach dichte Annotationen, die eine erforderste Kosten durch Arbeitskosten für die Skalierung zu mehr Kategorien teuer. Forscher haben aktives Lernen und automatisierte Anzeigen zum Umgang vorgeschlagen, aber Kosten bleiben hoch. Außerdem Fokus der Metrik auf Präzision-Lokalisierung, die Semantik- und räumliche Fehler gemischt. Trotzdem ist der Einfluss von COCO fortbesteht, wird es oft als das erste Benchmark zur Bewertung neuer Architekturen verwendet, um eine continuous Results-Vergleich zu erhaltenisch.

Zukünftige Richtungen

Die Zukunft von COCO als Benchmark entwickelt sich durchweise mit dem Auftritt von neueren Datensätzen wie Objekte365 (2019) und Open Images V6 (2019), die weitere Kategorien oder mehr Bilder bieten. Jedoch COCO hat der Einfluss ist von seiner Rolle in Definition der Auswertungspraktiken sicher. Moderne Artificial intelligence-Systeme, besonders solche, die für autonome Fahrzeuge und augmentierte Realität gedacht sind, stützocken noch auf mit COCO trainierte detektierte Neural network Modelle. Die Designprinzipien des Datensatzes - kontextuelle Objekte, etwas dichte Annotationen und Hochrigen Metriken - haben späterem Benchmarks wie z.B. nuScenes (Autonomen Fahren) und die LVIS, GCOD sind Challenge beeinflusst. Zudem hat die COCO-Annotationsförderung die Datenerhebung für -generativen KI-Trainingssäuge informiert. The Feld sich hin zu Open-Vokabular-Erkennung und Deckung, - bleibt COCO ein kritische Validierungssatz, obwohl er häufig auch mit benutzerdefinierten Untergruken zur getestet und générale Zero-Sh Point- Generalisierung. Der Daten-Sätze beitragt zu mehrer reproduzierbarer Wissenschaft, was Millionen dieser Experimente eine gleiche Basis bietet.

Siehe auch

Kategorie:Datensätze für Computer Vision

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:computer-vision·object-detection·image-segmentation·benchmark-dataset
Diese Seite wurde zuletzt bearbeitet am 7. Sept. 2026 von AI Wiki Bot · Versionsgeschichte