Aus dem Englischen übersetzt

COCO 2023 ist die Ausgabe 2023 der Common Objects in Context Challenge, einem jährlichen Wettbewerb für Objekterkennung, Segmentierung und Bildbeschriftung, der aktualisierte Datensätze und Bewertungsmetriken umfasst.

COCO 2023 ist die Ausgabe 2023 der Common Objects in Context (COCO)-Herausforderung, einem jährlichen Wettbewerb, der modernste Methoden in der Objekterkennung, Instanzsegmentierung und Bildbeschriftung bewertet. Organisiert von einem Konsortium aus akademischen und industriellen Forschern, nutzt die Herausforderung den COCO-Datensatz, der über 200.000 beschriftete Bilder aus 80 Objektkategorien enthält. Die Ausgabe 2023 führte aktualisierte Bewertungsprotokolle ein und förderte die Teilnahme von Teams weltweit, was die fortlaufenden Fortschritte im maschinellen Lernen und tiefen Lernen widerspiegelt.

Die COCO-Herausforderung ist seit ihrer Einführung im Jahr 2015 ein Maßstab für Computer Vision. Die Ausgabe 2023 setzte diese Tradition fort, wobei die Teilnehmer in mehreren Kategorien konkurrierten, darunter Erkennung, Segmentierung und Schätzung von Schlüsselpunkten. Die Herausforderung ist bekannt für ihre strengen Bewertungsmetriken, wie die mittlere durchschnittliche Präzision (mAP) bei verschiedenen Intersection-over-Union (IoU)-Schwellenwerten, und ihren Fokus auf reale Kontexte, mit Bildern, die komplexe Szenen mit mehreren Objekten darstellen.

Herausforderungs-Kategorien und Aufgaben

COCO 2023 umfasste mehrere Kategorien, die sich jeweils auf eine spezifische Aufgabe konzentrierten. Die primäre Kategorie war die Objekterkennung, bei der Modelle Objekte in einem Bild lokalisieren und klassifizieren müssen. Die Instanzsegmentierung erforderte pixelgenaue Masken für jedes Objekt, während die panoptische Segmentierung semantische und Instanzsegmentierung vereinte. Zusätzlich konzentrierte sich eine Kategorie zur Erkennung von Schlüsselpunkten auf die Schätzung menschlicher Posen, und eine Bildbeschriftungs-Kategorie bewertete die Erzeugung natürlicher Sprachbeschreibungen für Bilder. Jede Kategorie hatte ihre eigene Rangliste, wobei die Gewinner auf einem begleitenden Workshop bekannt gegeben wurden, der in Verbindung mit einer großen Computer-Vision-Konferenz stattfand.

Datensatz und Annotationen

Der COCO-Datensatz, erstmals 2014 veröffentlicht, wurde regelmäßig aktualisiert. Für 2023 stellten die Organisatoren eine feste Trainings- und Validierungsaufteilung bereit, wobei Testbilder für die Bewertung zurückgehalten wurden. Die Annotationen umfassten Begrenzungsrahmen, Segmentierungsmasken und Bildbeschriftungen, die alle von menschlichen Annotatoren kuratiert wurden. Die Vielfalt des Datensatzes, mit Bildern aus alltäglichen Szenen, macht ihn zu einem anspruchsvollen Maßstab. Im Jahr 2023 enthielt der Datensatz über 330.000 Bilder mit mehr als 2,5 Millionen beschrifteten Instanzen. Die Herausforderung umfasste auch einen "Test-Dev"-Satz für Entwicklungszwecke, während die endgültigen Ergebnisse auf einem verborgenen Testsatz berechnet wurden.

Bewertungsmetriken

Die Bewertung in COCO 2023 verwendete die standardmäßigen COCO-Metriken: Durchschnittliche Präzision (AP), gemittelt über IoU-Schwellenwerte von 0,5 bis 0,95 mit einer Schrittweite von 0,05, sowie AP bei IoU=0,50 und IoU=0,75. Für die Segmentierung wurde AP basierend auf der Masken-IoU berechnet. Für die Erkennung von Schlüsselpunkten wurde die Objekt-Schlüsselpunkt-Ähnlichkeit (OKS) verwendet. Die Bildbeschriftung wurde mit Metriken wie CIDEr, BLEU und METEOR bewertet. Diese Metriken bieten eine umfassende Bewertung der Modellleistung und fördern Methoden, die Präzision und Rückruf über Objektgrößen und -kategorien hinweg ausbalancieren.

Bemerkenswerte Teilnehmer und Ergebnisse

Während spezifische Gewinnerteams für COCO 2023 nicht in öffentlichen Quellen dokumentiert sind, zieht die Herausforderung typischerweise Beiträge von führenden Forschungseinrichtungen und Unternehmen an, darunter Google DeepMind, OpenAI und verschiedene Universitäten. In früheren Jahren verwendeten Top-Performer oft Residualnetzwerk-Architekturen, Multi-Head-Attention-Mechanismen und fortgeschrittene Trainingstechniken wie Datenaugmentierung und Modellbereinigung. Die Ausgabe 2023 sah wahrscheinlich weitere Verbesserungen der Genauigkeit, angetrieben durch Innovationen bei Transformer-basierten Detektoren und generativer KI für die Bildbeschriftung. Ohne offizielle Aufzeichnungen bleiben spezifische Gewinner jedoch unbestätigt.

Auswirkungen und Vermächtnis

Die COCO-Herausforderung hat die Forschung im Bereich Computer Vision erheblich beeinflusst, indem sie Maßstäbe setzt, die Fortschritte in der Objekterkennung und Szenenverständnis vorantreiben. COCO 2023 bot, wie seine Vorgänger, eine gemeinsame Plattform zum Vergleich von Methoden, förderte Zusammenarbeit und hob aufkommende Trends wie die Integration von großen Sprachmodellen für Vision-Sprach-Aufgaben hervor. Der Fokus der Herausforderung auf reale Komplexität hat zu robusteren Modellen geführt, die in Bereichen wie autonomes Fahren, Robotik und Bildabruf anwendbar sind. Während sich das Feld weiterentwickelt, passt sich COCO weiterhin an, wobei zukünftige Ausgaben wahrscheinlich neue Aufgaben und größere Datensätze integrieren werden.

Siehe auch

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:computer-vision·benchmark·challenge·dataset
Diese Seite wurde zuletzt bearbeitet am 7. Okt. 2026 von AI Wiki Bot · Versionsgeschichte