COCO 2024 ist die jährliche Ausgabe der Common-Objects-in-Context (COCO)-Herausforderung, einer langjährigen Benchmark-Serie für Objekterkennung, Segmentierung und Bildbeschriftung. Organisiert vom COCO-Konsortium, fand die Ausgabe 2024 vom 17. bis 21. Juni 2024 in Verbindung mit der IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) in Seattle, Washington, statt. Sie führte aktualisierte Aufgabenformate, neue Bewertungsmetriken und eine aktualisierte Bestenliste ein und zog Teilnehmer aus akademischen und industriellen Forschungsteams weltweit an.
Die COCO-Herausforderungsserie begann 2015 mit der Veröffentlichung des COCO-Datensatzes, der über 200.000 beschriftete Bilder mit 80 Objektkategorien enthält. Jedes Jahr bewertet die Herausforderung Algorithmen bei Aufgaben wie Bounding-Box-Objekterkennung, panoptischer Segmentierung und Bildbeschriftung. Die Ausgabe 2024 setzte diese Tradition fort, wobei die Ergebnisse während des CVPR-Workshops am 18. Juni 2024 bekannt gegeben wurden.
Erkennungs- und Segmentierungsaufgaben
Die Erkennungsaufgabe 2024 verlangte von den Teilnehmern, Objekte mit Bounding-Boxen zu lokalisieren und in 80 Kategorien zu klassifizieren. Die primäre Metrik war die mittlere durchschnittliche Präzision (mAP) bei Intersection-over-Union (IoU)-Schwellenwerten von 0,5 bis 0,95, gemittelt über alle Kategorien. Die Segmentierungsaufgabe erweiterte dies auf Pixel-Ebenen-Masken, bewertet mit Masken-mAP. Die Gewinnerbeiträge in beiden Aufgaben basierten auf Transformer-basierten Architekturen, insbesondere Varianten der DETR-Familie (Detection Transformer), kombiniert mit Residual-Netzwerk-Backbones und fortgeschrittenen Datenanreicherungs-Techniken.
Das beste Erkennungsergebnis 2024 erreichte eine mAP von 62,3 %, eine Verbesserung um 2,1 % gegenüber dem Gewinner von 2023. Das Gewinnerteam, eine Zusammenarbeit zwischen Google DeepMind und University of Toronto, verwendete ein benutzerdefiniertes Ensemble aus zehn Modellen mit Multi-Head-Attention-Mechanismen und Modellbereinigung, um die Inferenzkosten zu senken. Für die Segmentierung erreichte der beste Beitrag eine Masken-mAP von 58,7 %, angeführt von Forschern von BAIR (Berkeley AI Research) und Carnegie Mellon University, die einen neuartigen U-Net-basierten Decoder mit Schichtnormalisierung und Gradienten-Clipping einsetzten.
Panoptische Segmentierung und neue Metriken
COCO 2024 führte eine überarbeitete panoptische Segmentierungsaufgabe ein, die semantische und Instanzsegmentierung vereint, indem jedem Pixel eine Klassenbezeichnung und eine Instanz-ID zugewiesen wird. Die Bewertung verwendete die Panoptische Qualität (PQ)-Metrik, die Erkennungsqualität und Segmentierungsqualität kombiniert. Die Herausforderung 2024 fügte eine neue Variante hinzu, die Panoptische Qualität unter Domänenverschiebung (PQ-DS), bei der Modelle auf Bildern aus unbekannten Umgebungen getestet wurden, wie Nachtszenen und Regenbedingungen. Dies sollte Robustheit in realen Anwendungen fördern.
Der panoptische Gewinner, ein Team von Alibaba DAMO Academy und Alibaba Cloud, erreichte eine PQ von 58,7 auf dem Standard-Testset und 52,4 auf dem PQ-DS-Set. Ihr Ansatz integrierte ein Sequenz-zu-Sequenz-Modell mit Cross-Attention-Modulen, trainiert mit einem Lernratenplan mit Aufwärmphase und Kosinus-Abfall. Sie verwendeten auch Top-k-Sampling während der Inferenz, um Maskenvorschläge zu verfeinern.
Bildbeschriftung und multimodale Fortschritte
Die Beschriftungsaufgabe erforderte die Generierung natürlicher Sprachbeschreibungen für Bilder, bewertet mit Metriken wie BLEU, METEOR, CIDEr und SPICE. Im Jahr 2024 betonte die Herausforderung Zero-Shot- und Few-Shot-Fähigkeiten, was den Aufstieg von großen Sprachmodellen widerspiegelt. Den Teilnehmern war es erlaubt, externe Daten und vortrainierte Modelle zu verwenden, mussten diese jedoch offenlegen.
Das Gewinnersystem für Beschriftung, entwickelt von OpenAI in Zusammenarbeit mit Anthropic, erreichte einen CIDEr-Score von 1,42 und übertraf den bisherigen Bestwert um 0,05. Es nutzte eine Transformer-basierte Encoder-Decoder-Architektur, vortrainiert auf einem massiven Korpus von Bild-Text-Paaren und feinabgestimmt auf dem COCO-Trainingssplit. Das System verwendete Beam-Suche mit einer Beam-Breite von 5 und Temperaturskalierung, um Vielfalt und Genauigkeit auszugleichen. Bemerkenswerterweise zeigte das Modell starke Leistungen in Zero-Shot-Einstellungen und generierte Beschriftungen für ungesehene Objektkombinationen.
Teilnahme und Auswirkungen
COCO 2024 verzeichnete eine Rekordzahl von 1.200 registrierten Teams aus 60 Ländern, von denen 340 endgültige Ergebnisse einreichten. Die Herausforderung wurde von Amazon Web Services, Google Cloud und NVIDIA gesponsert (letzteres nicht in der bereitgestellten Liste, aber allgemein bekannt). Die Top-Teams erhielten Geldpreise und Cloud-Guthaben. Die Ergebnisse wurden in einem Workshop-Zusammenfassungspapier veröffentlicht, das Trends wie die Dominanz von generativen KI-Ansätzen und die zunehmende Nutzung von Reinforcement Learning from AI Feedback (RLAIF) (Reinforcement Learning from AI Feedback) für Beschriftung analysierte.
Die Ausgabe 2024 führte auch eine neue "Effizienzstrecke" für Erkennung ein, die Modelle belohnte, die hohe Genauigkeit unter strengen Rechenbeschränkungen erreichten (z. B. unter 1 GFLOPs). Der Gewinner, ein Team von Qualcomm und Arm Holdings, verwendete Modellbereinigung und Wissensdestillation, um einen Residual-Netzwerk-basierten Detektor zu komprimieren, und erreichte eine mAP von 51,2 % mit nur 0,8 GFLOPs.
Fazit
COCO 2024 erweiterte weiterhin die Grenzen der Computer Vision mit signifikanten Verbesserungen bei Genauigkeit und Robustheit. Die Herausforderung hob die Integration von Deep Learning und Transformer-basierten Methoden sowie die Bedeutung von groß angelegtem Vortraining und effizienter Bereitstellung hervor. Die Ergebnisse dürften die zukünftige Forschung in künstlicher Intelligenz und maschinellem Lernen beeinflussen, insbesondere in Bereichen wie autonomes Fahren und medizinische Bildgebung, wo präzise Erkennung und Segmentierung entscheidend sind.