COCO 2020 bezieht sich auf die Ausgabe 2020 der Common Objects in Context (COCO)-Herausforderung, einer langjährigen Benchmark- und Wettbewerbsserie im Bereich der Computer Vision. Organisiert von einem Konsortium aus akademischen und industriellen Forschern, bewertet die Herausforderung Algorithmen bei Aufgaben wie Objekterkennung, Instanzsegmentierung und Bildbeschriftung. Die Ausgabe 2020 wurde im Juni 2020 in Verbindung mit der Conference on Computer Vision and Pattern Recognition (CVPR) abgehalten, aber aufgrund der COVID-19-Pandemie wurde die physische Veranstaltung durch ein virtuelles Format ersetzt. Die Herausforderung zog die Teilnahme führender Forschungsgruppen und Technologieunternehmen an, wobei die Ergebnisse online bekannt gegeben wurden.
Der COCO-Datensatz selbst, erstmals 2014 veröffentlicht, enthält über 200.000 beschriftete Bilder, die 80 Objektkategorien abdecken, mit mehr als 1,5 Millionen Objektinstanzen. Die Herausforderung 2020 verwendete die Version 2017 des Datensatzes, die Bilder in Trainings- (118.000), Validierungs- (5.000) und Testmengen (20.000) aufteilt. Die primären Bewertungsmetriken für Erkennung und Segmentierung sind die durchschnittliche Präzision (AP) bei verschiedenen Intersection-over-Union (IoU)-Schwellenwerten, wobei die primäre Metrik AP bei IoU 0,50:0,95 ist. Für die Beschriftung umfassen die Metriken BLEU, METEOR, ROUGE, CIDEr und SPICE.
Herausforderungsaufgaben und Gewinner
Die Herausforderung 2020 umfasste mehrere Tracks: Erkennung, Instanzsegmentierung, Keypoint-Erkennung und Bildbeschriftung. Bei der Erkennungsaufgabe erreichte das Gewinnerteam eine AP von 0,617 auf dem Test-Dev-Set, eine signifikante Verbesserung gegenüber den 0,493 des Gewinners von 2019. Die besten Lösungen verwendeten fortschrittliche Deep-Learning-Architekturen, einschließlich Varianten von Residual-Netzwerk- und Neuronales-Netzwerk-Designs mit Batch-Normalisierung- und Dropout-Techniken. Der Gewinner der Instanzsegmentierung erreichte eine AP von 0,582, während der Gewinner der Keypoint-Erkennung eine AP von 0,764 erzielte. Für die Beschriftung erzielte das beste Modell einen CIDEr von 1,302, wobei Transformer-basierte Sequenz-zu-Sequenz-Architekturen mit Multi-Head-Attention und Positionskodierung verwendet wurden.
Technische Innovationen
Die Teilnehmer von COCO 2020 trieben den Stand der Technik in mehreren Richtungen voran. Viele Top-Beiträge verwendeten Daten-Augmentierung-Strategien, einschließlich zufälligem Zuschneiden, Skalieren und Farb-Jitter, um die Generalisierung zu verbessern. Lernratenpläne-Techniken wie Cosinus-Abkühlung und Aufwärmen wurden weitgehend übernommen. Einige Teams verwendeten Modellbeschneidung, um die Rechenkosten zu reduzieren und gleichzeitig die Genauigkeit beizubehalten. Die Verwendung von SGD-Varianten wie Adam und Adam-Optimierer war üblich, oft kombiniert mit Gradienten-Clipping, um das Training zu stabilisieren. Schichtnormalisierung und Batch-Normalisierung wurden beide in verschiedenen Teilen der Netzwerke angewendet. Der Wettbewerb sah auch eine verstärkte Nutzung von Cross-Attention-Mechanismen in Erkennungsköpfen, die auf Transformer-Innovationen aus der Verarbeitung natürlicher Sprache-Forschung aufbauten.
Auswirkungen und Vermächtnis
Die Ergebnisse von COCO 2020 beeinflussten die anschließende Forschung in der Computer Vision. Die Gewinnerarchitekturen und Trainingsrezepte wurden in vielen späteren Projekten übernommen, einschließlich solcher in Künstliche-Intelligenz-Anwendungen für autonomes Fahren, Robotik und medizinische Bildgebung. Die Herausforderung hob die Bedeutung von groß angelegtem Maschinellem Lernen und die Rolle des Neuronales-Netzwerk-Designs bei der Erreichung hoher Genauigkeit hervor. Der COCO-Benchmark bleibt ein Standard-Bewertungswerkzeug, und die Ausgabe 2020 setzte eine neue Baseline für zukünftige Wettbewerbe. Die Veranstaltung förderte auch die Zusammenarbeit zwischen akademischen Institutionen wie MIT CSAIL, Stanford AI Lab und Berkeley AI Research sowie Industrielabors wie Google DeepMind und OpenAI, obwohl die genauen Zugehörigkeiten der Gewinnerteams variierten.
Vergleich mit anderen Benchmarks
Während sich COCO 2020 auf das Verständnis auf Objektebene konzentrierte, zielen andere Benchmarks wie ImageNet auf die Bildklassifizierung ab. COCOs Betonung auf Instanzsegmentierung und Beschriftung machte es anspruchsvoller und näher am Verständnis realer Szenen. Die Ausgabe 2020 sah eine bemerkenswerte Lücke zwischen der besten und der durchschnittlichen Leistung, was auf Verbesserungspotenzial hinweist. Im Gegensatz zu Schachcomputer-Benchmarks, die deterministisch sind, erfordern COCO-Aufgaben den Umgang mit visueller Variabilität und Mehrdeutigkeit. Der Wettbewerb unterschied sich auch von Großes-Sprachmodell-Bewertungen, da er sich auf visuelle Wahrnehmung und nicht auf Textgenerierung konzentrierte. Trotz dieser Unterschiede fanden Techniken aus COCO 2020, wie Top-k-Sampling bei der Beschriftung, Parallelen in Generative-KI-Modellen.
Zukünftige Richtungen
Nach COCO 2020 bewegte sich die Gemeinschaft in Richtung umfassenderer Benchmarks wie LVIS und Open Images, die mehr Kategorien und Long-Tail-Verteilungen enthalten. Der Fokus der Herausforderung 2020 auf Effizienz förderte auch die Forschung an leichten Modellen, die auf Edge-Geräten wie denen von Arm Holdings und Qualcomm einsetzbar sind. Die Verwendung von Transformer-basierten Detektoren, die 2020 populär wurden, wurde in den folgenden Jahren zum Mainstream. Der COCO-2020-Datensatz und die Ergebnisse werden weiterhin für das Vortraining und die Bewertung in vielen Deep-Learning-Frameworks verwendet. Ab 2025 bleibt COCO ein Referenzpunkt, obwohl neuere Datensätze mit höherer Auflösung und Videodaten entstehen.