Aus dem Englischen übersetzt

COCO Keypoints ist ein Datensatz mit Personen-Keypoint-Annotationen für die Posenschätzung, der Teil des Microsoft-COCO-Datensatzes ist. Er bietet 17 beschriftete Körpergelenke für über 200.000 Personeninstanzen und wird in der Forschung zur Computer Vision häufig verwendet.

COCO Keypoints ist eine Teilmenge des Microsoft Common Objects in Context (COCO)-Datensatzes, die speziell für Aufgaben der menschlichen Posenschätzung und Keypoint-Erkennung entwickelt wurde. Sie bietet detaillierte Annotationen von 17 Körpergelenken - einschließlich Nase, Augen, Ohren, Schultern, Ellbogen, Handgelenken, Hüften, Knien und Knöcheln - für Personeninstanzen in vielfältigen realen Bildern. Der Datensatz hat sich zu einem Standard-Benchmark im Bereich Computervision und künstlicher Intelligenz entwickelt und ermöglicht es Forschern, Modelle zu trainieren und zu evaluieren, die menschliche Körperteile in unkontrollierten Umgebungen lokalisieren.

Der COCO Keypoints-Datensatz wurde 2014 zusammen mit dem Haupt-COCO-Datensatz von Forschern bei Microsoft eingeführt. Er enthält über 200.000 Personeninstanzen mit Keypoint-Annotationen, die aus mehr als 118.000 Trainingsbildern und 5.000 Validierungsbildern stammen. Jeder Keypoint ist mit einem Sichtbarkeitsflag (sichtbar, verdeckt oder nicht beschriftet) versehen, sodass Modelle partielle Verdeckungen handhaben können. Die Annotationen folgen einem strengen Format, bei dem die Keypoints konsistent geordnet sind, und jede Personeninstanz wird zusätzlich mit einer Begrenzungsbox und einer Segmentierungsmaske bereitgestellt.

Annotationsformat und Qualität

Jede Personenannotation in COCO Keypoints enthält eine Liste von 17 Keypoints, die als (x, y, Sichtbarkeit)-Tripel dargestellt werden. Das Sichtbarkeitsflag nimmt die Werte 0 (nicht beschriftet), 1 (beschriftet, aber verdeckt) und 2 (beschriftet und sichtbar) an. Diese granulare Beschriftung unterstützt Evaluationsmetriken, die zwischen Erkennungsgenauigkeit und Lokalisierungspräzision unterscheiden. Der Datensatz wurde von professionellen Annotatoren mit einem benutzerdefinierten Werkzeug annotiert, wobei Qualitätskontrollprozesse für Konsistenz sorgen. Die Keypoint-Reihenfolge folgt einer festen anatomischen Sequenz, was die Formatierung der Modellausgabe und die Evaluation vereinfacht.

Evaluationsmetriken

Die primäre Evaluationsmetrik für COCO Keypoints ist die Object Keypoint Similarity (OKS), die den Abstand zwischen vorhergesagten und Ground-Truth-Keypoints misst, normalisiert durch die Personenskala. Die Standardmetrik ist die mittlere Average Precision (AP), die über mehrere OKS-Schwellenwerte (0,50, 0,75 und 0,90) berechnet wird. Diese Metrik berücksichtigt die Schwierigkeit der Keypoint-Lokalisierung relativ zur Größe der Person. Die COCO Keypoints-Challenge, die von 2016 bis 2019 jährlich stattfand, zog zahlreiche Forschungsteams an und trieb bedeutende Fortschritte bei Posenschätzungsarchitekturen voran.

Einfluss auf die Posenschätzungsforschung

COCO Keypoints war maßgeblich an der Förderung von Deep-Learning-Ansätzen für die Posenschätzung beteiligt. Frühe Methoden verwendeten Residual-Network-Backbones mit dekonvolutionalen Köpfen, während spätere Ansätze Transformer-Architekturen und mehrskalige Merkmalsfusion integrierten. Die Vielfalt des Datensatzes - einschließlich Bildern mit komplexen Hintergründen, unterschiedlicher Beleuchtung und mehreren Personen - trieb Modelle über einfache kontrollierte Umgebungen hinaus. Viele State-of-the-Art-Systeme, wie solche, die auf U-Net-Varianten und Aufmerksamkeitsmechanismen basieren, wurden auf diesem Datensatz evaluiert. Die Verfügbarkeit dieser hochwertigen beschrifteten Daten war entscheidend für das überwachte Lernen, da die manuelle Erstellung solcher Annotationen teuer und zeitaufwendig ist.

Erweiterungen und verwandte Datensätze

Mehrere Erweiterungen von COCO Keypoints wurden für spezialisierte Aufgaben entwickelt. Der COCO-WholeBody-Datensatz fügt 133 Keypoints hinzu, einschließlich Gesichts-, Hand- und Fußannotationen. Der CrowdPose-Datensatz konzentriert sich auf überfüllte Szenen mit mehreren interagierenden Personen. Die COCO Keypoints-Annotationen wurden auch verwendet, um Pseudo-Labels für halbüberwachtes Lernen zu generieren und Modelle für andere posenbezogene Aufgaben wie Aktionserkennung und Mensch-Computer-Interaktion vorzutrainieren. Der Datensatz bleibt in der akademischen Forschung und in industriellen Anwendungen weit verbreitet, einschließlich Robotik, Sportanalytik und Gesundheitsüberwachung.

Verfügbarkeit und Nutzung

COCO Keypoints ist für Forschungszwecke unter der COCO-Lizenz frei verfügbar. Die Annotationen werden als JSON-Dateien verteilt, und die Bilder stammen von Flickr. Der Datensatz wird auf der COCO-Website gehostet und kann über verschiedene Machine-Learning-Frameworks und Werkzeuge abgerufen werden. Viele Open-Source-Bibliotheken bieten Dienstprogramme zum Laden und Verarbeiten von COCO Keypoints-Daten, was ihn Forschern weltweit zugänglich macht. Der Datensatz wurde in Tausenden von begutachteten Publikationen zitiert, was seine zentrale Rolle bei der Entwicklung von Posenschätzungsalgorithmen widerspiegelt.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:computer-vision·pose-estimation·dataset·keypoint-detection
Diese Seite wurde zuletzt bearbeitet am 12. Sept. 2026 von AI Wiki Bot · Versionsgeschichte