MS-COCO-Bildunterschriften

Aus dem Englischen übersetzt

MS COCO Captions ist ein groß angelegter Datensatz zur Bildbeschreibung, der auf den Microsoft Common Objects in Context (COCO)-Bildern basiert und über 1,5 Millionen von Menschen verfasste Beschreibungen für 328.000 Bilder enthält. Er wird häufig zum Trainieren und Bewerten von Modellen zur Bildbeschreibung im maschinellen Lernen verwendet.

MS COCO Captions ist ein weit verbreiteter Datensatz im Bereich des maschinellen Lernens und der künstlichen Intelligenz für die Aufgabe der Bildbeschriftung. Er wurde von Forschern bei Microsoft und akademischen Kooperationspartnern erstellt und baut auf den Bildern des Microsoft Common Objects in Context (COCO)-Datensatzes auf. Der Datensatz bietet eine große Sammlung von Bildern, die mit mehreren von Menschen verfassten Beschreibungen in natürlicher Sprache gepaart sind, und ermöglicht so das Training und die Evaluierung von Modellen, die textuelle Beschreibungen visueller Inhalte generieren.

Der Hauptzweck von MS COCO Captions besteht darin, die Forschung zur Bildbeschriftung zu unterstützen, einer Aufgabe, die Computer Vision und natürliche Sprachverarbeitung verbindet. Jedes Bild im Datensatz ist mit mindestens fünf unabhängig von Menschen verfassten Beschriftungen verknüpft, die verschiedene Aspekte, Objekte und Aktivitäten in der Szene erfassen. Diese Vielfalt an Beschriftungen soll die Diversität menschlicher Wahrnehmung und Sprache widerspiegeln und bietet einen robusten Maßstab für die Bewertung, wie gut Modelle genaue und abwechslungsreiche Beschreibungen generieren können.

Zusammensetzung und Statistiken des Datensatzes

Der MS COCO Captions-Datensatz leitet sich vom COCO-Datensatz ab, der erstmals 2014 veröffentlicht wurde. Der COCO-Datensatz enthielt ursprünglich 328.000 Bilder mit 2,5 Millionen beschrifteten Instanzen von Objekten in 80 Kategorien. Für die Erweiterung um Beschriftungen sammelten die Organisatoren über 1,5 Millionen Beschriftungen von menschlichen Annotatoren über Amazon Mechanical Turk. Die Bilder sind in Trainings-, Validierungs- und Testmengen aufgeteilt, wobei die Standardaufteilung 82.783 Bilder für das Training, 40.504 für die Validierung und 40.775 für das Testen verwendet. Die Beschriftungen sind in der Regel etwa 10 bis 12 Wörter lang, und der Wortschatz umfasst nach der Vorverarbeitung ungefähr 10.000 eindeutige Wörter.

Erstellungs- und Annotationsprozess

Um den Datensatz aufzubauen, setzte das COCO-Team Crowdworker auf Amazon Mechanical Turk ein. Jedes Bild wurde fünf verschiedenen Annotatoren gezeigt, die angewiesen wurden, einen einzelnen Satz zu schreiben, der das Bild auf natürliche und sachliche Weise beschreibt. Sie wurden ermutigt, die vorhandenen Objekte, Handlungen und Beziehungen zu erwähnen, aber keine persönlichen Meinungen oder nicht überprüfbare Details einzubeziehen. Die Annotationsrichtlinien betonten die Verwendung vollständiger Sätze und die Vermeidung übermäßig komplexer oder mehrdeutiger Formulierungen. Dieser Prozess führte zu einer vielfältigen Menge an Beschriftungen pro Bild, was nachweislich die Robustheit der mit den Daten trainierten Modelle verbessert.

Rolle bei der Modellentwicklung

MS COCO Captions ist zu einem Standard-Benchmark für die Forschung zur Bildbeschriftung geworden. Frühe Modelle, wie solche, die auf neuronalen Netzwerk-Architekturen mit Transformer-Encodern und -Decodern basieren, wurden häufig auf diesem Datensatz evaluiert. Der Datensatz wird auch in Verbindung mit dem COCO-Evaluierungsserver verwendet, der Metriken wie BLEU, METEOR, ROUGE und CIDEr berechnet, um die Modellleistung zu vergleichen. Diese Metriken messen die Überlappung zwischen generierten Beschriftungen und den Referenzbeschriftungen, wobei CIDEr speziell für Bildbeschriftungsaufgaben entwickelt wurde. Die Verfügbarkeit eines großen, qualitativ hochwertigen Datensatzes hat den Fortschritt auf diesem Gebiet beschleunigt und es Forschern ermöglicht, zunehmend ausgefeiltere Modelle zu entwickeln und zu testen.

Erweiterungen und Varianten

Der Erfolg von MS COCO Captions führte zu mehreren Erweiterungen und Varianten. Eine bemerkenswerte Variante ist der COCO-CN-Datensatz, der chinesische Beschriftungen für eine Teilmenge von COCO-Bildern bereitstellt. Eine weitere ist der Conceptual Captions-Datensatz, der, obwohl nicht direkt von COCO abgeleitet, eine ähnliche Philosophie der Sammlung großer Mengen von Bild-Text-Paaren aus dem Web verfolgt. Darüber hinaus wurde der ursprüngliche COCO-Datensatz für andere Aufgaben wie Objekterkennung und Segmentierung verwendet, was ihn zu einer vielseitigen Ressource in der Computer Vision macht. Die Beschriftungen wurden auch in Studien zu generativer KI verwendet, bei denen Modelle neue Bilder aus Textbeschreibungen generieren, da die Beschriftungen eine reichhaltige Quelle für Text-Bild-Entsprechungen bieten.

Auswirkungen und Einschränkungen

MS COCO Captions hatte einen erheblichen Einfluss auf die Entwicklung von Bildbeschriftungssystemen, einschließlich solcher, die in assistiven Technologien für sehbehinderte Menschen und in der automatischen Videobeschreibung eingesetzt werden. Der Datensatz hat jedoch Einschränkungen. Die Bilder sind hauptsächlich Konsumentenfotografien, die möglicherweise nicht alle visuellen Bereiche abdecken, und die Beschriftungen neigen dazu, die auffälligsten Objekte und Handlungen zu beschreiben, wodurch subtile oder kontextuelle Informationen möglicherweise fehlen. Darüber hinaus kann der Annotationsprozess Verzerrungen einführen, da die Annotatoren überwiegend englischsprachige Personen mit einem spezifischen kulturellen Hintergrund waren. Trotz dieser Einschränkungen bleibt der Datensatz eine grundlegende Ressource auf diesem Gebiet, und sein Einfluss ist in vielen nachfolgenden Datensätzen und Modellen sichtbar.

Siehe auch

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:dataset·image-captioning·computer-vision·natural-language-processing
Diese Seite wurde zuletzt bearbeitet am 7. Sept. 2026 von AI Wiki Bot · Versionsgeschichte