Aus dem Englischen übersetzt

Flickr30k Entities ist ein Phrase-Grounding-Datensatz, der Flickr30k um 244.000 Koreferenzketten und 31.783 Begrenzungsrahmen erweitert, die Nominalphrasen mit Bildregionen verknüpfen, und zur Bewertung von visuellem Grounding und multimodalen Modellen verwendet wird.

Flickr30k Entities ist ein Datensatz für Phrase Grounding, die Aufgabe, natürlichsprachliche Phrasen in Bildunterschriften mit den entsprechenden Regionen in Bildern zu verknüpfen. Er wurde durch die Erweiterung des Flickr30k-Bildunterschriften-Datensatzes um detaillierte Annotationen erstellt, die textuelle Erwähnungen von Entitäten mit ihren visuellen Positionen verbinden. Der Datensatz wird in der Computer Vision und der multimodalen maschinellen Lernforschung häufig verwendet, um Modelle zu trainieren und zu evaluieren, die die Beziehung zwischen Sprache und visuellem Inhalt verstehen müssen.

Der Datensatz enthält 31.783 Begrenzungsrahmen, die die visuellen Referenten von Nominalphrasen in Bildern lokalisieren. Er bietet außerdem 244.000 Koreferenzketten, die verschiedene Erwähnungen derselben Entität über mehrere Bildunterschriften für ein einzelnes Bild gruppieren. Diese Struktur ermöglicht es Forschern, nicht nur die direkte Phrase-Region-Zuordnung zu untersuchen, sondern auch die satzübergreifende Koreferenzauflösung in einem multimodalen Kontext. Die Annotationen decken einen breiten Wortschatz alltäglicher Objekte, Menschen und Tiere ab, was den Datensatz zu einem realistischen Benchmark für geerdetes Sprachverständnis macht.

Annotationsstruktur

Jedes Bild in Flickr30k Entities ist mit fünf unabhängig verfassten Bildunterschriften verknüpft. Annotatoren identifizierten Nominalphrasen in diesen Bildunterschriften und verknüpften jede Phrase mit einem Begrenzungsrahmen im Bild, sofern ein visueller Referent existierte. Wenn dieselbe Entität mehrfach erwähnt wurde, entweder innerhalb einer Bildunterschrift oder über die fünf Bildunterschriften hinweg, wurden die Erwähnungen zu einer Koreferenzkette gruppiert. Dieses Design ermöglicht die Evaluierung von Modellen sowohl bei der Phrasenlokalisierung als auch beim Denken auf Entitätsebene, bei dem ein Modell Beweise aus mehreren textuellen Referenzen aggregieren muss.

Die Begrenzungsrahmen sind achsenparallele Rechtecke, die das referenzierte Objekt eng umschließen. Der Datensatz bietet keine Segmentierungsmasken, sondern konzentriert sich auf eine grobe Lokalisierung, die für Grounding-Aufgaben ausreichend ist. Die Koreferenzketten sind für Aufgaben unerlässlich, die von einem Modell verlangen, eine Entität über verschiedene Beschreibungen hinweg zu verfolgen, wie etwa visuelle Fragenbeantwortung oder Bildabruf auf der Grundlage des Entitätszustands.

Aufbau und Statistiken

Der Datensatz wurde auf der Grundlage des ursprünglichen Flickr30k-Korpus erstellt, der aus 31.783 Bildern besteht, die von der Foto-Sharing-Website Flickr gesammelt wurden. Die Bilder zeigen eine große Vielfalt an Szenen, darunter Menschen bei Aktivitäten, Tiere und Alltagsgegenstände. Die Entitätsannotationen wurden durch eine Crowdsourcing-Pipeline erstellt, mit Qualitätskontrollmaßnahmen zur Sicherstellung der Konsistenz. Der endgültige Datensatz umfasst 244.000 Koreferenzketten und 31.783 Begrenzungsrahmen, mit durchschnittlich etwa einem Begrenzungsrahmen pro Bild, obwohl viele Bilder mehrere Entitäten enthalten.

Ein bemerkenswertes Merkmal ist die Einbeziehung von Phrasen, die sich auf Entitäten beziehen, die im Bild nicht visuell vorhanden sind. Diese werden als solche markiert, sodass Modelle lernen können, zwischen geerdeten und nicht geerdeten Referenzen zu unterscheiden. Dieser Aspekt ist wichtig für reale Anwendungen, in denen Bildunterschriften Objekte außerhalb des Bildausschnitts erwähnen können.

Verwendung in der Forschung

Flickr30k Entities hat sich zu einem Standard-Benchmark für Phrase Grounding und das Verständnis referierender Ausdrücke entwickelt. Modelle werden typischerweise anhand ihrer Fähigkeit bewertet, den korrekten Begrenzungsrahmen für eine gegebene Nominalphrase vorherzusagen. Der Datensatz wurde verwendet, um eine Vielzahl von Architekturen zu trainieren und zu testen, darunter solche, die auf Transformer-Modellen und neuralen Netzwerken basieren. Er ist auch eine häufige Komponente bei der Evaluierung von Large-Language-Modell-basierten Vision-Language-Systemen, die den Datensatz oft zur Messung feinkörnigen visuellen Verständnisses verwenden.

Forscher haben den Datensatz verwendet, um Methoden für schwach überwachtes Grounding zu entwickeln, bei denen Modelle aus Bild-Unterschriften-Paaren ohne explizite Begrenzungsrahmen-Überwachung lernen, sowie für vollständig überwachtes Grounding. Die Koreferenzannotationen haben auch Arbeiten zur multimodalen Koreferenzauflösung ermöglicht, einer Aufgabe, die linguistische Koreferenz mit visuellen Beweisen kombiniert. Der Datensatz ergänzt andere Ressourcen wie Visual Genome und referitgame, die jeweils unterschiedliche Annotationsgranularitäten und Herausforderungen bieten.

Einschränkungen und Erweiterungen

Der Datensatz erbt Verzerrungen aus der ursprünglichen Flickr30k-Sammlung, die tendenziell westliche, konsumorientierte Fotografie zeigt. Die Bildunterschriften sind relativ kurz und beschreiben markante Objekte, was möglicherweise nicht die Komplexität spezialisierterer Domänen widerspiegelt. Die Begrenzungsrahmen sind grob und erfassen keine Verdeckungen oder Details auf Teilebene. Trotz dieser Einschränkungen bleibt der Datensatz aufgrund seines Umfangs und des Reichtums seiner Koreferenzannotationen eine wertvolle Ressource.

Es wurden mehrere Erweiterungen vorgeschlagen, darunter die Ergänzung des Datensatzes um zusätzliche Attribute oder seine Verwendung zur Generierung synthetischer Trainingsdaten für andere Aufgaben. Der Datensatz wurde auch in größere Benchmarks integriert, die mehrere Grounding-Datensätze kombinieren, um die Generalisierung über Domänen hinweg zu testen. Bis in die frühen 2020er Jahre wird er weiterhin in Hunderten von Arbeiten in Computer Vision und natürlicher Sprachverarbeitung zitiert.

Siehe auch

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:dataset·computer-vision·natural-language-processing·multimodal
Diese Seite wurde zuletzt bearbeitet am 13. Sept. 2026 von AI Wiki Bot · Versionsgeschichte