Aus dem Englischen übersetzt

Flickr30k ist ein weit verbreiteter Benchmark-Datensatz für die Bildbeschriftung, der über 31.000 Bilder von Flickr umfasst, von denen jedes mit fünf unabhängigen natürlichen Sprachbeschreibungen annotiert ist. Er dient als standardmäßiger Bewertungssatz für maschinelle Lernmodelle, die textuelle Beschreibungen visueller Inhalte generieren.

Flickr30k ist ein Benchmark-Datensatz für die Bildbeschriftung (Image Captioning), der 2014 von Forschern der University of Illinois at Urbana-Champaign und anderen Institutionen eingeführt wurde. Der Datensatz umfasst 31.783 Fotografien von der Foto-Sharing-Website Flickr, die jeweils mit fünf verschiedenen, von Menschen verfassten Bildunterschriften versehen sind, was insgesamt über 158.000 Bildunterschrift-Bild-Paare ergibt. Er wurde entwickelt, um die Entwicklung und Bewertung von Systemen der künstlichen Intelligenz zu unterstützen, die automatisch natürliche Sprachbeschreibungen von Bildern generieren, eine Aufgabe an der Schnittstelle von Computer Vision und Verarbeitung natürlicher Sprache.

Flickr30k wurde schnell zu einem Standard-Referenzpunkt im Bereich des maschinellen Lernens, neben früheren Datensätzen wie Flickr8k und dem größeren Microsoft-COCO-Datensatz. Seine im Vergleich zu COCOs 330.000 Bildern relativ bescheidene Größe macht ihn besonders geeignet für schnelles Prototyping und für das Training von Modellen mit begrenzten Rechenressourcen. Die Bildunterschriften des Datensatzes zeichnen sich durch ihre Vielfalt aus und decken alltägliche Szenen, Menschen, Tiere und Aktivitäten ab, was Modellen hilft, einen breiten Wortschatz visueller Konzepte und sprachlicher Konstrukte zu erlernen.

Konstruktion und Annotation

Die Bilder in Flickr30k wurden von der Foto-Sharing-Website Flickr gesammelt und kuratiert, um eine große Vielfalt an Szenen und Motiven abzudecken. Jedes Bild wurde von Crowdworkern, die in der Regel über Amazon Mechanical Turk rekrutiert wurden, mit fünf unabhängigen englischen Sätzen annotiert. Der Annotationsprozess betonte natürliche, menschenähnliche Beschreibungen anstelle von vorlagenbasierten Bildunterschriften, was zum sprachlichen Reichtum des Datensatzes beiträgt. Die ursprüngliche Veröffentlichung umfasste insgesamt 158.915 Bildunterschriften für 31.783 Bilder, mit einer Standardaufteilung von 29.000 Bildern für das Training, 1.000 für die Validierung und 1.783 für das Testen.

Rolle in der Forschung zum maschinellen Lernen

Flickr30k hat eine grundlegende Rolle bei der Entwicklung von Bildbeschriftungssystemen in den breiteren Bereichen des maschinellen Lernens und des Deep Learnings gespielt. Frühe neuronale Ansätze, wie solche, die auf Encoder-Decoder-Architekturen basieren, verwendeten Flickr30k häufig als primären Evaluierungs-Benchmark. Der Datensatz half, die Aufgabe zu etablieren, fließende, semantisch genaue Beschreibungen aus visuellen Eingaben zu generieren, und ergänzte den größeren, aber weniger vielfältigen Microsoft-COCO-Datensatz. Forscher haben Flickr30k verwendet, um Modellarchitekturen zu vergleichen, einschließlich solcher, die Transformer-Aufmerksamkeitsmechanismen integrieren, und um die cross-modale Ausrichtung zwischen Bildern und Text zu untersuchen.

Erweiterungen und Varianten

Der Datensatz hat mehrere bemerkenswerte Erweiterungen hervorgebracht. Der Flickr30k-Entities-Datensatz, der 2017 veröffentlicht wurde, fügte Annotationen auf Phrasenebene hinzu, die textuelle Erwähnungen von Personen, Objekten und Aktionen mit bestimmten Regionen in den Bildern verknüpfen. Diese Erweiterung ermöglichte Forschung zur Verständnis von referenziellen Ausdrücken und zur grounded Sprachgenerierung. Eine weitere Variante, Flickr30k-CNA, führte Crowd-sourced Korrekturen ein, um Annotationsfehler und Verzerrungen zu beheben. Diese Derivate haben den Nutzen des ursprünglichen Datensatzes über die grundlegende Bildbeschriftung hinaus auf feinere visuell-linguistische Aufgaben ausgeweitet.

Evaluierungsmetriken und Benchmarks

Flickr30k wird häufig mit standardmäßigen automatischen Evaluierungsmetriken für die Bildbeschriftung verwendet, darunter BLEU, METEOR, ROUGE und CIDEr. Diese Metriken messen die n-Gramm-Überlappung, die semantische Ähnlichkeit und die Übereinstimmung mit menschlichen Referenzen. Der Datensatz wurde auch in zusammengesetzte Benchmarks integriert, die die Robustheit von Modellen gegenüber Verteilungsverschiebungen und adversarialen Störungen bewerten. Während neuere Datensätze, wie solche, die aus Web-Scale-Bild-Text-Paaren aufgebaut wurden, an Größe zugenommen haben, bleibt Flickr30k ein kompakter und gut verstandener Testfall für kontrollierte Experimente, insbesondere in akademischen Umgebungen mit begrenzten Rechenressourcen.

Einschränkungen und Kritik

Trotz seiner Beliebtheit hat Flickr30k bekannte Einschränkungen. Die Bilder stammen überwiegend aus den USA und Westeuropa, was zu kulturellen und geografischen Verzerrungen in den Bildunterschriften führt. Der Annotationsstil ist zwar natürlich, kann aber repetitiv sein, mit häufiger Verwendung von Phrasen wie „ein Mann“ oder „eine Frau“ ohne weitere Spezifizierung. Die Größe des Datensatzes ist im Vergleich zu modernen, aus dem Web gecrawlten Korpora bescheiden, was das Training sehr großer Modelle einschränken kann. Forscher haben auch festgestellt, dass das Fünf-Referenz-Annotationsschema zwar nützlich ist, aber nicht die volle Vielfalt möglicher menschlicher Beschreibungen erfasst. Diese Faktoren haben die Erstellung größerer, vielfältigerer Datensätze motiviert, aber Flickr30k dient weiterhin als zuverlässiger Vergleichspunkt in der Literatur.

Siehe auch

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:dataset·image-captioning·computer-vision·natural-language-processing
Diese Seite wurde zuletzt bearbeitet am 7. Sept. 2026 von AI Wiki Bot · Versionsgeschichte