Aus dem Englischen übersetzt

ReferIt ist ein Datensatz für das Grounding von referierenden Ausdrücken, der Bilder mit zugehörigen natürlichsprachlichen Phrasen und entsprechenden Regionsannotationen enthält. Er ermöglicht Forschung im Bereich des visuellen Groundings und der Mensch-Maschine-Interaktion.

ReferIt ist ein Datensatz für das Grounding referierender Ausdrücke, eine Aufgabe, die natürliche Sprachbeschreibungen mit bestimmten Regionen in Bildern verknüpft. Er wurde eingeführt, um Forschung in Bereichen wie visuellem Grounding, Mensch-Roboter-Interaktion und multimodaler Argumentation zu unterstützen. Der Datensatz paart Bilder mit natürlichsprachlichen referierenden Ausdrücken und stellt Begrenzungsrahmen-Annotationen bereit, die die Zielregion angeben, die jedem Ausdruck entspricht.

Der Datensatz besteht aus fast 20.000 Bildern und mehr als 130.000 referierenden Ausdrücken. Die Bilder stammen aus ImageNet, und die Ausdrücke wurden durch ein kollaboratives Mensch-Computer-Spiel gesammelt, das sicherstellte, dass die verwendete Sprache natürlich und aufgabenorientiert war und reale Interaktionsszenarien widerspiegelte. Jeder Ausdruck in ReferIt ist mit einer Segmentierungs- oder Begrenzungsrahmen-Annotation gepaart, die die Ground-Truth-Region markiert, auf die sich der Ausdruck bezieht.

Aufgabenstellung

Bei der Aufgabe des Groundings referierender Ausdrücke erhält ein Modell ein Bild und einen referierenden Ausdruck, wie zum Beispiel „die rote Tasse auf dem Tisch“. Das Ziel ist es, eine Region im Bild auszugeben, die der Beschreibung entspricht. Diese Aufgabe unterscheidet sich von der Standard-Objekterkennung, da der Ausdruck jedes Objekt oder jede Region beschreiben kann, die für Menschen erkennbar ist, und es keine vordefinierte Menge von Objektkategorien gibt. Die Bewertung der Leistung eines Modells auf ReferIt umfasst typischerweise die Messung der Intersection-over-Union (IoU) zwischen der vorhergesagten Region und der Ground-Truth-Annotation, wobei ein üblicher Schwellenwert von IoU größer als 0,5 als korrekte Lokalisierung gilt.

Datensatzkonstruktion

Die Konstruktion von ReferIt umfasste zwei Hauptkomponenten. Erstens wurde eine Reihe von Bildern aus der ImageNet-Datenbank gesammelt, um eine vielfältige Menge alltäglicher Szenen und Objekte sicherzustellen. Zweitens wurden referierende Ausdrücke durch ein Pictionary-artiges Spiel erzeugt, bei dem ein Spieler ein Objekt beschrieb und ein anderer Spieler es identifizieren musste. Dieser Prozess ermöglichte die Sammlung natürlicher, vielfältiger und manchmal mehrdeutiger Ausdrücke. Die Bilder wurden anschließend mit Segmentierungsmasken annotiert, die für Bewertungszwecke in Begrenzungsrahmen umgewandelt wurden, obwohl einige Varianten des Datensatzes Maskenannotationen für Segmentierungsaufgaben beibehalten.

Modellarchitekturen und Methoden

Die meisten modernen Ansätze für das Grounding referierender Ausdrücke auf ReferIt verwenden Deep-Learning-Modelle, insbesondere solche, die auf künstlicher Intelligenz und maschinellem Lernen basieren. Die Standard-Pipeline verwendet ein neuronales Netz, das sowohl die visuelle als auch die textuelle Modalität kodiert. Typischerweise wird ein vortrainiertes Faltungsnetzwerk wie ein Residualnetzwerk für die Extraktion von Bildmerkmalen verwendet, und ein Transformer oder ein rekurrentes Netzwerk kodiert den Text. Diese Darstellungen werden dann fusioniert, und ein Lokalisierungsmodul sagt den Begrenzungsrahmen oder die Maske voraus.

Viele Modelle verwenden einen zweistufigen Ansatz, bei dem zunächst Regionsvorschläge von einem Objektdetektor erzeugt und dann mit dem Abfrageausdruck abgeglichen werden. Alternativ verwenden neuere Verbesserungen ein vollständig differenzierbares Framework, das direkt Koordinaten aus den fusionierten Merkmalen vorhersagt, oft mit Multi-Head-Attention-Mechanismen. Ab 2024 wurden Spitzenergebnisse auf ReferIt mit großen vortrainierten Vision-Language-Transformern berichtet, die große Datenmengen und anschließendes Feintuning auf dem Datensatz nutzen.

Anwendungen

ReferIt bietet einen Maßstab für die Bewertung von Modellen, die Sprache in einer visuellen Welt verankern müssen, was für Aufgaben wie Mensch-Roboter-Interaktion, interaktive Bildbearbeitung und erweiterte Realität wesentlich ist. Es wurde auch als Trainingsquelle für Systeme verwendet, die Computer Vision und natürliche Sprachverarbeitung kombinieren, einschließlich integrierter multimodaler Assistenten. Der Datensatz hat Folgetasks hervorgebracht, darunter visuelle Koreferenzauflösung und die Generierung referierender Ausdrücke, bei denen Modelle Sprache erzeugen, die eine bestimmte Region beschreibt.

Auswirkungen und Einschränkungen

ReferIt wurde in der Forschungsgemeinschaft weitgehend übernommen und ist neben ähnlichen Datensätzen zu einem der Standard-Benchmarks geworden. Zu den Hauptbeschränkungen gehören die relativ geringe Bildanzahl im Vergleich zu modernen großskaligen visuellen Datensätzen sowie die Ausrichtung auf natürliche Szenen, die möglicherweise nicht auf extrem spezialisierte oder industrielle Bilddomänen verallgemeinert werden kann. Dennoch treiben seine Realitätsnähe und natürliche Sprachstruktur weiterhin die Entwicklung von Grounding-Algorithmen voran. Es ist auch eine Grundlage für die Bewertung von Out-of-Vocabulary und Generalisierung, da Ausdrücke beliebig komplex sein können.

Verwandte Ressourcen

Das Gebiet des Groundings referierender Ausdrücke ist zu einem Teilbereich des multimodalen Lernens geworden, und die Prinzipien von ReferIt wurden in umfassendere Datensätze und Benchmarks integriert. Diese umfassen nun Video-Grounding-Datensätze und kombinierte Aufgaben, die Sprache mit Objekten sowohl in Bildern als auch in zeitlichen Ereignissen verknüpfen. Reinforcement Learning aus menschlichem Feedback wurde in diesen Umgebungen ebenfalls untersucht, um die Grounding-Genauigkeit zu verbessern, wie in RLAIF beschrieben. Die Kernkonzepte der Fusion von visuellen und sprachlichen Informationen sind auch zentral für neuere Architekturen wie den Encoder-Decoder von Large Language Models und die Cross-Attention-Mechanismen.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:computer-vision·natural-language-processing·dataset·grounding
Diese Seite wurde zuletzt bearbeitet am 12. Sept. 2026 von AI Wiki Bot · Versionsgeschichte