ReferIt es un conjunto de datos para el fundamento de expresiones referenciales, una tarea que vincula descripciones en lenguaje natural con regiones específicas dentro de imágenes. Fue introducido para facilitar la investigación en áreas como el fundamento visual, la interacción humano-robot y el razonamiento multimodal. El conjunto de datos empareja imágenes con expresiones referenciales en lenguaje natural y proporciona anotaciones de cajas delimitadoras que especifican la región objetivo correspondiente a cada expresión.
El conjunto de datos consta de casi 20 000 imágenes y más de 130 000 expresiones referenciales. Las imágenes se recopilan de ImageNet, y las expresiones se reunieron mediante un juego colaborativo humano-computadora, lo que garantizó que el lenguaje utilizado fuera natural y orientado a tareas, reflejando escenarios de interacción del mundo real. Cada expresión en ReferIt se empareja con una anotación de segmentación o caja delimitadora que marca la región de verdad fundamental a la que se refiere la frase.
Definición de la tarea
En la tarea de fundamento de expresiones referenciales, un modelo recibe una imagen y una expresión referencial, como "la taza roja sobre la mesa". El objetivo es generar una región en la imagen que coincida con la descripción. Esta tarea difiere de la detección de objetos estándar, porque la expresión puede describir cualquier objeto o región que sea reconocible por los humanos, y no hay un conjunto predefinido de categorías de objetos. Evaluar el rendimiento de un modelo en ReferIt generalmente implica medir la intersección sobre unión (IoU) entre la región predicha y la anotación de verdad fundamental, con un umbral común de IoU mayor que 0.5 considerado como una localización correcta.
Construcción del conjunto de datos
La construcción de ReferIt involucró dos componentes principales. Primero, se recopiló un conjunto de imágenes de la base de datos ImageNet, asegurando una diversidad de escenas y objetos cotidianos. Segundo, las expresiones referenciales se generaron mediante un juego estilo Pictionary, donde un jugador describía un objeto y otro jugador tenía que identificarlo. Este proceso permitió la recopilación de frases naturales, variadas y a veces ambiguas. Las imágenes se anotaron luego con máscaras de segmentación, que posteriormente se convirtieron en cajas delimitadoras para fines de evaluación, aunque algunas variantes del conjunto de datos conservan anotaciones de máscara para tareas de segmentación.
Arquitecturas de modelos y métodos
La mayoría de los enfoques modernos para el fundamento de expresiones referenciales en ReferIt involucran modelos de aprendizaje profundo, particularmente aquellos basados en inteligencia artificial y aprendizaje automático. El flujo de trabajo estándar emplea una red neuronal que codifica tanto la modalidad visual como la textual. Típicamente, una red convolucional preentrenada como red residual se utiliza para la extracción de características de imagen, y un transformador o red recurrente codifica el texto. Estas representaciones se fusionan luego, y un módulo de localización predice la caja delimitadora o máscara.
Muchos modelos utilizan un enfoque de dos etapas donde las propuestas de región se generan primero mediante un detector de objetos, y luego se emparejan con la expresión de consulta. Alternativamente, mejoras recientes usan un marco totalmente diferenciable que predice directamente coordenadas a partir de las características fusionadas, a menudo con mecanismos de atención de múltiples cabezas. A partir de 2024, se han informado resultados de última generación en ReferIt utilizando transformadores de visión-lenguaje preentrenados a gran escala, que aprovechan vastas cantidades de datos y un posterior ajuste fino en el conjunto de datos.
Aplicaciones
ReferIt proporciona un punto de referencia para evaluar modelos que necesitan fundamentar el lenguaje en un mundo visual, lo cual es esencial para tareas como la interacción humano-robot, la edición interactiva de imágenes y la realidad aumentada. También se ha utilizado como fuente de entrenamiento para sistemas que combinan visión por computadora y procesamiento de lenguaje natural, incluidos asistentes multimodales integrados. El conjunto de datos ha dado lugar a tareas derivadas, incluida la resolución de correferencia visual y la generación de expresiones referenciales, donde los modelos producen lenguaje que describe una región dada.
Impacto y limitaciones
ReferIt ha sido ampliamente adoptado en la comunidad de investigación, convirtiéndose en uno de los puntos de referencia estándar, junto con conjuntos de datos similares. Sus principales limitaciones incluyen el número relativamente pequeño de imágenes en comparación con conjuntos de datos visuales modernos a gran escala, y su sesgo hacia escenas naturales, que puede no generalizarse a dominios de imágenes extremadamente especializados o industriales. Sin embargo, su realismo y estructura de lenguaje natural continúan impulsando el desarrollo de algoritmos de fundamento. También es una base para evaluar la generalización y el vocabulario fuera de conjunto, ya que las expresiones pueden ser arbitrariamente complejas.
Recursos relacionados
El área del fundamento de expresiones ha crecido hasta convertirse en un subcampo del aprendizaje multimodal, y los principios de ReferIt se han incorporado en conjuntos de datos y puntos de referencia más completos. Estos ahora incluyen conjuntos de datos de fundamento en video y tareas combinadas, que vinculan el lenguaje con objetos tanto en imágenes como en eventos temporales. El aprendizaje por refuerzo con retroalimentación humana también se ha explorado en estos entornos para mejorar la precisión del fundamento, como se describe en aprendizaje por refuerzo con retroalimentación humana. Los conceptos centrales de fusionar lo visual y el lenguaje también son fundamentales para arquitecturas más nuevas como el codificador-decodificador de los modelos de lenguaje grandes y los mecanismos de atención cruzada.