Traduzido do inglês

ReferIt é um conjunto de dados para fundamentação de expressões de referência, contendo imagens com frases associadas em linguagem natural e anotações de regiões correspondentes. Ele possibilita pesquisa em fundamentação visual e interação humano-máquina.

ReferIt é um conjunto de dados para fundamentação de expressões de referência, uma tarefa que vincula descrições em linguagem natural a regiões específicas dentro de imagens. Ele foi introduzido para facilitar a pesquisa em áreas como fundamentação visual, interação humano-robô e raciocínio multimodal. O conjunto de dados emparelha imagens com expressões de referência em linguagem natural e fornece anotações de caixas delimitadoras que especificam a região alvo correspondente a cada expressão.

O conjunto de dados consiste em quase 20.000 imagens e mais de 130.000 expressões de referência. As imagens são coletadas do ImageNet, e as expressões foram reunidas por meio de um jogo colaborativo humano-computador, o que garantiu que a linguagem usada fosse natural e orientada a tarefas, refletindo cenários reais de interação. Cada expressão no ReferIt é emparelhada com uma anotação de segmentação ou caixa delimitadora que marca a região de referência à qual a frase se refere.

Definição da Tarefa

Na tarefa de fundamentação de expressões de referência, um modelo recebe uma imagem e uma expressão de referência, como "o copo vermelho sobre a mesa". O objetivo é produzir uma região na imagem que corresponda à descrição. Essa tarefa difere da detecção de objetos padrão, porque a expressão pode descrever qualquer objeto ou região reconhecível por humanos, e não há um conjunto predefinido de categorias de objetos. Avaliar o desempenho de um modelo no ReferIt normalmente envolve medir a interseção sobre união (IoU) entre a região prevista e a anotação de referência, com um limiar comum de IoU maior que 0,5 considerado uma localização correta.

Construção do Conjunto de Dados

A construção do ReferIt envolveu dois componentes principais. Primeiro, um conjunto de imagens foi coletado do banco de dados ImageNet, garantindo uma diversidade de cenas e objetos do cotidiano. Segundo, expressões de referência foram geradas por meio de um jogo no estilo Pictionary, onde um jogador descrevia um objeto e outro jogador tinha que identificá-lo. Esse processo permitiu a coleta de frases naturais, variadas e, às vezes, ambíguas. As imagens foram então anotadas com máscaras de segmentação, que foram posteriormente convertidas em caixas delimitadoras para fins de avaliação, embora algumas variantes do conjunto de dados mantenham anotações de máscara para tarefas de segmentação.

Arquiteturas de Modelo e Métodos

A maioria das abordagens modernas para fundamentação de expressões de referência no ReferIt envolve modelos de aprendizado profundo, particularmente aqueles baseados em inteligência artificial e aprendizado de máquina. O pipeline padrão emprega uma rede neural que codifica tanto a modalidade visual quanto a textual. Tipicamente, uma rede convolucional pré-treinada, como a rede residual, é usada para extração de características de imagem, e um transformador ou rede recorrente codifica o texto. Essas representações são então fundidas, e um módulo de localização prevê a caixa delimitadora ou máscara.

Muitos modelos utilizam uma abordagem de dois estágios, onde propostas de regiões são primeiro geradas por um detector de objetos e depois combinadas com a expressão de consulta. Alternativamente, melhorias recentes usam uma estrutura totalmente diferenciável que prevê coordenadas diretamente das características fundidas, frequentemente com mecanismos de atenção de múltiplas cabeças. Em 2024, resultados de última geração no ReferIt foram relatados usando transformadores visão-linguagem pré-treinados em larga escala, que aproveitam grandes quantidades de dados e ajuste fino subsequente no conjunto de dados.

Aplicações

O ReferIt fornece um benchmark para avaliar modelos que precisam fundamentar linguagem em um mundo visual, o que é essencial para tarefas como interação humano-robô, edição de imagens interativa e realidade aumentada. Ele também foi usado como fonte de treinamento para sistemas que combinam visão computacional e processamento de linguagem natural, incluindo assistentes multimodais integrados. O conjunto de dados deu origem a tarefas complementares, incluindo resolução de coreferência visual e geração de expressões de referência, onde modelos produzem linguagem descrevendo uma região dada.

Impacto e Limitações

O ReferIt foi amplamente adotado na comunidade de pesquisa, tornando-se um dos benchmarks padrão, juntamente com conjuntos de dados semelhantes. Suas principais limitações incluem o número relativamente pequeno de imagens em comparação com conjuntos de dados visuais modernos em larga escala, e seu viés para cenas naturais, que pode não generalizar para domínios de imagem extremamente especializados ou industriais. No entanto, seu realismo e estrutura de linguagem natural continuam a impulsionar o desenvolvimento de algoritmos de fundamentação. Ele também é uma base para avaliar generalização e vocabulário fora do conjunto, já que as expressões podem ser arbitrariamente complexas.

Recursos Relacionados

A área de fundamentação de expressões cresceu para um subcampo do aprendizado multimodal, e os princípios do ReferIt foram incorporados a conjuntos de dados e benchmarks mais abrangentes. Esses agora incluem conjuntos de dados de fundamentação em vídeo e tarefas combinadas, vinculando linguagem a objetos tanto em imagens quanto em eventos temporais. Aprendizado por reforço com feedback humano também foi explorado nesses contextos para melhorar a precisão da fundamentação, conforme descrito em aprendizado por reforço com feedback humano. Os conceitos centrais de fundir visual e linguagem também são centrais para arquiteturas mais novas, como o codificador-decodificador de modelos de linguagem de grande escala e os mecanismos de atenção cruzada.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:computer-vision·natural-language-processing·dataset·grounding
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico