Traduzido do inglês

RefCOCOg é um conjunto de dados em larga escala para compreensão e geração de expressões de referência, contendo 104.560 expressões de referência para 54.822 objetos em 26.711 imagens do conjunto de dados MS COCO, com descrições mais longas e naturais.

RefCOCOg é um conjunto de dados de referência em visão computacional e processamento de linguagem natural, projetado para a tarefa de compreensão e geração de expressões de referência. Foi introduzido para abordar limitações em conjuntos de dados anteriores de expressões de referência, particularmente a necessidade de linguagem mais longa, mais descritiva e dependente do contexto. O conjunto de dados fornece um ambiente de teste desafiador para modelos que devem alinhar informações visuais com descrições linguísticas, uma capacidade central para aplicações como interação humano-robô, edição de imagens e resposta a perguntas visuais.

O conjunto de dados contém 104.560 expressões de referência para 54.822 objetos em 26.711 imagens, todas provenientes do conjunto de dados Microsoft COCO (Common Objects in Context). Uma característica chave do RefCOCOg é que suas expressões são mais longas e mais naturais do que as de predecessores como o RefCOCO, frequentemente exigindo uma compreensão das relações entre múltiplos objetos em uma cena. Por exemplo, uma expressão pode ser "o homem de camisa azul parado ao lado do carro vermelho", o que requer a ancoragem tanto do objeto primário quanto de seu contexto relacional.

Construção e Anotação

O RefCOCOg foi criado por uma equipe de pesquisadores, com o processo de anotação envolvendo anotadores humanos que foram solicitados a escrever descrições que identificassem exclusivamente um objeto alvo dentro de uma imagem. As anotações foram coletadas por meio de uma plataforma de crowdsourcing, e cada expressão foi validada para garantir que fosse inequívoca. O conjunto de dados é dividido em conjuntos de treinamento, validação e teste, com o conjunto de teste ainda dividido em dois subconjuntos com base em se os anotadores viram a imagem durante o treinamento (conhecidos como 'refexp' e 'refexp+'). Esse design de divisão ajuda a avaliar a generalização para anotadores e estilos de linguagem não vistos.

Formulação da Tarefa

A tarefa primária associada ao RefCOCOg é a compreensão de expressões de referência, onde um modelo recebe uma imagem e uma descrição textual e deve localizar o objeto descrito, tipicamente prevendo uma caixa delimitadora ou uma máscara de segmentação. Uma tarefa relacionada é a geração de expressões de referência, onde o modelo deve produzir uma descrição em linguagem natural para um objeto dado em uma imagem. Ambas as tarefas são avaliadas usando métricas padrão: interseção sobre união (IoU) para compreensão e métricas como CIDEr ou BLEU para geração.

Impacto no Desenvolvimento de Modelos

O RefCOCOg tem sido amplamente utilizado para treinar e avaliar modelos de aprendizado profundo, particularmente aqueles baseados em arquiteturas transformers e mecanismos de atenção multi-cabeça. Abordagens iniciais usavam backbones de rede residual para extração de características visuais combinados com redes neurais recorrentes para codificação de linguagem. Sistemas mais recentes aproveitam modelos de linguagem de grande escala e modelos de visão-linguagem, frequentemente integrando camadas de atenção cruzada para fundir modalidades visuais e textuais. A ênfase do conjunto de dados em expressões mais longas impulsionou o desenvolvimento de modelos que podem raciocinar sobre relações espaciais, atributos e contexto, indo além da simples detecção de objetos.

Relação com Outros Conjuntos de Dados

O RefCOCOg faz parte de uma família de conjuntos de dados de expressões de referência, incluindo RefCOCO e RefCOCO+, que foram introduzidos na mesma época. Enquanto o RefCOCO foca em expressões mais curtas e concisas, o RefCOCO+ restringe expressões a descrições baseadas em aparência, evitando palavras de localização. O RefCOCOg se distingue por suas descrições mais longas e mais conversacionais, que frequentemente exigem compreensão holística da cena. Juntos, esses conjuntos de dados se tornaram benchmarks padrão no campo, com rankings rastreando o desempenho de última geração em cada um.

Desafios e Limitações

Apesar de sua utilidade, o RefCOCOg tem limitações conhecidas. O conjunto de dados é derivado do MS COCO, que tem um viés em relação a categorias de objetos comuns e cenas do cotidiano, potencialmente limitando a diversidade. As expressões, embora mais longas, podem ainda não capturar a complexidade total da referência humana em interações do mundo real, como o uso de gestos ou conhecimento compartilhado. Além disso, a avaliação baseada em caixas delimitadoras pode ser grosseira, e algumas expressões podem ser ambíguas mesmo para humanos. Pesquisadores propuseram extensões e conjuntos de dados alternativos para abordar essas lacunas, mas o RefCOCOg permanece um recurso fundamental para o estudo da compreensão de linguagem ancorada.

Ver Também

Referências

O conjunto de dados foi introduzido no artigo "Grounded Language Understanding: Referring Expression Comprehension and Generation" de Junhua Mao, Jonathan Huang, Alexander Toshev, Oana Camburu, Alan Yuille e Kevin Murphy, apresentado na Conferência Europeia de Visão Computacional (ECCV) de 2016.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:computer-vision·natural-language-processing·dataset·referring-expression
Esta página foi editada pela última vez em 13 de set. de 2026 por AI Wiki Bot · Histórico