Traduzido do inglês

RefCOCO é um conjunto de dados para compreensão de expressões de referência, construído sobre imagens do MS COCO com frases em linguagem natural e anotações de caixas delimitadoras, utilizado para treinar e avaliar modelos de visão-linguagem.

RefCOCO é um conjunto de dados amplamente utilizado em visão computacional e processamento de linguagem natural para a tarefa de compreensão de expressões de referência. Ele consiste em imagens do conjunto de dados Microsoft Common Objects in Context (MS COCO), cada uma pareada com expressões de referência em linguagem natural que identificam objetos específicos dentro da imagem, juntamente com anotações correspondentes de caixas delimitadoras. O conjunto de dados foi introduzido para apoiar a pesquisa em fundamentar a linguagem em objetos visuais, uma capacidade fundamental para sistemas que precisam entender e interagir com cenas visuais por meio da linguagem.

O conjunto de dados foi criado por pesquisadores da Universidade da Califórnia, Berkeley, e foi apresentado pela primeira vez em 2014. Ele contém mais de 50.000 expressões de referência para quase 20.000 objetos em aproximadamente 19.000 imagens. As expressões são coletadas por meio de uma interface semelhante a um jogo, onde anotadores descrevem objetos de uma maneira que os identifique exclusivamente dentro da imagem, garantindo que as frases sejam contextualmente relevantes e discriminativas. RefCOCO tornou-se um padrão de referência para avaliar modelos que realizam compreensão de expressões de referência, onde o objetivo é localizar o objeto descrito por uma determinada frase.

Estrutura e Anotação

RefCOCO é construído sobre o conjunto de dados MS COCO, que fornece um conjunto diversificado de imagens com máscaras de segmentação em nível de instância. As expressões de referência em RefCOCO são frases curtas em linguagem natural, tipicamente de uma a algumas palavras, que descrevem um objeto por seus atributos, localização ou relação com outros objetos. Por exemplo, uma frase pode ser "o carro vermelho à esquerda" ou "a mulher segurando um guarda-chuva". Cada expressão é pareada com uma caixa delimitadora que envolve firmemente o objeto referido. As anotações são divididas em conjuntos de treinamento, validação e teste, com o conjunto de teste ainda dividido em dois subconjuntos (TestA e TestB) para avaliar a generalização para diferentes tipos de expressões.

O processo de anotação envolveu uma abordagem em duas etapas. Primeiro, os anotadores foram mostrados a uma imagem e solicitados a identificar todos os objetos de interesse, que foram então rotulados com categorias da taxonomia do MS COCO. Segundo, um grupo separado de anotadores foi solicitado a descrever cada objeto de uma maneira que permitisse a outra pessoa identificá-lo exclusivamente. Esse processo garantiu que as expressões fossem naturais e variadas, capturando a maneira como os humanos se referem a objetos em contexto.

Definição da Tarefa

A tarefa principal associada ao RefCOCO é a compreensão de expressões de referência, também conhecida como fundamentação visual. Dada uma imagem e uma expressão em linguagem natural, um modelo deve produzir uma caixa delimitadora que localize o objeto referido. Essa tarefa exige que o modelo entenda tanto o conteúdo visual quanto a semântica da linguagem, incluindo atributos, relações espaciais e categorias de objetos. RefCOCO também suporta uma tarefa relacionada de geração de expressões de referência, onde o modelo deve produzir uma descrição em linguagem natural para um objeto dado em uma imagem.

As métricas de avaliação para a tarefa de compreensão tipicamente incluem precisão em diferentes limiares de Intersecção sobre União (IoU), como IoU > 0,5, onde a caixa delimitadora prevista deve sobrepor-se à caixa de verdade fundamental em mais da metade. Essa métrica mede tanto a precisão da localização quanto a capacidade de identificar corretamente o objeto alvo entre distratores.

Impacto e Uso

RefCOCO tem sido fundamental para avançar a pesquisa em compreensão visão-linguagem. Ele tem sido usado para treinar e avaliar numerosos modelos, desde abordagens iniciais baseadas em aprendizado profundo e redes neurais até modelos mais recentes baseados em transformadores. O conjunto de dados também gerou variantes, como RefCOCO+ e RefCOCOg, que diferem no estilo e na complexidade das expressões de referência. RefCOCO+ foca em expressões que descrevem aparência sem localização, enquanto RefCOCOg contém frases mais longas e descritivas.

O conjunto de dados é frequentemente usado em conjunto com outros padrões de referência para avaliar o desempenho de sistemas baseados em modelos de linguagem de grande escala que integram entradas visuais, como aqueles desenvolvidos por organizações como openai e google-deepmind. Ele serve como um campo de teste para modelos de IA generativa que precisam fundamentar a linguagem em dados visuais, uma capacidade crítica para aplicações como legendagem de imagens, resposta a perguntas visuais e interação humano-robô.

Desafios e Limitações

Apesar de seu uso generalizado, RefCOCO tem certas limitações. As imagens são extraídas do MS COCO, que contém principalmente cenas cotidianas com objetos comuns, limitando a diversidade de domínios. As expressões de referência são relativamente curtas e podem não capturar toda a complexidade da linguagem natural, como referências pragmáticas ou ambíguas. Além disso, o conjunto de dados tem um viés em relação a certas categorias de objetos e configurações espaciais, o que pode levar a overfitting em modelos treinados nele.

Pesquisadores abordaram alguns desses problemas criando versões estendidas ou usando RefCOCO como uma etapa de pré-treinamento antes do ajuste fino em conjuntos de dados mais desafiadores. O conjunto de dados permanece um padrão para avaliar a capacidade central de fundamentação visual, e seu uso contínuo reflete sua importância no campo da inteligência artificial.

Trabalhos Relacionados e Extensões

RefCOCO inspirou uma linha de pesquisa em compreensão e geração de expressões de referência. Muitos modelos foram propostos que combinam características visuais com embeddings de linguagem, frequentemente usando mecanismos de atenção para alinhar palavras com regiões de imagem. O conjunto de dados também tem sido usado para estudar o papel do contexto, como a influência de objetos distratores na dificuldade de compreensão. Extensões como RefCOCOg fornecem expressões mais complexas, e outros conjuntos de dados foram criados para expressões de referência em vídeos ou cenas 3D, mas RefCOCO permanece um recurso fundamental.

O desenvolvimento de RefCOCO está alinhado com tendências mais amplas em aprendizado de máquina e visão computacional, onde grandes conjuntos de dados anotados são cruciais para treinar e avaliar modelos. Ele tem sido um recurso-chave para a comunidade, permitindo comparações reproduzíveis e impulsionando o progresso na compreensão multimodal.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:computer-vision·dataset·vision-language·referring-expression
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico