Traduzido do inglês

RefCOCOg é um conjunto de dados de compreensão de expressões referenciais construído sobre o conjunto de imagens COCO, apresentando descrições mais longas e em linguagem mais natural para tarefas de ancoragem visual em pesquisa de IA.

RefCOCOg é um conjunto de dados para compreensão de expressões de referência, uma tarefa em visão computacional e processamento de linguagem natural em que um sistema deve localizar um objeto específico em uma imagem com base em uma descrição textual. Ele foi introduzido como uma extensão do conjunto de dados RefCOCO anterior, com foco em frases mais longas e descritivas que se assemelham à linguagem gerada por humanos. O conjunto de dados é construído sobre a coleção de imagens Microsoft COCO (Common Objects in Context), que contém mais de 330.000 imagens com anotações detalhadas de objetos.

A principal distinção do RefCOCOg está em suas descrições. Ao contrário de conjuntos de dados anteriores que frequentemente usavam frases curtas baseadas em modelos, o RefCOCOg fornece frases mais longas e naturais que incluem informações contextuais, relações espaciais e detalhes de atributos. Por exemplo, uma descrição pode ser "o homem de camisa azul em pé ao lado do carro vermelho", em vez de simplesmente "o homem". Isso torna o conjunto de dados mais desafiador e realista para avaliar modelos que devem compreender tanto o conteúdo visual quanto a nuance linguística.

Construção do Conjunto de Dados

O RefCOCOg foi criado por pesquisadores da Universidade da Carolina do Norte em Chapel Hill e foi apresentado pela primeira vez em um artigo de 2016. O conjunto de dados foi montado usando uma plataforma de crowdsourcing, onde trabalhadores recebiam imagens do COCO e eram solicitados a escrever descrições que identificassem exclusivamente um objeto específico dentro da imagem. As instruções enfatizavam a geração de frases naturais, semelhantes às humanas, em vez de usar modelos predefinidos. Esse processo resultou em aproximadamente 104.560 expressões de referência para 54.822 objetos em 26.711 imagens.

O conjunto de dados é dividido em conjuntos de treinamento, validação e teste. Uma divisão comum, chamada RefCOCOg-google, usa uma divisão de 90/10 para treinamento e validação, com um conjunto de teste separado. Outra divisão, RefCOCOg-umd, foi proposta posteriormente por pesquisadores da Universidade de Maryland, fornecendo uma distribuição mais equilibrada de imagens entre as divisões. A escolha da divisão pode afetar significativamente a avaliação do modelo, pois diferentes divisões podem ter níveis variados de dificuldade.

Avaliação e Métricas

A avaliação padrão para o RefCOCOg usa a métrica de precisão, onde uma previsão é considerada correta se a caixa delimitadora prevista tiver uma interseção sobre união (IoU) com a caixa de referência que exceda um limite, tipicamente 0,5. Algumas avaliações também relatam precisão em limites de IoU mais altos, como 0,75, para avaliar a precisão da localização. A tarefa é frequentemente estruturada como um problema de classificação, onde o modelo deve selecionar a região correta de um conjunto de propostas candidatas geradas por um detector de objetos.

Impacto na Pesquisa em IA

O RefCOCOg tornou-se um benchmark para ancoragem visual e compreensão multimodal. Ele é amplamente usado para avaliar modelos que combinam visão e linguagem, incluindo aqueles baseados em arquiteturas de Transformer (architecture) e modelos de linguagem de grande escala. O conjunto de dados impulsionou o progresso em áreas como legendagem em nível de região, resposta a perguntas visuais e geração de expressões de referência. Muitas abordagens modernas usam técnicas de aprendizado profundo, incluindo backbones de rede residual e mecanismos de atenção de múltiplas cabeças, para enfrentar os desafios impostos pelas descrições mais longas do conjunto de dados.

O conjunto de dados também serve como base para tarefas relacionadas, como segmentação de expressões de referência, onde o objetivo é produzir uma máscara em nível de pixel em vez de uma caixa delimitadora. Pesquisadores estenderam o RefCOCOg para criar novos benchmarks, incluindo aqueles com elementos temporais ou interativos, embora o conjunto de dados original permaneça um ponto de referência padrão.

Limitações e Desafios

Apesar de sua utilidade, o RefCOCOg tem limitações conhecidas. As descrições, embora mais longas que as de conjuntos de dados anteriores, ainda são relativamente curtas em comparação com parágrafos completos de linguagem natural. O conjunto de dados também herda vieses do COCO, como uma super-representação de categorias de objetos comuns e um foco em cenas do cotidiano. Além disso, as descrições de crowdsourcing podem ser ambíguas ou depender de contexto que nem sempre é visualmente evidente, tornando a tarefa difícil até mesmo para anotadores humanos em alguns casos.

Outro desafio é o próprio protocolo de avaliação. Usar um limite fixo de IoU pode não capturar totalmente a qualidade da localização de um modelo, especialmente para objetos pequenos ou com formas irregulares. Nos últimos anos, pesquisadores propuseram métricas e estruturas de avaliação mais robustas, mas a métrica de precisão original continua sendo a mais comumente relatada.

Direções Futuras

O RefCOCOg continua relevante como um campo de teste para novos métodos de IA. Com o surgimento de IA generativa e modelos multimodais, o conjunto de dados é frequentemente usado para investigar quão bem esses sistemas podem ancorar a linguagem em conteúdo visual. Trabalhos futuros podem envolver a extensão do conjunto de dados com descrições mais diversas, a incorporação de cenas de vídeo ou 3D, ou a integração com outros benchmarks para criar suítes de avaliação mais abrangentes. As lições aprendidas com o RefCOCOg provavelmente informarão o desenvolvimento de conjuntos de dados de ancoragem visual de próxima geração que reflitam melhor a complexidade da linguagem e da visão do mundo real.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:dataset·computer-vision·natural-language-processing·visual-grounding
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico