Traduzido do inglês

COCO Captions é um conjunto de dados de referência para legenda de imagens, construído sobre a coleção de imagens do COCO, com cinco descrições escritas por humanos para cada imagem, usado para avaliar modelos de IA que geram descrições em linguagem natural de conteúdo visual.

Métricas de Avaliação e Abordagens Comuns

A avaliação padrão para COCO Captions utiliza métricas automáticas como BLEU, METEOR, ROUGE e CIDEr, sendo o CIDEr (Avaliação Baseada em Consenso) particularmente adaptado para essa tarefa, pois mede a similaridade entre legendas geradas e legendas de referência. Essas métricas comparam a sobreposição de n-gramas e a similaridade semântica, embora tenham limitações conhecidas em relação à captura do julgamento humano. Na prática, os pesquisadores também conduzem avaliações humanas para uma avaliação qualitativa.

As abordagens iniciais para COCO Captions dependiam de arquiteturas de rede neural que combinavam uma rede neural convolucional (CNN) para extração de características de imagem com uma rede neural recorrente (RNN), frequentemente uma rede de memória de curto e longo prazo (LSTM), para geração de sequências. Esses modelos codificador-decodificador estabeleceram o desempenho de referência. A introdução de arquiteturas Transformer (architecture) e métodos baseados em modelo de linguagem de grande escala, como modelos de pré-treinamento visão-linguagem, levou a melhorias significativas. Modelos como CLIP e, posteriormente, transformers multimodais, incluindo aqueles desenvolvidos por OpenAI e Google DeepMind, alcançaram resultados de ponta ao alinhar representações visuais e textuais em um espaço de incorporação compartilhado.

Estrutura e Variantes do Conjunto de Dados

COCO Captions é organizado em divisões de treinamento, validação e teste, sendo a divisão de teste utilizada para o ranking oficial do benchmark. Cada imagem é acompanhada de cinco legendas, e o conjunto de dados inclui um total de mais de 500.000 legendas. As imagens abrangem 80 categorias de objetos, incluindo categorias comuns como pessoas, itens, animais e objetos domésticos, e são coletadas de cenas cotidianas. O conjunto de dados foi estendido de várias maneiras, como a variante COCO-CN para legendas em chinês e o benchmark nocaps, que testa a generalização para novos objetos e cenas. Essas variantes mantêm o mesmo conjunto de imagens, mas introduzem novos desafios de legendagem.

Uma característica fundamental é a categoria "coisas", que inclui elementos de fundo como céu, grama e paredes, além das categorias de "objetos" (entidades discretas). Isso incentiva os modelos a descrever a cena completa, em vez de apenas os objetos em primeiro plano. O processo de anotação envolveu trabalhadores da Amazon Mechanical Turk, que receberam diretrizes específicas para evitar descrições excessivamente simplistas ou repetitivas, garantindo alta variabilidade. As instruções pediam que os anotadores descrevessem a imagem como uma pessoa com visão normal faria, incluindo detalhes sobre ações, interações e o contexto geral.

Impacto e Limitações

COCO Captions tornou-se um padrão de facto para avaliar sistemas de legendagem de imagens, influenciando pesquisas em aprendizado profundo, inteligência artificial e compreensão multimodal. Tem sido utilizado em centenas de artigos científicos e serve como referência em conferências e competições importantes. O conjunto de dados também impulsionou o desenvolvimento de tarefas relacionadas, como resposta a perguntas visuais e geração de texto a partir de imagens, fornecendo uma fonte rica de pares imagem-texto.

No entanto, o conjunto de dados apresenta limitações notáveis. As imagens são tendenciosas para cenas ocidentais e cotidianas, e as legendas refletem as normas culturais e linguísticas dos anotadores, o que pode levar a modelos que aprendem estereótipos. As métricas de avaliação não capturam totalmente a qualidade das legendas, como precisão factual ou erros sutis. Além disso, o número fixo de legendas por imagem pode limitar a avaliação da diversidade nas legendas geradas. Pesquisadores propuseram conjuntos de dados complementares, como o Flickr30k, embora COCO Captions continue sendo o mais amplamente utilizado devido à sua escala e padronização.

Desenvolvimentos Recentes e Direções Futuras

Com o surgimento de modelos de linguagem de grande escala, COCO Captions é frequentemente usado como um conjunto de dados de ajuste fino ou avaliação, em vez de uma fonte primária de treinamento. Modelos pré-treinados em dados massivos da web, como aqueles da Anthropic e Google DeepMind, são avaliados em COCO Captions para testar capacidades de legendagem com poucos ou nenhum exemplo. O benchmark também foi adaptado para avaliar legendagem em domínios específicos, como imagens médicas ou direção autônoma, por meio de versões ou subconjuntos modificados.

O trabalho futuro concentra-se em abordar as limitações do conjunto de dados, incluindo o desenvolvimento de métricas de avaliação mais robustas que se alinhem com o julgamento humano, a expansão para imagens mais diversas e inclusivas e a criação de benchmarks dinâmicos que possam evoluir com as capacidades dos modelos. Em meados da década de 2020, COCO Captions permanece um recurso fundamental no campo, mas os pesquisadores cada vez mais o complementam com conjuntos de dados mais recentes e estruturas de avaliação para ampliar os limites da compreensão de imagens e da geração de linguagem.

Veja Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:image-captioning·dataset·computer-vision·natural-language-processing
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico