NoCaps (Novel Object Captioning at Scale) é um conjunto de dados de referência e um protocolo de avaliação projetado para avaliar a capacidade de sistemas de legendar imagens de descrever imagens que contêm objetos que não estavam presentes em seus dados de treinamento. Introduzido em 2019 por pesquisadores da Universidade do Texas em Austin e outros, ele aborda uma limitação crítica nos conjuntos de dados de legendar padrão: os modelos frequentemente se ajustam demais ao vocabulário limitado de objetos visto durante o treinamento e falham em generalizar para a cauda longa de conceitos visuais. NoCaps fornece um ambiente controlado para medir essa capacidade de generalização, usando imagens do conjunto de dados Open Images e um grande conjunto de categorias de objetos que são disjuntas daquelas no conjunto de dados COCO, amplamente utilizado.
O conjunto de dados consiste em mais de 15.000 imagens, cada uma emparelhada com múltiplas legendas de referência escritas por humanos. As imagens são divididas em três subconjuntos de avaliação com base em quantos objetos novos elas contêm: no domínio (sem objetos novos), quase domínio (alguns objetos novos) e domínio aberto (muitos objetos novos). Essa estrutura em camadas permite que os pesquisadores analisem a degradação do desempenho à medida que a novidade e a complexidade do conteúdo visual aumentam. A principal métrica de avaliação é o CIDEr, uma métrica padrão para legendagem que mede o consenso entre legendas geradas e de referência, embora outras métricas como BLEU, METEOR e SPICE também sejam relatadas.
Motivação e Desafios
Conjuntos de dados tradicionais de legendagem como o COCO contêm apenas 80 categorias de objetos, o que é uma fração minúscula do mundo visual. Modelos treinados em tais conjuntos de dados tendem a memorizar co-ocorrências frequentes de objetos e falham ao encontrar combinações desconhecidas ou objetos totalmente novos. NoCaps foi criado para impulsionar o campo em direção a sistemas de legendagem mais robustos e generalizáveis. O principal desafio é que um modelo deve não apenas reconhecer objetos novos (um problema de percepção visual), mas também gerar linguagem fluente e contextualmente apropriada para descrevê-los, frequentemente usando palavras que nunca viu emparelhadas com essas entradas visuais durante o treinamento.
Construção e Anotação
As imagens em NoCaps são provenientes do conjunto de dados Open Images, que contém milhões de imagens com diversas anotações de objetos. Os criadores selecionaram um subconjunto de imagens e as filtraram para garantir uma distribuição equilibrada entre os três níveis de dificuldade. Eles usaram um vocabulário de 500 categorias de objetos do Open Images, das quais 200 são consideradas novas em relação às 80 categorias do COCO. Anotadores humanos no Amazon Mechanical Turk escreveram cinco legendas de referência por imagem, seguindo diretrizes que incentivavam frases naturais e descritivas. O processo de anotação incluiu medidas de controle de qualidade para garantir que as legendas fossem precisas e variadas.
Protocolo de Avaliação
Para avaliar um modelo no NoCaps, um sistema gera uma legenda para cada imagem no conjunto de teste. As legendas geradas são comparadas com as referências humanas usando CIDEr, que calcula a similaridade média de cosseno entre os vetores de n-gramas do candidato e da referência, ponderados por frequência de termo-frequência inversa de documento. O conjunto de dados fornece um conjunto de validação público para desenvolvimento e um conjunto de teste oculto para avaliação final, com resultados relatados no ranking oficial. Essa configuração incentiva a comparação justa entre diferentes abordagens, desde modelos clássicos de Sequence-to-Sequence (Seq2Seq) até arquiteturas modernas baseadas em Transformer (architecture).
Impacto e Uso
NoCaps se tornou um conjunto de dados de referência padrão nas comunidades de Machine learning e visão computacional, particularmente para avaliar as capacidades de generalização de modelos de legendagem de imagens. Ele tem sido usado para demonstrar a eficácia de técnicas como Data Augmentation, Curriculum Learning e a incorporação de fontes de conhecimento externas como Large language models. Por exemplo, algumas abordagens usam um detector de objetos pré-treinado para identificar objetos novos e então condicionam um modelo de linguagem nos rótulos detectados, enquanto outras empregam mecanismos de Cross-Attention para alinhar características visuais e textuais de forma mais eficaz. O conjunto de dados também destacou a importância de escalar dados de treinamento e capacidade do modelo, pois redes neurais maiores treinadas em conjuntos de dados massivos tendem a ter melhor desempenho no subconjunto de domínio aberto.
Limitações e Críticas
Apesar de sua influência, NoCaps tem algumas limitações. O conjunto de dados depende de um conjunto fixo de objetos novos, o que pode não capturar totalmente a natureza aberta da novidade no mundo real. A métrica de avaliação CIDEr é conhecida por ser sensível ao estilo e ao comprimento, e pode não refletir totalmente a correção semântica. Além disso, as referências humanas, embora de alta qualidade, são limitadas em número e podem não cobrir todas as maneiras válidas de descrever uma imagem. Alguns pesquisadores argumentaram que o foco do conjunto de dados na novidade em nível de objeto ofusca outros aspectos da generalização, como relações ou atributos novos. No entanto, NoCaps continua sendo uma ferramenta valiosa para acompanhar o progresso na legendagem robusta de imagens.
Direções Futuras
À medida que o campo avança em direção a sistemas mais capazes de Generative AI, é provável que NoCaps seja estendido ou complementado por conjuntos de dados que testem generalização composicional, aprendizado de zero disparo e interação com instruções do usuário. A integração de Large language models como decodificadores, frequentemente combinados com modelos de visão-linguagem, já mostrou promessa em lidar com objetos novos ao aproveitar amplo conhecimento do mundo. Trabalhos futuros também podem explorar conjuntos de dados dinâmicos que se adaptam aos dados de treinamento de um modelo, garantindo que a novidade seja sempre genuinamente nova. NoCaps estabeleceu um precedente para a avaliação rigorosa da generalização, e seus princípios provavelmente influenciarão o design de futuros conjuntos de dados em IA multimodal.