Traduit de l'anglais

NoCaps est un ensemble de données de référence pour évaluer les modèles de légende d'images sur des objets nouveaux, exigeant que les modèles décrivent des images avec des objets non vus lors de l'entraînement. Il teste la généralisation au-delà de la distribution d'entraînement.

NoCaps (Novel Object Captioning at Scale) est un ensemble de données de référence et un protocole d'évaluation conçus pour évaluer la capacité des systèmes de légendage d'images à décrire des images contenant des objets absents de leurs données d'entraînement. Introduit en 2019 par des chercheurs de l'Université du Texas à Austin et d'autres, il répond à une limitation critique des références standard de légendage : les modèles ont souvent tendance à surajuster le vocabulaire limité d'objets vu pendant l'entraînement et échouent à généraliser à la longue traîne des concepts visuels. NoCaps fournit un cadre contrôlé pour mesurer cette capacité de généralisation, en utilisant des images de l'ensemble de données Open Images et un large ensemble de catégories d'objets disjointes de celles de l'ensemble de données COCO, largement utilisé.

La référence comprend plus de 15 000 images, chacune associée à plusieurs légendes de référence rédigées par des humains. Les images sont réparties en trois sous-ensembles d'évaluation selon le nombre d'objets nouveaux qu'elles contiennent : dans le domaine (aucun objet nouveau), proche du domaine (quelques objets nouveaux) et domaine ouvert (de nombreux objets nouveaux). Cette structure à plusieurs niveaux permet aux chercheurs d'analyser la dégradation des performances à mesure que la nouveauté et la complexité du contenu visuel augmentent. La principale métrique d'évaluation est CIDEr, une métrique standard pour le légendage qui mesure le consensus entre les légendes générées et les légendes de référence, bien que d'autres métriques comme BLEU, METEOR et SPICE soient également rapportées.

Motivation et défis

Les ensembles de données de légendage traditionnels comme COCO ne contiennent que 80 catégories d'objets, ce qui représente une fraction infime du monde visuel. Les modèles entraînés sur de tels ensembles de données ont tendance à mémoriser les cooccurrences fréquentes d'objets et échouent lorsqu'ils rencontrent des combinaisons inhabituelles ou des objets entièrement nouveaux. NoCaps a été créé pour pousser le domaine vers des systèmes de légendage plus robustes et généralisables. Le défi clé est qu'un modèle doit non seulement reconnaître les objets nouveaux (un problème de perception visuelle), mais aussi générer un langage fluide et contextuellement approprié pour les décrire, souvent en utilisant des mots qu'il n'a jamais vus associés à ces entrées visuelles pendant l'entraînement.

Construction et annotation

Les images de NoCaps proviennent de l'ensemble de données Open Images, qui contient des millions d'images avec des annotations d'objets diverses. Les créateurs ont sélectionné un sous-ensemble d'images et les ont filtrées pour garantir une distribution équilibrée entre les trois niveaux de difficulté. Ils ont utilisé un vocabulaire de 500 catégories d'objets provenant d'Open Images, dont 200 sont considérées comme nouvelles par rapport aux 80 catégories de COCO. Des annotateurs humains sur Amazon Mechanical Turk ont rédigé cinq légendes de référence par image, en suivant des directives encourageant des phrases naturelles et descriptives. Le processus d'annotation comprenait des mesures de contrôle qualité pour garantir que les légendes étaient précises et variées.

Protocole d'évaluation

Pour évaluer un modèle sur NoCaps, un système génère une légende pour chaque image de l'ensemble de test. Les légendes générées sont comparées aux références humaines à l'aide de CIDEr, qui calcule la similarité cosinus moyenne entre les vecteurs de n-grammes du candidat et des références, pondérée par la fréquence des termes et la fréquence inverse des documents. La référence fournit un ensemble de validation public pour le développement et un ensemble de test caché pour l'évaluation finale, avec des résultats rapportés sur le classement officiel. Cette configuration encourage une comparaison équitable entre différentes approches, des modèles classiques Sequence-to-Sequence (Seq2Seq) aux architectures modernes basées sur Transformer (architecture).

Impact et utilisation

NoCaps est devenu une référence standard dans les communautés Machine learning et vision par ordinateur, en particulier pour évaluer les capacités de généralisation des modèles de légendage d'images. Il a été utilisé pour démontrer l'efficacité de techniques telles que Data Augmentation, Curriculum Learning et l'incorporation de sources de connaissances externes comme Large language model. Par exemple, certaines approches utilisent un détecteur d'objets pré-entraîné pour identifier les objets nouveaux, puis conditionnent un modèle de langage sur les étiquettes détectées, tandis que d'autres emploient des mécanismes de Cross-Attention pour aligner plus efficacement les caractéristiques visuelles et textuelles. La référence a également mis en évidence l'importance de l'échelle des données d'entraînement et de la capacité des modèles, car les Neural network plus grands entraînés sur des ensembles de données massifs tendent à mieux performer sur le sous-ensemble du domaine ouvert.

Limites et critiques

Malgré son influence, NoCaps présente certaines limites. La référence repose sur un ensemble fixe d'objets nouveaux, qui peut ne pas capturer pleinement la nature ouverte de la nouveauté dans le monde réel. La métrique d'évaluation CIDEr est connue pour être sensible au style et à la longueur, et elle peut ne pas refléter pleinement la correction sémantique. De plus, les références humaines, bien que de haute qualité, sont limitées en nombre et peuvent ne pas couvrir toutes les manières valides de décrire une image. Certains chercheurs ont soutenu que l'accent mis par la référence sur la nouveauté au niveau des objets éclipse d'autres aspects de la généralisation, tels que les relations ou attributs nouveaux. Néanmoins, NoCaps reste un outil précieux pour suivre les progrès dans le légendage d'images robuste.

Directions futures

Alors que le domaine évolue vers des systèmes Generative AI plus capables, NoCaps est susceptible d'être étendu ou complété par des références qui testent la généralisation compositionnelle, l'apprentissage zero-shot et l'interaction avec les instructions utilisateur. L'intégration de Large language model comme décodeurs, souvent combinée à des modèles vision-langage, a déjà montré des promesses dans le traitement des objets nouveaux en exploitant une connaissance mondiale étendue. Les travaux futurs pourraient également explorer des références dynamiques qui s'adaptent aux données d'entraînement d'un modèle, garantissant que la nouveauté est toujours réellement nouvelle. NoCaps a établi un précédent pour une évaluation rigoureuse de la généralisation, et ses principes sont susceptibles d'influencer la conception de futures références dans l'IA multimodale.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:computer-vision·natural-language-processing·benchmark·image-captioning
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique