Traduit de l'anglais

ObjectNet est un ensemble de données de référence du monde réel contenant 50 000 images d'objets hors distribution, conçu pour tester la robustesse des modèles de vision par ordinateur face à de nouveaux points de vue, arrière-plans et rotations.

ObjectNet est un ensemble de données de référence introduit en 2019 pour évaluer la robustesse des modèles de reconnaissance d'objets face à des décalages de distribution réels. Contrairement aux ensembles de données standard tels que ImageNet, qui contiennent souvent des images avec des points de vue canoniques et des arrière-plans propres, ObjectNet contient délibérément des images d'objets photographiés dans des contextes quotidiens, sous des angles inhabituels, avec des arrière-plans encombrés et dans des orientations rotatives. L'ensemble de données comprend 50 000 images réparties sur 313 catégories d'objets, chacune collectée spécifiquement pour défier les modèles entraînés sur des ensembles de données conventionnels. Son objectif principal est de mesurer dans quelle mesure un modèle généralise au-delà des régularités statistiques de sa distribution d'entraînement, une propriété critique pour déployer des systèmes d'Artificial intelligence dans des environnements non contrôlés.

La création d'ObjectNet a été motivée par l'observation que de nombreux modèles de pointe en Deep learning atteignent une haute précision sur des références standard mais échouent de manière spectaculaire lorsqu'ils sont testés sur des images qui diffèrent de manières apparemment mineures. L'ensemble de données a été conçu par une équipe dirigée par Andrei Barbu au MIT Computer Science and Artificial Intelligence Laboratory (CSAIL), avec des collaborateurs d'autres institutions. Les images ont été collectées via le crowdsourcing puis filtrées pour garantir qu'elles répondaient à des critères stricts concernant la classe d'objet, le point de vue, l'arrière-plan et la rotation. Chaque image a été annotée avec des métadonnées décrivant la rotation de l'objet, l'arrière-plan de la scène et le point de vue de la caméra, permettant aux chercheurs d'analyser les modes d'échec en détail.

Conception et Collecte

La construction d'ObjectNet a impliqué un effort de crowdsourcing à grande échelle. Les travailleurs ont été invités à photographier des objets dans leurs maisons ou d'autres contextes naturels, en suivant des instructions spécifiques pour varier l'angle, l'arrière-plan et la rotation de chaque objet. Ce processus a produit des images qui sont véritablement hors distribution par rapport aux ensembles d'entraînement typiques, car elles capturent la variabilité naturelle des scènes réelles. L'ensemble de données comprend 313 catégories, dont beaucoup chevauchent les classes d'ImageNet, mais les images elles-mêmes sont entièrement nouvelles et ne proviennent pas d'ensembles de données existants. Les métadonnées de chaque image incluent trois attributs clés : la rotation (l'orientation de l'objet dans le plan de l'image), l'arrière-plan (le type de scène, comme cuisine, salle de bain ou bureau) et le point de vue (l'angle de la caméra par rapport à l'objet). Cette annotation structurée permet une évaluation fine des performances du modèle à travers différents types de décalage de distribution.

Impact sur l'Évaluation des Modèles

Lorsqu'ObjectNet a été publié, il a exposé des vulnérabilités significatives dans les modèles de pointe. Par exemple, un modèle qui atteignait une performance quasi humaine sur ImageNet pouvait voir sa précision chuter de plus de 40 points de pourcentage sur ObjectNet. Ce contraste frappant a mis en évidence que de nombreux modèles s'appuyaient sur des corrélations fallacieuses, telles que des indices d'arrière-plan ou des poses d'objets typiques, plutôt que d'apprendre des caractéristiques visuelles robustes. L'ensemble de données est rapidement devenu une référence standard pour la recherche sur la robustesse, aux côtés d'autres ensembles de données hors distribution comme ImageNet-C et ImageNet-A. Les chercheurs ont utilisé ObjectNet pour évaluer des techniques telles que l'augmentation de données, l'adaptation de domaine et les changements architecturaux, conduisant à des améliorations de la généralisation des modèles. L'ensemble de données a également suscité un intérêt pour comprendre le rôle de la forme, de la texture et du contexte dans la reconnaissance d'objets, avec des études montrant que les modèles privilégient souvent la texture sur la forme, un biais que les conditions variées d'ObjectNet aident à exposer.

Relation avec d'Autres Références

ObjectNet occupe une niche unique parmi les références de vision par ordinateur. Contrairement aux références de corruption synthétique qui appliquent du bruit artificiel ou du flou aux images existantes, ObjectNet se compose entièrement de photographies naturelles, ce qui en fait un test plus réaliste de la performance dans le monde réel. Il complète des références comme COCO et Pascal VOC, qui se concentrent sur la détection et la segmentation, en fournissant un cadre contrôlé mais naturaliste pour la classification. L'accent mis par l'ensemble de données sur la rotation et le point de vue le relie également à la recherche sur la compréhension d'objets en 3D et l'interprétabilité des Neural network. Étant donné que l'ensemble de données est relativement petit par rapport à ImageNet, il est souvent utilisé comme ensemble de test plutôt que comme ensemble d'entraînement, bien que certaines études aient exploré le fine-tuning sur une partie de celui-ci pour améliorer la robustesse.

Limitations et Critiques

Malgré ses contributions, ObjectNet présente des limitations. Les 313 catégories de l'ensemble de données sont un sous-ensemble de la taxonomie d'objets plus large, et certaines classes courantes sont absentes. La nature crowdsourcée des images signifie que la distribution des arrière-plans et des points de vue peut ne pas représenter pleinement tous les scénarios réels, et il y a un bruit inhérent dans le processus d'annotation. De plus, parce qu'ObjectNet a été collecté dans des environnements domestiques, il peut sous-représenter les contextes industriels, extérieurs ou extrêmes. Certains chercheurs ont noté que la difficulté de l'ensemble de données peut être partiellement atténuée en s'entraînant sur des ensembles de données plus grands et plus diversifiés, suggérant que l'écart entre ObjectNet et les références standard se réduit à mesure que les modèles s'améliorent. Néanmoins, ObjectNet reste un outil précieux pour tester les modèles sous pression et pour comprendre l'écart entre la performance sur les références et la fiabilité dans le monde réel.

Héritage et Utilisation Continue

ObjectNet est devenu un point de référence dans l'effort continu pour construire des systèmes de vision robustes. Il est fréquemment cité dans des articles sur la généralisation de domaine, la robustesse adversarial et l'apprentissage auto-supervisé. Les métadonnées de l'ensemble de données ont également permis des études sur l'effet de facteurs spécifiques, tels que la rotation ou l'arrière-plan, sur la performance des modèles, fournissant des informations qui éclairent la conception d'architectures plus résilientes. Au milieu des années 2020, ObjectNet continue d'être utilisé dans la recherche académique et par des équipes industrielles développant des produits de vision par ordinateur, en particulier dans des domaines comme la conduite autonome, la robotique et la réalité augmentée, où rencontrer des points de vue nouveaux et des scènes encombrées est courant. Sa création a souligné l'importance d'évaluer les modèles au-delà de leur distribution d'entraînement et a contribué à un changement plus large dans la communauté du Machine learning vers la robustesse et la généralisation hors distribution comme préoccupations de premier plan.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:computer-vision·dataset·benchmark·robustness
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique