Traduit de l'anglais

ImageNet-R est un ensemble de données de référence composé de rendus artistiques (dessins animés, peintures, sculptures) des classes d'ImageNet, utilisé pour évaluer la robustesse des modèles d'apprentissage automatique face aux changements de distribution.

ImageNet-R est un ensemble de données de référence conçu pour tester la robustesse des modèles d'apprentissage automatique face aux changements de distribution. Il se compose d'images qui sont des représentations artistiques des classes d'objets de l'ensemble de données ImageNet original, incluant des styles tels que les dessins animés, les peintures, les croquis et les sculptures. Contrairement aux ensembles de test standard qui contiennent des photographies naturelles, ImageNet-R présente aux modèles un changement de domaine visuel significatif, mettant à l'épreuve leur capacité à généraliser au-delà de la distribution d'entraînement. Cet ensemble de données a été introduit pour révéler la fragilité des réseaux de neurones profonds face à des représentations atypiques d'objets familiers.

L'objectif principal d'ImageNet-R est de servir d'outil d'évaluation pour la robustesse face aux changements de distribution. En Machine learning, les modèles sont souvent entraînés sur des ensembles de données à grande échelle comme ImageNet, qui contiennent des images naturelles. Cependant, les applications du monde réel rencontrent fréquemment des images qui diffèrent par leur style, leur texture ou leur contexte. ImageNet-R fournit un environnement contrôlé pour mesurer dans quelle mesure un modèle conserve sa précision de classification lorsque le domaine d'entrée change. Il est devenu une référence standard dans le domaine de l'Deep learning robuste, complétant d'autres ensembles de données comme ImageNet-C (corruptions) et ImageNet-A (exemples adversariaux).

Construction et composition

ImageNet-R a été créé par Hendrycks et al. en 2020. L'ensemble de données contient 30 000 images réparties sur 200 classes d'ImageNet, chaque classe ayant environ 150 images. Les images proviennent de divers dépôts en ligne et sont sélectionnées pour représenter des styles artistiques diversifiés. Les 200 classes sont un sous-ensemble des 1 000 classes originales d'ImageNet, choisies pour inclure des catégories ayant des équivalents visuels clairs dans l'art, comme les animaux, les véhicules et les objets du quotidien. Les représentations incluent des aquarelles, des peintures à l'huile, des cliparts et des rendus 3D, entre autres. Cette diversité garantit que l'ensemble de données capture une large gamme de transformations visuelles, allant de représentations abstraites à des représentations plus réalistes mais stylisées.

Évaluation et métriques

Lors de l'évaluation des modèles sur ImageNet-R, la métrique standard est la précision de classification top-1. L'ensemble de données est généralement utilisé comme ensemble de test, avec des modèles entraînés sur ImageNet standard ou d'autres ensembles de données d'images naturelles. Un résultat clé des expériences initiales est que de nombreux modèles de pointe, y compris ceux basés sur des architectures Residual Network (ResNet), subissent une baisse significative de précision sur ImageNet-R par rapport à l'ensemble de validation ImageNet standard. Par exemple, un ResNet-50 entraîné sur ImageNet peut atteindre environ 76 % de précision top-1 sur des images naturelles, mais seulement environ 36 % sur ImageNet-R. Cet écart de performance met en évidence le défi du changement de distribution. Des recherches ultérieures se sont concentrées sur le développement de techniques d'entraînement, telles que des stratégies de Data Augmentation et des fonctions de perte conscientes de la robustesse, pour améliorer les performances sur cette référence.

Relation avec d'autres références de robustesse

ImageNet-R fait partie d'une famille de références qui explorent différents aspects de la robustesse des modèles. Alors qu'ImageNet-C introduit des corruptions synthétiques comme le bruit et le flou, ImageNet-R se concentre sur les variations de style naturelles. ImageNet-A, quant à lui, contient des exemples adversariaux naturels qui sont souvent mal classés par les modèles standard. Ensemble, ces ensembles de données fournissent une évaluation complète de la capacité d'un modèle à gérer des données hors distribution. Dans le contexte de la sécurité et de la fiabilité de l'Artificial intelligence, ImageNet-R est particulièrement pertinent car les représentations artistiques sont courantes dans le contenu généré par les utilisateurs, et un modèle qui échoue sur de telles entrées peut être moins fiable dans des applications réelles.

Impact et limites

ImageNet-R a stimulé des recherches significatives dans le domaine de la généralisation de domaine et de l'apprentissage de représentations robustes. Il a été utilisé pour évaluer l'efficacité de diverses approches, notamment l'apprentissage contrastif, le pré-entraînement auto-supervisé et les innovations architecturales comme les modèles de vision basés sur Transformer (architecture). Cependant, l'ensemble de données présente également des limites. Les 200 classes sont un sous-ensemble d'ImageNet, il ne couvre donc pas tout l'espace des étiquettes. De plus, les styles artistiques ne sont pas exhaustifs, et les modèles qui performent bien sur ImageNet-R peuvent encore échouer sur d'autres types de changements de distribution. En 2024, ImageNet-R reste une référence largement citée, mais les chercheurs développent de plus en plus des ensembles de données plus diversifiés et plus difficiles pour repousser les limites de la robustesse.

Voir aussi

Références

  • Hendrycks, D., et al. (2020). The Many Faces of Robustness: A Critical Analysis of Out-of-Distribution Generalization. arXiv preprint.
  • Hendrycks, D., & Dietterich, T. (2019). Benchmarking Neural Network Robustness to Common Corruptions and Perturbations. ICLR.

Liens externes

  • Dépôt officiel d'ImageNet-R (non lié en raison de la politique)

Catégories

  • robustesse
  • référence
  • ensemble de données
  • vision par ordinateur
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:robustness·benchmark·dataset·computer-vision
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique