Jeu de données CIFAR-10

Traduit de l'anglais

CIFAR-10 est un ensemble de données de référence largement utilisé, composé de 60 000 images couleur en basse résolution réparties en 10 classes d'objets. Créé en 2009 à partir de l'ensemble de données 80 Million Tiny Images, il sert à entraîner et à évaluer des algorithmes d'apprentissage automatique et de vision par ordinateur.

Le jeu de données CIFAR-10 (Canadian Institute For Advanced Research) est une collection de 60 000 images couleur basse résolution utilisées pour entraîner et évaluer des algorithmes d'apprentissage automatique et de vision par ordinateur. Publié en 2009, il est devenu l'un des benchmarks les plus largement utilisés dans le domaine, permettant aux chercheurs de tester rapidement différentes approches de reconnaissance d'objets. Le jeu de données se compose d'images de 32x32 pixels réparties en 10 classes - avions, voitures, oiseaux, chats, cerfs, chiens, grenouilles, chevaux, bateaux et camions - avec 6 000 images par classe.

CIFAR-10 est un sous-ensemble étiqueté du jeu de données 80 Million Tiny Images de 2008. Lors de la création du jeu de données, des étudiants ont été rémunérés pour étiqueter toutes les images. En raison de la basse résolution des images, le jeu de données permet une expérimentation rapide avec différents algorithmes, ce qui en fait un point de départ standard pour les chercheurs développant de nouvelles techniques en apprentissage automatique et intelligence artificielle.

Structure du jeu de données

Les 60 000 images sont généralement divisées en 50 000 images d'entraînement et 10 000 images de test. Chaque image est une photographie couleur de 32x32 pixels avec trois canaux (rouge, vert, bleu), ce qui donne un total de 3 072 pixels par image. Les 10 classes sont mutuellement exclusives - chaque image appartient à exactement une catégorie. La petite taille des images distingue CIFAR-10 des jeux de données à plus haute résolution comme ImageNet, qui contient des images d'une résolution moyenne de 469x387.

Rôle dans la recherche en apprentissage automatique

Les algorithmes informatiques de reconnaissance d'objets dans les photos apprennent souvent par l'exemple, et CIFAR-10 fournit un ensemble standardisé d'exemples à cette fin. Divers types de réseaux neuronaux convolutifs tendent à être les meilleurs pour reconnaître les images de CIFAR-10. Le jeu de données a été déterminant pour suivre les progrès en apprentissage profond, des premiers réseaux peu profonds aux architectures modernes avec connexions résiduelles et mécanismes d'attention.

Des articles de recherche revendiquant des résultats de pointe sur CIFAR-10 ont été publiés de manière constante depuis sa sortie. Cependant, tous les articles ne sont pas standardisés sur les mêmes techniques de prétraitement, comme le retournement d'image ou le décalage d'image. Pour cette raison, la revendication de pointe d'un article pourrait avoir un taux d'erreur plus élevé qu'une revendication plus ancienne tout en restant valide dans des conditions de prétraitement différentes.

Benchmarks et performances

Au-delà du développement d'algorithmes, CIFAR-10 est utilisé comme benchmark de performance pour les équipes qui rivalisent pour exécuter des réseaux neuronaux plus rapidement et à moindre coût. La compétition DAWNBench, par exemple, dispose de données de benchmark sur son site web comparant le temps d'entraînement et le coût sur différentes piles matérielles et logicielles. Cette utilisation relie le jeu de données aux efforts d'infrastructure plus larges d'entreprises comme Google Cloud, Amazon Web Services et Azure.

Jeux de données similaires

Plusieurs jeux de données connexes étendent ou complètent CIFAR-10. CIFAR-100 est similaire mais contient 100 classes avec 600 images chacune. CIFAR-10H est une version étiquetée avec l'incertitude perceptuelle humaine. Le jeu de données ImageNet (ILSVRC) contient 1 million d'images couleur de 1 000 classes à plus haute résolution. Le jeu de données Street View House Numbers (SVHN) fournit environ 600 000 images de 10 classes (chiffres 0-9) également en résolution 32x32. Le jeu de données 80 Million Tiny Images sert d'ensemble parent à partir duquel CIFAR-10 a été dérivé.

Voir aussi

  • Liste des jeux de données pour la recherche en apprentissage automatique
  • Base de données MNIST

Références

  • Page CIFAR-10 - Le site d'origine du jeu de données
  • Canadian Institute For Advanced Research
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:datasets·computer-vision·machine-learning·benchmarks
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique