Charades est un jeu de données à grande échelle pour la reconnaissance d'activités quotidiennes, comprenant 9 848 vidéos collectées auprès de 267 utilisateurs. Ce jeu de données a été introduit en 2016 par des chercheurs de l'Université Carnegie Mellon et de l'Université de Toronto, et il se concentre sur la reconnaissance d'actions courantes effectuées dans des environnements domestiques. Chaque vidéo est annotée avec plusieurs étiquettes d'action, offrant une ressource riche pour l'entraînement et l'évaluation de modèles d'apprentissage automatique dans le domaine de la vision par ordinateur.
Le jeu de données a été créé pour remédier aux limitations des références précédentes en reconnaissance d'activités, qui présentaient souvent des actions scénarisées ou scriptées. Charades capture des activités spontanées et non scriptées telles que cuisiner, nettoyer et lire, ce qui en fait une référence plus réaliste pour les applications du monde réel. Les vidéos sont accompagnées de descriptions textuelles et d'étiquettes d'action, permettant la recherche à la fois en reconnaissance visuelle et en ancrage linguistique.
Composition du jeu de données
Charades contient 9 848 vidéos d'une durée moyenne d'environ 30 secondes, totalisant environ 82 heures de séquences. Le jeu de données comprend 157 classes d'actions, couvrant une large gamme d'activités quotidiennes comme « ouvrir un réfrigérateur », « regarder la télévision » et « utiliser un téléphone ». Chaque vidéo est annotée avec plusieurs instances d'action, et les annotations incluent des limites temporelles, permettant une reconnaissance d'action au niveau de la trame.
Les vidéos ont été collectées via Amazon Mechanical Turk, où les participants devaient s'enregistrer en train d'effectuer des activités dans leur propre maison. Cette approche participative a abouti à des environnements, des conditions d'éclairage et des angles de caméra divers, ce qui augmente la difficulté de la tâche de reconnaissance. Le jeu de données comprend également 27 847 descriptions de vidéos, utilisées pour des tâches comme le sous-titrage vidéo et la récupération.
Évaluation et références
Charades est couramment utilisé pour évaluer les modèles de reconnaissance d'actions, en particulier ceux basés sur l'apprentissage profond. La métrique d'évaluation standard est la précision moyenne (mAP) sur toutes les classes d'actions, calculée au niveau de la vidéo. Les chercheurs rapportent souvent leurs résultats sur la division Charades v1, qui comprend 7 984 vidéos d'entraînement et 1 864 vidéos de test.
Plusieurs modèles notables ont été évalués sur Charades, notamment les réseaux convolutifs à deux flux, les réseaux de segments temporels et, plus récemment, les architectures basées sur les transformeurs. Le jeu de données a également été utilisé pour étudier la classification multi-étiquettes, car chaque vidéo peut contenir plusieurs actions simultanées. En 2025, les modèles de pointe atteignent des scores mAP supérieurs à 60 %, mais le jeu de données reste difficile en raison de sa nature réaliste et bruitée.
Applications en intelligence artificielle
Charades a joué un rôle important dans l'avancement de la recherche en intelligence artificielle, en particulier dans les domaines du apprentissage automatique et du apprentissage profond. Il est largement utilisé pour entraîner des modèles de compréhension vidéo, un composant clé d'applications telles que la surveillance, l'interaction homme-machine et la robotique. Le jeu de données soutient également la recherche sur les architectures de réseaux de neurones, y compris les modèles de réseau résiduel et de transformeur.
Au-delà de la reconnaissance d'actions, Charades a été utilisé pour des tâches comme la localisation temporelle d'actions, où les modèles doivent identifier quand les actions se produisent dans une vidéo. Il a également été employé dans l'apprentissage multimodal, combinant des informations visuelles et textuelles. Les annotations du jeu de données permettent la recherche sur les modèles de séquence à séquence pour le sous-titrage vidéo, où l'objectif est de générer des descriptions en langage naturel des activités.
Jeux de données connexes et impact
Charades fait partie d'une famille plus large de jeux de données de reconnaissance d'activités, notamment UCF101, ActivityNet et Kinetics. Contrairement à ces jeux de données, qui présentent souvent des clips courts et découpés, Charades fournit des vidéos plus longues et non découpées qui reflètent mieux les conditions du monde réel. Cela en a fait une ressource précieuse pour développer des modèles robustes capables de gérer les dépendances temporelles et les entrées bruitées.
Le jeu de données a été cité dans des centaines d'articles de recherche et a influencé la conception de références ultérieures, comme le jeu de données Charades-Ego, qui se concentre sur les vidéos égocentriques. Charades a également été utilisé dans des défis lors de grandes conférences, notamment le défi de reconnaissance d'activités à grande échelle ActivityNet, favorisant la collaboration entre le monde académique et l'industrie.
Limites et orientations futures
Malgré ses atouts, Charades présente des limites. Les vidéos sont enregistrées par des non-professionnels, ce qui entraîne une variabilité de la qualité et des erreurs d'annotation occasionnelles. Les classes d'actions sont limitées aux activités quotidiennes, ce qui peut ne pas se généraliser à d'autres domaines comme le sport ou les procédures médicales. De plus, le jeu de données est relativement petit par rapport aux références plus récentes, ce qui peut limiter l'entraînement de très grands modèles.
Les recherches futures pourraient remédier à ces limites en élargissant le jeu de données ou en le combinant avec des données synthétiques. L'essor de la IA générative et des grands modèles de langage a également ouvert de nouvelles voies pour utiliser Charades dans des tâches de raisonnement multimodal, où les modèles doivent comprendre à la fois des informations visuelles et textuelles. En 2025, Charades reste une référence standard pour évaluer les progrès en compréhension vidéo.
Voir aussi
- apprentissage automatique
- apprentissage profond
- vision par ordinateur
- compréhension vidéo