Traduit de l'anglais

EPIC-KITCHENS est un ensemble de données vidéo égocentriques à grande échelle capturant des activités quotidiennes en cuisine, utilisé pour faire progresser la recherche en reconnaissance et anticipation d'actions.

EPIC-KITCHENS est un ensemble de données vidéo égocentriques à grande échelle conçu pour la recherche en intelligence artificielle, en particulier dans les domaines de la reconnaissance d'actions et de l'anticipation d'actions. L'ensemble de données se compose d'enregistrements vidéo à la première personne (égocentriques) d'activités quotidiennes en cuisine, capturés à l'aide de caméras montées sur la tête. Il fournit une ressource riche pour développer et évaluer des algorithmes qui comprennent les interactions humaines avec les objets et les environnements depuis une perspective à la première personne.

L'ensemble de données a été introduit en 2018 par une collaboration entre l'Université de Bristol, l'Université de Catane et l'Université de Toronto, entre autres. Il contient plus de 55 heures de vidéo provenant de 32 participants dans leurs propres cuisines, capturant une grande variété de tâches de cuisson et de préparation. Les vidéos sont densément annotées avec des étiquettes d'actions, y compris des combinaisons de verbes et de noms (par exemple, « couper un oignon », « verser de l'eau »), et des boîtes englobantes d'objets, permettant une analyse fine des activités.

Collecte de données et annotation

L'ensemble de données EPIC-KITCHENS a été enregistré à l'aide de caméras montées sur la tête (telles que GoPro) portées par les participants lors de sessions de cuisson naturelles. Les enregistrements ont eu lieu dans les propres maisons des participants, fournissant des scénarios réalistes et non scénarisés. Le processus d'annotation a impliqué l'étiquetage manuel de chaque image vidéo avec des segments d'actions, l'identification des heures de début et de fin des actions, et l'attribution d'étiquettes de verbes et de noms à partir d'un vocabulaire prédéfini. De plus, des boîtes englobantes d'objets ont été annotées pour chaque image, permettant des tâches de détection et de suivi d'objets.

L'ensemble de données comprend un ensemble d'entraînement et un ensemble de test, avec un total de 39 594 segments d'actions et 454 714 boîtes englobantes d'objets. Les étiquettes d'actions couvrent 125 classes de verbes et 352 classes de noms, résultant en un grand espace combinatoire d'actions possibles.

Tâches de référence et évaluation

EPIC-KITCHENS est devenu une référence standard pour les tâches de vision égocentrique, en particulier la reconnaissance d'actions et l'anticipation d'actions. La reconnaissance d'actions implique de classer l'action en cours dans un segment vidéo donné, tandis que l'anticipation d'actions nécessite de prédire la prochaine action avant qu'elle ne se produise. L'ensemble de données prend également en charge des tâches telles que la détection d'objets, le suivi et la récupération vidéo.

Les métriques d'évaluation incluent généralement la précision top-1 et top-5 pour la reconnaissance d'actions, et la précision moyenne (mAP) pour les tâches d'anticipation. La référence a été utilisée dans plusieurs défis, y compris le défi de reconnaissance d'actions EPIC-KITCHENS, qui a été organisé lors de grandes conférences en vision par ordinateur telles que CVPR et ECCV.

Impact et applications

L'ensemble de données a considérablement fait progresser la recherche en vision égocentrique et a été largement adopté par les communautés de apprentissage automatique et de apprentissage profond. Il a permis le développement de modèles capables de comprendre les activités humaines depuis une perspective à la première personne, ce qui est crucial pour des applications en robotique, réalité augmentée et technologies d'assistance. Par exemple, des architectures de réseaux de neurones telles que les modèles basés sur transformers ont été appliquées à EPIC-KITCHENS pour l'anticipation d'actions, en exploitant le contexte temporel et les informations multimodales.

De plus, EPIC-KITCHENS a contribué à l'étude de la compréhension vidéo à long terme et à l'intégration de multiples modalités, telles que l'audio et le mouvement. Le cadre réaliste de l'ensemble de données et ses annotations denses en font une ressource précieuse pour entraîner et évaluer des modèles visant à généraliser à des scénarios du monde réel.

Extensions et ensembles de données connexes

Suite au succès d'EPIC-KITCHENS, la même équipe a publié EPIC-KITCHENS-100, une version étendue avec 100 heures de vidéo provenant de 45 participants, incluant des annotations supplémentaires et un vocabulaire plus large. D'autres ensembles de données égocentriques connexes incluent Ego4D, qui couvre une gamme plus large d'activités quotidiennes, et Charades-Ego, qui se concentre sur la reconnaissance d'actions égocentriques dans des contextes domestiques. Ces ensembles de données repoussent collectivement les limites de la compréhension vidéo égocentrique.

Conclusion

EPIC-KITCHENS reste un ensemble de données fondamental dans le domaine de la vision égocentrique, fournissant une référence unique et difficile pour la compréhension d'actions. Ses contributions ont stimulé de nombreuses innovations en intelligence artificielle et continuent d'influencer la recherche en interaction homme-machine et en systèmes intelligents.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:egocentric-vision·dataset·action-recognition·computer-vision
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique