Traduit de l'anglais

ActivityNet est un jeu de données vidéo à grande échelle pour la localisation temporelle et la reconnaissance d'actions, contenant 200 classes d'actions et plus de 28 000 vidéos avec des annotations temporelles denses, largement utilisé dans la recherche en vision par ordinateur.

ActivityNet est un ensemble de données vidéo à grande échelle conçu pour faire progresser la recherche en localisation temporelle d'actions et en reconnaissance d'actions. Il fournit des segments vidéo densément annotés, permettant aux modèles d'identifier non seulement quelles actions se produisent, mais aussi quand elles se produisent dans une vidéo. Depuis son introduction, il est devenu une référence standard pour évaluer les algorithmes en compréhension vidéo, en particulier pour les tâches impliquant des vidéos non découpées où les actions sont intégrées dans des séquences plus longues.

L'ensemble de données a été publié pour la première fois en 2015 par des chercheurs de l'Université du Michigan et d'autres institutions, dirigés par Fabian Caba Heilbron, Victor Escorcia, Bernard Ghanem et Juan Carlos Niebles. La version initiale, ActivityNet-200, contient 200 classes d'actions et plus de 28 000 vidéos, avec un total de plus de 648 000 annotations temporelles. Les vidéos proviennent de plateformes publiques comme YouTube, couvrant diverses activités telles que les sports, les tâches ménagères et les interactions sociales. Chaque vidéo est annotée avec plusieurs instances d'actions, chacune ayant un temps de début et de fin, fournissant une vérité terrain riche pour la localisation temporelle.

Structure et annotations

ActivityNet est organisé en trois divisions : entraînement, validation et test, avec une distribution approximative de 50/25/25. Les annotations sont fournies dans un format JSON, incluant les URL des vidéos, les étiquettes d'actions et les limites temporelles. Pour chaque instance d'action, l'ensemble de données inclut également un score de confiance pour la qualité de l'annotation. Les classes d'actions sont organisées hiérarchiquement en catégories, telles que « Sports », « Ménage » et « Soins personnels », ce qui aide à évaluer les modèles à différentes granularités.

Une caractéristique clé d'ActivityNet est son accent sur les vidéos non découpées, ce qui contraste avec des ensembles de données antérieurs comme UCF101 ou HMDB51 qui contenaient des clips découpés. Cette conception force les modèles à gérer le contexte temporel complet, rendant la tâche plus réaliste. L'ensemble de données inclut également une classe « arrière-plan » pour les segments qui ne correspondent à aucune des 200 actions, ce qui est crucial pour entraîner les modèles de localisation.

Tâches de référence

Les tâches principales associées à ActivityNet sont la localisation temporelle d'actions et la reconnaissance d'actions. Dans la localisation temporelle d'actions, un modèle doit prédire les temps de début et de fin de chaque instance d'action dans une vidéo non découpée, ainsi que l'étiquette de l'action. Cela est souvent évalué en utilisant la précision moyenne (mAP) à différents seuils d'Intersection sur Union (IoU) temporelle, tels que 0,5 et 0,75. La reconnaissance d'actions, en revanche, implique de classer l'action dominante dans une vidéo, généralement évaluée avec une précision top-1 et top-5.

ActivityNet héberge également un défi annuel, le ActivityNet Large-Scale Activity Recognition Challenge, qui a été organisé en conjonction avec de grandes conférences en vision par ordinateur comme CVPR et ICCV. Le défi a attiré de nombreuses soumissions de groupes de recherche académiques et industriels, stimulant les progrès dans le domaine. Au fil des ans, l'ensemble de données a été étendu avec des annotations supplémentaires, comme le sous-ensemble ActivityNet Captions, qui fournit des descriptions en langage naturel pour les segments vidéo, permettant la recherche en sous-titrage vidéo et en sous-titrage vidéo dense.

Impact sur la vision par ordinateur

ActivityNet a considérablement influencé le développement des modèles de compréhension vidéo. Il a été utilisé pour entraîner et évaluer une large gamme d'architectures, des méthodes traditionnelles basées sur des caractéristiques artisanales aux approches modernes de apprentissage profond. De nombreux modèles de pointe pour la localisation temporelle d'actions, tels que Boundary Matching Network (BMN) et ActionFormer, ont rapporté des résultats sur ActivityNet. L'ensemble de données a également stimulé la recherche en localisation faiblement supervisée, où les modèles sont entraînés en utilisant uniquement des étiquettes au niveau vidéo, et en traitement vidéo efficace, étant donné la grande échelle des données.

L'accent mis par l'ensemble de données sur la structure temporelle a contribué au domaine plus large de l'intelligence artificielle, en particulier dans des domaines comme la reconnaissance d'activités pour la surveillance, l'interaction homme-machine et la conduite autonome. Il a également été utilisé en conjonction avec d'autres ensembles de données, comme kinetics (bien que non inclus dans la liste fournie, c'est un ensemble de données connexe connu) et Something-Something (également non inclus dans la liste), pour créer des références plus complètes.

Limites et orientations futures

Malgré son succès, ActivityNet présente des limites. Les vidéos proviennent de YouTube, ce qui peut introduire des biais en termes de contenu et de qualité. Les classes d'actions sont prédéfinies, ce qui peut ne pas couvrir toutes les activités humaines possibles. De plus, les annotations temporelles sont créées manuellement, ce qui prend du temps et peut présenter des incohérences. Pour remédier à ces problèmes, les chercheurs ont proposé des extensions comme ActivityNet-1.3, qui inclut plus de vidéos et des annotations affinées, et ont exploré l'utilisation de techniques de augmentation de données pour améliorer la robustesse des modèles.

Les travaux futurs pourraient impliquer l'intégration d'ActivityNet avec d'autres modalités, comme l'audio ou le texte, pour créer des références multimodales. L'essor des grands modèles de langage et des architectures basées sur transformeurs a également ouvert de nouvelles voies pour la compréhension vidéo, et ActivityNet reste un banc d'essai pertinent pour ces méthodes émergentes. Alors que le domaine évolue vers des tâches plus complexes comme la réponse à des questions vidéo et la compréhension vidéo à long terme, des ensembles de données comme ActivityNet évolueront probablement pour relever ces défis.

Conclusion

ActivityNet constitue une ressource fondamentale en vision par ordinateur, fournissant une référence rigoureuse pour la localisation temporelle d'actions. Ses annotations denses et ses vidéos non découpées réalistes en ont fait une norme pour évaluer les algorithmes de compréhension vidéo. En permettant une modélisation temporelle précise, il a repoussé les limites de ce qui est possible dans l'analyse vidéo automatisée, avec des implications pour de nombreuses applications du monde réel.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:computer-vision·dataset·video-understanding·temporal-action-localization
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique