Traduit de l'anglais

UCF101 est un jeu de données largement utilisé pour la reconnaissance d'actions vidéo, contenant 101 classes d'actions et plus de 13 000 vidéos réalistes provenant de YouTube, servant de référence pour les modèles d'apprentissage profond en vision par ordinateur.

UCF101 est un jeu de données pour la reconnaissance d'actions vidéo, comprenant 101 catégories d'actions et 13 320 clips vidéo. Les vidéos proviennent de YouTube et représentent des activités réalistes et non contraintes, allant de sports comme « Basketball » et « SkateBoarding » à des interactions homme-objet telles que « Playing Guitar » et « Applying Eye Makeup ». Introduit en 2012 par des chercheurs de l'Université de Floride centrale, le jeu de données a été conçu pour faire progresser la recherche en reconnaissance d'activités en fournissant une collection vaste et diversifiée de vidéos reflétant la variabilité du monde réel en termes de mouvement de caméra, d'éclairage et d'encombrement de l'arrière-plan.

Le jeu de données est organisé en 101 classes, chacune contenant entre 100 et 150 clips, avec une durée totale de plus de 27 heures. Les vidéos sont divisées en trois ensembles d'entraînement et de test, chacun comprenant environ 9 500 clips d'entraînement et 3 700 clips de test. Cette structure de division permet une évaluation cohérente entre différents modèles. UCF101 est une extension du jeu de données antérieur UCF50, qui contenait 50 catégories d'actions, et il intègre des classes supplémentaires et des scénarios plus difficiles.

Composition et caractéristiques du jeu de données

Chaque vidéo dans UCF101 est un clip court, durant généralement quelques secondes, capturé à une résolution de 320x240 pixels avec un taux de 25 images par seconde. Les actions sont regroupées en cinq grands types : interaction homme-objet, mouvement corporel uniquement, interaction homme-homme, jeu d'instruments de musique et sports. Cette catégorisation aide les chercheurs à analyser les performances des modèles selon différentes complexités d'actions. Les vidéos ne sont pas éditées et incluent des variations naturelles telles que des secousses de caméra, des occlusions et des vues partielles, ce qui fait du jeu de données un benchmark réaliste pour des applications du monde réel.

Rôle dans la recherche en apprentissage profond

UCF101 est devenu un benchmark standard dans la communauté de l'Deep learning, en particulier pour évaluer les architectures de Neural network conçues pour la compréhension vidéo. Les premières approches utilisaient des caractéristiques artisanales, mais le jeu de données a gagné en importance avec l'avènement des réseaux de neurones convolutifs. En 2014, des chercheurs ont démontré que les modèles d'Deep learning pouvaient atteindre une haute précision sur UCF101, surpassant les méthodes traditionnelles. Le jeu de données a été utilisé pour comparer des architectures comme les réseaux à deux flux, qui traitent séparément les informations spatiales et temporelles, et les réseaux convolutifs 3D qui apprennent directement les caractéristiques spatiotemporelles. Il sert également de banc d'essai pour les techniques de Data Augmentation, telles que le recadrage aléatoire et le gigue temporel, qui améliorent la généralisation des modèles.

Évaluation et métriques

L'évaluation standard sur UCF101 rapporte la précision de classification moyenne sur les trois divisions prédéfinies. Un modèle est entraîné sur l'ensemble d'entraînement de chaque division et testé sur l'ensemble de test correspondant. La métrique finale est la précision moyenne sur les divisions. Ce protocole garantit une comparaison équitable entre différentes méthodes. Au fil des ans, la précision de pointe est passée d'environ 70 % en 2014 à plus de 97 % en 2020, grâce aux avancées dans les architectures comme les réseaux résiduels et les mécanismes d'attention. Le jeu de données est souvent associé à HMDB51, un autre jeu de données de reconnaissance d'actions, pour fournir une évaluation plus complète.

Impact et limites

UCF101 a influencé le développement de modèles de compréhension vidéo et a été utilisé dans des applications telles que la surveillance, l'interaction homme-machine et la recherche vidéo basée sur le contenu. Cependant, ses limites incluent un nombre relativement faible de classes par rapport à des jeux de données plus récents comme Kinetics-400, qui contient 400 classes et plus de 300 000 clips. Les vidéos dans UCF101 sont également courtes et peuvent ne pas capturer les dépendances temporelles à long terme. Malgré ces contraintes, UCF101 reste une ressource précieuse pour le prototypage rapide et à des fins éducatives dans les cours de Machine learning. Sa nature réaliste et sa taille modérée le rendent accessible aux chercheurs disposant de ressources computationnelles limitées.

Benchmarks connexes et évolution

Le succès d'UCF101 a stimulé la création de jeux de données plus grands et plus complexes. L'introduction de Kinetics-400 en 2017 a déplacé l'attention vers l'entraînement à grande échelle, permettant le développement de modèles plus puissants. Néanmoins, UCF101 est toujours utilisé comme benchmark secondaire pour tester la généralisation et le surapprentissage. Il sert également de base pour l'apprentissage par transfert, où des modèles pré-entraînés sur de grands jeux de données sont affinés sur UCF101 pour des tâches spécifiques. La pertinence durable du jeu de données est évidente dans sa citation continue dans les articles de recherche et son inclusion dans les frameworks d'apprentissage profond populaires comme exemple standard pour la classification vidéo.

Conclusion

UCF101 a joué un rôle central dans l'avancement de la reconnaissance d'actions vidéo. Ses vidéos réalistes, son protocole d'évaluation clair et sa taille gérable en ont fait un pilier de la communauté de vision par ordinateur. Bien que les jeux de données plus récents offrent une plus grande échelle et diversité, UCF101 reste un outil essentiel pour le benchmarking et pour comprendre les fondamentaux de la modélisation spatiotemporelle en Artificial intelligence.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:video-action-recognition·dataset·computer-vision·benchmark
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique