Traduit de l'anglais

Kinetics-700 est un jeu de données à grande échelle pour la reconnaissance d'actions vidéo, comprenant 700 classes d'actions humaines, introduit en 2019 comme extension de la série Kinetics pour l'entraînement et l'évaluation de modèles d'apprentissage profond.

Kinetics-700 est un jeu de données à grande échelle pour la reconnaissance d'actions vidéo, contenant 700 classes d'actions humaines et environ 650 000 clips vidéo. Il a été introduit en 2019 par des chercheurs de DeepMind (désormais partie de Google DeepMind) comme successeur des jeux de données antérieurs Kinetics-400 et Kinetics-600. Ce jeu de données est largement utilisé comme référence pour entraîner et évaluer des modèles de Deep learning dans des tâches de compréhension vidéo, telles que la classification d'actions et la localisation temporelle.

Les vidéos de Kinetics-700 proviennent de clips YouTube publics, chacun étant découpé à une durée fixe de 10 secondes. Les classes d'actions couvrent un large éventail d'activités humaines quotidiennes, notamment les sports, la cuisine, les soins personnels et les interactions sociales. Chaque classe contient entre 600 et 1 000 clips vidéo, garantissant une distribution équilibrée entre les catégories. Le jeu de données est divisé en ensembles d'entraînement, de validation et de test, les étiquettes de l'ensemble de test étant retenues pour une évaluation officielle.

Construction et annotation

La construction de Kinetics-700 a suivi un pipeline semi-automatisé. Les vidéos candidates ont d'abord été récupérées à l'aide de requêtes de recherche pour chaque classe d'action, puis filtrées par une combinaison de vérifications automatisées et d'annotation humaine. Les annotateurs ont vérifié que chaque clip représentait correctement l'action cible, et les clips ambigus ou de faible qualité ont été écartés. Le jeu de données final a été organisé pour garantir une cohérence temporelle, chaque clip contenant une action unique et clairement identifiable.

Comparé à ses prédécesseurs, Kinetics-700 a introduit un ensemble plus diversifié de classes d'actions, y compris des distinctions fines telles que « jouer de l'accordéon » par rapport à « jouer de l'harmonica ». Cette granularité accrue pose un défi plus important pour les modèles, les obligeant à capturer des indices subtils de mouvement et de contexte.

Impact sur la recherche en reconnaissance vidéo

Kinetics-700 est devenu une référence standard dans le domaine de la reconnaissance d'actions vidéo. Il est couramment utilisé pour pré-entraîner des modèles sur des données vidéo à grande échelle avant de les affiner sur des tâches en aval, telles que la localisation spatio-temporelle d'actions ou le sous-titrage vidéo. Le jeu de données a stimulé les progrès dans des architectures comme les réseaux résiduels 3D et les transformateurs vidéo, qui ont obtenu des résultats de pointe sur son ensemble de validation.

Les chercheurs ont également utilisé Kinetics-700 pour étudier la généralisation des modèles vidéo à travers différents domaines. Par exemple, il a été démontré que les modèles entraînés sur Kinetics-700 se transfèrent bien à d'autres jeux de données vidéo, tels que Something-Something et UCF101, lorsqu'ils sont affinés de manière appropriée. L'échelle et la diversité du jeu de données en ont fait une ressource clé pour faire progresser les approches de Machine learning dans la compréhension vidéo.

Évaluation et métriques

L'évaluation standard sur Kinetics-700 utilise la précision top-1 et top-5 sur l'ensemble de validation. Étant donné que les étiquettes de l'ensemble de test ne sont pas publiées publiquement, la plupart des résultats publiés rapportent la précision de validation. Le protocole d'évaluation officiel exige que les modèles prédisent une seule étiquette d'action pour chaque clip de 10 secondes, sans localisation temporelle. Cette configuration met l'accent sur la capacité à reconnaître des actions à partir de segments vidéo courts et découpés.

En pratique, de nombreux modèles atteignent une précision top-1 comprise entre 70 et 80 % sur Kinetics-700, les architectures les plus performantes intégrant une modélisation temporelle multi-échelle et des mécanismes d'attention. Le jeu de données prend également en charge l'évaluation de l'apprentissage de représentations vidéo, où les modèles sont pré-entraînés sur Kinetics-700 puis évalués sur d'autres tâches via un sondage linéaire ou un affinage.

Limites et considérations

Malgré son utilité, Kinetics-700 présente des limites connues. Le jeu de données est biaisé vers des actions bien représentées sur YouTube, ce qui peut ne pas refléter la pleine diversité des activités humaines dans des contextes réels. De plus, la durée de clip de 10 secondes peut être insuffisante pour des actions qui se déroulent sur des échelles de temps plus longues, comme cuisiner un repas ou assembler des meubles. Les chercheurs ont noté que la distribution des classes du jeu de données peut conduire à des modèles trop sensibles au contexte de fond plutôt qu'à l'action elle-même.

Des préoccupations en matière de confidentialité et d'éthique découlent également de l'utilisation de vidéos YouTube publiques, car des individus peuvent apparaître sans consentement explicite. Le jeu de données est destiné à des fins de recherche, et les utilisateurs sont encouragés à considérer ces questions lors du déploiement de modèles entraînés sur celui-ci.

Jeux de données connexes et extensions

Kinetics-700 fait partie d'une famille plus large de jeux de données Kinetics, incluant Kinetics-400, Kinetics-600 et le plus récent Kinetics-700-2020, qui a mis à jour la liste des classes et ajouté de nouveaux clips. D'autres références connexes, telles que Something-Something et ActivityNet, se concentrent sur différents aspects de la compréhension vidéo, comme les interactions fines avec des objets ou la détection temporelle d'activités. Les techniques de Data Augmentation développées pour Kinetics-700 ont également influencé d'autres jeux de données vidéo et pipelines d'entraînement de modèles.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:video-action-recognition·dataset·computer-vision·benchmark
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique