Kinetics-600 est un jeu de données à grande échelle pour la reconnaissance d'actions vidéo, comprenant environ 480 000 clips vidéo couvrant 600 classes d'actions humaines. Il a été introduit en 2018 par des chercheurs de DeepMind (désormais partie de Google DeepMind) et de l'Université d'Oxford, en s'appuyant sur le jeu de données antérieur Kinetics-400. Ce jeu de données est largement utilisé comme référence pour entraîner et évaluer les modèles de apprentissage profond dans les tâches de compréhension vidéo.
Les clips proviennent de YouTube et représentent une large gamme d'activités humaines, allant d'actions quotidiennes comme « se brosser les dents » à des sports et des interactions avec des objets. Chaque clip est réduit à environ 10 secondes et étiqueté avec une seule classe d'action. Le jeu de données est conçu pour capturer la diversité et la complexité du mouvement humain réel, ce qui en fait un banc d'essai difficile pour les algorithmes de reconnaissance d'actions.
Construction du jeu de données
Le jeu de données Kinetics-600 a été créé via un pipeline semi-automatisé. Des URL de vidéos candidates ont été collectées à l'aide de requêtes de recherche pour chaque classe d'action, puis des annotateurs humains ont vérifié les clips pour s'assurer qu'ils représentaient correctement l'action prévue. Le processus d'annotation a impliqué plusieurs étapes de contrôle qualité, notamment la vérification de l'exactitude des étiquettes et la suppression des clips ambigus ou de faible qualité. Le jeu de données final contient 600 classes, chaque classe ayant au moins 600 clips, garantissant une distribution équilibrée entre les catégories. Le nombre total de clips est d'environ 480 000, avec une répartition train/validation/test d'environ 70/10/20 pour cent.
Relation avec Kinetics-400 et Kinetics-700
Kinetics-600 est une version intermédiaire entre le Kinetics-400 original (400 classes, introduit en 2017) et le Kinetics-700 ultérieur (700 classes, publié en 2019). Par rapport à Kinetics-400, Kinetics-600 ajoute 200 nouvelles classes d'actions, y compris des activités plus fines et des interactions. Le jeu de données a également introduit un protocole de validation plus rigoureux, avec un ensemble fixe de clips de validation pour faciliter des comparaisons équitables entre les modèles. Kinetics-700 a ensuite élargi le nombre de classes et introduit une répartition temporelle pour évaluer la généralisation à des périodes non vues.
Impact sur la compréhension vidéo
Kinetics-600 est devenu une référence standard pour la reconnaissance d'actions vidéo, stimulant les avancées dans des architectures telles que les réseaux convolutifs 3D et les transformeurs vidéo. Les modèles pré-entraînés sur Kinetics-600 servent souvent d'extracteurs de caractéristiques pour des tâches en aval comme le sous-titrage vidéo et la détection d'actions spatio-temporelles. La diversité du jeu de données a encouragé le développement de méthodes qui capturent à la fois les indices d'apparence et de mouvement, conduisant à des améliorations en précision et en robustesse. En 2025, les modèles de pointe atteignent plus de 90 % de précision top-1 sur l'ensemble de validation, une amélioration significative par rapport aux références initiales.
Limites et critiques
Malgré son succès, Kinetics-600 a été critiqué pour les biais potentiels inhérents aux données provenant de YouTube, tels que le déséquilibre géographique et culturel. Les classes d'actions sont principalement centrées sur l'Occident, ce qui peut limiter la généralisation des modèles entraînés sur ce jeu de données à d'autres régions. De plus, le jeu de données se concentre sur des clips courts à action unique, ce qui ne capture pas pleinement la complexité des activités à long terme ou des scénarios multi-étiquettes. Les chercheurs ont proposé des jeux de données complémentaires, tels que Something-Something et Moments in Time, pour combler certaines de ces lacunes.