Traduit de l'anglais

NYU Depth V2 est un ensemble de données de scènes intérieures RGB-D, comprenant 1 449 paires densément annotées et 407 024 images non annotées, largement utilisé pour l'entraînement et l'évaluation de modèles d'estimation de profondeur et de segmentation sémantique.

NYU Depth V2 est un ensemble de données RGB-D à grande échelle pour la compréhension de scènes intérieures, publié en 2012 par des chercheurs de l'Université de New York. Il se compose de séquences vidéo enregistrées avec un capteur Microsoft Kinect, capturant à la fois des images couleur (RGB) et des cartes de profondeur alignées. Cet ensemble de données est une référence standard pour des tâches telles que l'estimation de profondeur monoculaire, la segmentation sémantique et l'analyse de scènes, et il a joué un rôle clé dans l'avancement des approches d'apprentissage profond pour la perception en intérieur.

L'ensemble de données contient 1 449 paires d'images RGB et de profondeur densément étiquetées, où chaque pixel est annoté avec l'une des 894 catégories d'objets (plus tard consolidées en 40 classes pour les benchmarks courants). De plus, il fournit 407 024 images non étiquetées provenant de 464 scènes intérieures diverses, couvrant des pièces comme les chambres, les salons, les bureaux et les cuisines. Les scènes ont été capturées d'un point de vue à la première personne, imitant une personne se déplaçant dans un espace, ce qui rend les données particulièrement pertinentes pour la robotique et les applications de réalité augmentée.

Acquisition et annotation

L'ensemble de données NYU Depth original (V1) a été publié en 2011, mais V2 a élargi le nombre de scènes et amélioré la qualité des annotations. Les données RGB-D ont été enregistrées à l'aide d'un capteur Kinect à une résolution de 640x480 pixels pour les flux couleur et profondeur. Les cartes de profondeur ont été capturées à l'aide de lumière structurée, fournissant des informations de profondeur métriques en millimètres. Pour créer le sous-ensemble étiqueté, les chercheurs ont sélectionné des images des séquences vidéo et les ont annotées manuellement à l'aide d'un outil personnalisé, étiquetant chaque pixel avec une classe sémantique. Le processus d'annotation a impliqué plusieurs passes pour garantir la cohérence, et les étiquettes finales ont été vérifiées par des évaluateurs humains.

Tâches de référence

NYU Depth V2 est principalement utilisé pour deux tâches : l'estimation de profondeur et la segmentation sémantique. Pour l'estimation de profondeur, les modèles sont entraînés à prédire une carte de profondeur dense à partir d'une seule image RGB, avec des métriques d'évaluation telles que l'erreur quadratique moyenne (RMSE) et l'erreur relative. Pour la segmentation sémantique, les modèles classifient chaque pixel dans l'une des 40 classes, avec des métriques comme la précision par pixel et l'intersection sur union moyenne (mIoU). L'ensemble de données prend également en charge l'apprentissage multitâche, où un modèle prédit simultanément la profondeur et la sémantique, ce qui est courant dans les architectures modernes de réseaux de neurones.

Impact sur la recherche

Depuis sa publication, NYU Depth V2 a été une pierre angulaire pour la compréhension de scènes intérieures. Il a été utilisé dans des centaines d'articles, y compris des travaux précoces sur les encodeurs basés sur réseaux résiduels et des modèles ultérieurs basés sur des transformeurs. Les cartes de profondeur de l'ensemble de données ont également été utilisées pour la reconstruction 3D et les tâches de complétion de scènes. Sa popularité découle des environnements intérieurs réalistes et de la disponibilité à la fois d'étiquettes denses et de grandes quantités de données non étiquetées, ce qui permet des techniques d'apprentissage semi-supervisé et auto-supervisé. Les chercheurs ont également utilisé les images non étiquetées pour le pré-entraînement de modèles avec augmentation de données et l'apprentissage contrastif.

Limitations et extensions

L'ensemble de données présente des limitations connues, telles que le bruit du capteur dans les cartes de profondeur, en particulier sur les surfaces réfléchissantes ou sombres, et un biais vers les intérieurs résidentiels. L'ensemble d'étiquettes de 40 classes est grossier, fusionnant de nombreuses catégories fines. Pour remédier à ces problèmes, des extensions comme NYU Depth V2 avec des étiquettes améliorées et des ensembles de données synthétiques ont été proposées. Malgré ces défis, NYU Depth V2 reste un point de référence pour comparer les algorithmes de perception en intérieur, et son influence s'étend aux applications commerciales en robotique et aux services de vision cloud basés sur Amazon Web Services.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:dataset·computer-vision·depth-estimation·semantic-segmentation
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique