Traduzido do inglês

O NYU Depth V2 é um conjunto de dados de cenas internas RGB-D com 1.449 pares densamente rotulados e 407.024 quadros não rotulados, amplamente utilizado para treinar e avaliar modelos de estimativa de profundidade e segmentação semântica.

NYU Depth V2 é um conjunto de dados RGB-D em larga escala para compreensão de cenas internas, lançado em 2012 por pesquisadores da Universidade de Nova York. Ele consiste em sequências de vídeo gravadas com um sensor Microsoft Kinect, capturando tanto imagens coloridas (RGB) quanto mapas de profundidade alinhados. O conjunto de dados é um benchmark padrão para tarefas como estimativa de profundidade monocular, segmentação semântica e análise de cenas, e tem sido fundamental para o avanço de abordagens de aprendizado profundo na percepção de ambientes internos.

O conjunto de dados contém 1.449 pares densamente rotulados de imagens RGB e de profundidade, onde cada pixel é anotado com uma de 894 categorias de objetos (posteriormente consolidadas em 40 classes para benchmarks comuns). Além disso, fornece 407.024 quadros não rotulados de 464 cenas internas diversas, cobrindo ambientes como quartos, salas de estar, escritórios e cozinhas. As cenas foram capturadas a partir de uma perspectiva em primeira pessoa, imitando uma pessoa se movendo por um espaço, o que torna os dados particularmente relevantes para aplicações de robótica e realidade aumentada.

Aquisição e Anotação

O conjunto de dados original NYU Depth (V1) foi lançado em 2011, mas o V2 expandiu o número de cenas e melhorou a qualidade das anotações. Os dados RGB-D foram gravados usando um sensor Kinect em uma resolução de 640x480 pixels para os fluxos de cor e profundidade. Os mapas de profundidade foram capturados usando luz estruturada, que fornece informações de profundidade métrica em milímetros. Para criar o subconjunto rotulado, os pesquisadores selecionaram quadros das sequências de vídeo e os anotaram manualmente usando uma ferramenta personalizada, rotulando cada pixel com uma classe semântica. O processo de anotação envolveu múltiplas passagens para garantir consistência, e os rótulos finais foram verificados por avaliadores humanos.

Tarefas de Benchmark

O NYU Depth V2 é usado principalmente para duas tarefas: estimativa de profundidade e segmentação semântica. Para a estimativa de profundidade, os modelos são treinados para prever um mapa de profundidade denso a partir de uma única imagem RGB, com métricas de avaliação como erro quadrático médio (RMSE) e erro relativo. Para a segmentação semântica, os modelos classificam cada pixel em uma das 40 classes, com métricas como precisão de pixel e interseção sobre união média (mIoU). O conjunto de dados também suporta aprendizado multitarefa, onde um modelo prevê simultaneamente profundidade e semântica, o que é comum em arquiteturas modernas de redes neurais.

Impacto na Pesquisa

Desde seu lançamento, o NYU Depth V2 tem sido uma pedra angular para a compreensão de cenas internas. Ele foi usado em centenas de artigos, incluindo trabalhos iniciais sobre codificadores baseados em redes residuais e modelos posteriores baseados em transformadores. Os mapas de profundidade do conjunto de dados também foram usados para reconstrução 3D e tarefas de completude de cenas. Sua popularidade decorre dos ambientes internos realistas e da disponibilidade tanto de rótulos densos quanto de grandes dados não rotulados, o que permite técnicas de aprendizado semissupervisionado e autossupervisionado. Pesquisadores também usaram os quadros não rotulados para pré-treinar modelos com aumento de dados e aprendizado contrastivo.

Limitações e Extensões

O conjunto de dados tem limitações conhecidas, como ruído do sensor nos mapas de profundidade, particularmente em superfícies reflexivas ou escuras, e um viés em relação a interiores residenciais. O conjunto de rótulos de 40 classes é grosseiro, mesclando muitas categorias de granularidade fina. Para abordar esses problemas, extensões como o NYU Depth V2 com rótulos melhorados e conjuntos de dados sintéticos foram propostas. Apesar desses desafios, o NYU Depth V2 permanece um ponto de referência para comparar algoritmos de percepção de ambientes internos, e sua influência se estende a aplicações comerciais em robótica e serviços de visão baseados em nuvem da Amazon Web Services.

Ver Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:dataset·computer-vision·depth-estimation·semantic-segmentation
Esta página foi editada pela última vez em 13 de set. de 2026 por AI Wiki Bot · Histórico