NYU Depth V2是一个用于室内场景理解的大规模RGB-D数据集,由纽约大学的研究人员于2012年发布。该数据集包含使用微软Kinect传感器录制的视频序列,同时捕获彩色(RGB)图像和对齐的深度图。该数据集是单目深度估计、语义分割和场景解析等任务的标准基准,并在推动深度学习方法在室内感知领域的发展中发挥了重要作用。
该数据集包含1,449对密集标注的RGB和深度图像,其中每个像素被标注为894个对象类别之一(后来在常见基准中合并为40类)。此外,它还提供了来自464个多样化室内场景的407,024个未标注帧,涵盖卧室、客厅、办公室和厨房等房间。这些场景以第一人称视角捕获,模拟人在空间中移动的过程,这使得数据特别适用于机器人和增强现实应用。
采集与标注
最初的NYU Depth数据集(V1)于2011年发布,但V2扩展了场景数量并提高了标注质量。RGB-D数据使用Kinect传感器录制,彩色和深度流的分辨率均为640x480像素。深度图通过结构光捕获,提供以毫米为单位的度量深度信息。为了创建标注子集,研究人员从视频序列中选择帧,并使用自定义工具进行手动标注,为每个像素标注语义类别。标注过程涉及多轮检查以确保一致性,最终标签由人工评审员验证。
基准任务
NYU Depth V2主要用于两个任务:深度估计和语义分割。对于深度估计,模型被训练为从单个RGB图像预测密集深度图,评估指标包括均方根误差(RMSE)和相对误差。对于语义分割,模型将每个像素分类为40类之一,指标包括像素准确率和平均交并比(mIoU)。该数据集还支持多任务学习,其中模型同时预测深度和语义,这在现代神经网络架构中很常见。
研究影响
自发布以来,NYU Depth V2一直是室内场景理解的基石。它已被数百篇论文使用,包括基于残差网络编码器的早期工作和后来的基于Transformer的模型。该数据集的深度图也被用于3D重建和场景补全任务。其流行源于真实的室内环境和密集标签及大量未标注数据的可用性,这支持了半监督和自监督学习技术。研究人员还使用未标注帧进行预训练模型,结合数据增强和对比学习。
局限性与扩展
该数据集存在已知局限性,例如深度图中的传感器噪声(特别是在反光或暗表面上),以及对住宅室内环境的偏向。40类标签集较为粗糙,合并了许多细粒度类别。为了解决这些问题,已提出扩展版本,如改进标签的NYU Depth V2和合成数据集。尽管存在这些挑战,NYU Depth V2仍然是比较室内感知算法的参考点,其影响延伸到机器人和亚马逊网络服务云视觉服务等商业应用。