译自英文

Cityscapes 是一个用于语义城市场景理解的大规模数据集,包含来自50个城市的多样化街道场景,并提供像素级标注,用于训练和评估计算机视觉模型。

城市景观是一个大规模数据集,专为城市街景的语义理解而设计。它提供了从德国及邻国50个城市的行驶车辆上录制的多样化立体视频序列,并配有5,000帧的高质量像素级标注,以及额外20,000帧的粗略多边形标注。该数据集由戴姆勒股份公司、达姆施塔特工业大学等机构的研究人员于2016年发布,现已成为自动驾驶和计算机视觉研究中语义分割、实例分割及全景分割等任务的标准基准。

城市景观的主要目标是推动算法的开发与评估,使其能够在真实条件下理解车辆周围的环境。数据集捕捉了城市驾驶的复杂性,包括多变的天气、季节和交通状况,因此成为具有挑战性的现实测试平台。其标注涵盖30个类别,归为八类:平坦路面(如道路、人行道)、人类(行人、骑行者)、车辆(汽车、卡车、公交车)、建筑(建筑物、围墙)、物体(交通标志、电线杆)、自然(植被、地形)、天空以及未标注区域。这种细粒度的分类体系支持深入的场景分析,并广泛用于训练自动驾驶系统中的深度学习模型。

数据采集与标注

数据采集使用安装在汽车上的立体摄像头系统,以每秒17帧的速度记录,分辨率为2048×1024像素。录制时间覆盖春、夏、秋三季,包含晴天、多云和雨天条件,但不包括冬季或夜间场景。5,000帧精细标注图像选自27个城市,而20,000帧粗略标注图像则来自另外23个城市,以确保地理多样性。标注工作由专业团队完成,每帧精细图像约需90分钟,使用多边形工具进行精确边界勾勒;粗略标注每帧约需7分钟,使用较少顶点的多边形,旨在支持预训练或弱监督学习。

基准任务与评估指标

该数据集主要用于语义分割任务,即为每个像素分配类别标签。标准评估指标是平均交并比(mIoU),涵盖所有类别,但通常单独报告19个用于训练和评估的类别(排除“未标注”类别)。城市景观还支持实例分割(区分同一类别中的不同对象,如单独车辆)和全景分割(结合语义与实例分割)。其公开排行榜允许研究者提交结果,推动了分割模型从早期全卷积网络到现代基于Transformer架构(如SegFormer和Mask2Former)的显著进步。

对计算机视觉的影响

城市景观已成为计算机视觉领域最具影响力的数据集之一,被广泛引用,并在学术界和工业界得到应用。它促进了域适应技术的发展,因为模型在城市景观上训练后,常需泛化到其他城市环境,如Waymo或Tesla Autopilot数据。该数据集还推动了合成数据的应用,例如使用GTA-V和CARLA等工具生成额外训练数据,再在城市景观上进行微调。其标注被用于训练语义分割、深度估计和目标检测模型,并持续作为新架构(包括基于神经网络和深度学习范式)的标准评估平台。

局限性与扩展

尽管取得了成功,城市景观仍存在已知局限。它仅覆盖欧洲城市,且主要集中在德国,导致对欧洲道路布局、标志和车辆类型存在偏差。数据集不包含夜间、大雨或雪天场景,限制了其在恶劣天气条件下的适用性。为弥补这些不足,研究者创建了扩展和补充数据集,如Cityscapes-Dark(夜间场景)和ACDC(恶劣条件数据集,涵盖雾、雨、雪等)。此外,粗略标注的精度较低,可能影响基于其训练的模型性能。尽管如此,城市景观仍是基础性资源,其基准持续用于评估最先进的城市场景理解模型。

参见

  • 语义分割
  • 自动驾驶
  • 计算机视觉
  • 数据集
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:computer-vision·dataset·autonomous-driving·semantic-segmentation
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史