nuScenes是自动驾驶研究领域的大规模公共数据集,由Aptiv于2019年发布。它提供了从城市环境中运行的车队捕获的多模态传感器数据的全面集合。该数据集被研究人员和开发者广泛用于训练和评估Artificial intelligence和Machine learning中的感知、预测和规划算法。其主要目标是通过提供具有丰富标注和多样化驾驶场景的标准化基准,加速自动驾驶技术的发展。
该数据集包含1,000个驾驶场景,每个场景约持续20秒,涵盖23个对象类别中的超过140万个标注对象。传感器套件包括六个提供360度覆盖的摄像头、五个远程雷达、一个激光雷达以及包含GPS和IMU数据的完整车辆状态报告。数据在两个地理上不同的城市 - 马萨诸塞州波士顿和新加坡 - 收集,以捕捉不同的交通模式、道路布局和天气条件。这种多样性使nuScenes在测试模型在不同环境和文化驾驶背景下的鲁棒性方面特别有价值。
标注和基准任务
nuScenes为所有对象提供详细的3D边界框标注,包括位置、大小、方向和速度。每个对象在帧间进行跟踪,支持时间分析。该数据集支持几个核心基准任务:3D对象检测、跟踪和运动预测。对于检测,主要评估指标是nuScenes检测分数(NDS),它结合了平均精度(mAP)与对平移、尺度、方向、速度和属性分类错误的惩罚。跟踪基准使用AMOTA(平均多对象跟踪精度),而预测任务评估未来轨迹在2、4和6秒时间范围内的准确性。
传感器融合与设计
nuScenes的一个显著特点是其对传感器融合的重视。与许多早期主要依赖激光雷达或摄像头的数据集不同,nuScenes包含来自所有传感器的同步数据,允许研究人员探索多模态方法。雷达数据在其他基准中通常未被充分利用,但在nuScenes中得到了完整标注和集成,支持对成本效益高的感知系统的研究。该数据集还为所有传感器提供了统一的坐标系和校准文件,简化了融合算法的开发。这种设计使nuScenes成为比较Deep learning架构的标准测试平台,包括基于Neural network的检测器和基于Transformer (architecture)的3D感知模型。
影响与采用
nuScenes的发布标志着自动驾驶研究向更真实和更具挑战性的基准转变。像KITTI这样的早期数据集规模较小,且在受控环境中捕获;nuScenes提供了更大的规模、传感器多样性和城市复杂性。它已被数千篇研究论文引用,并且是学术竞赛和行业评估的常见选择。该数据集还影响了后续工作,如Waymo Open Dataset和Argoverse,通过设定标注粒度和评估协议的标准。其研究许可下的公开可用性使高质量驾驶数据的获取民主化,使较小的实验室和初创公司能够参与前沿的Machine learning研究。
扩展和相关工具
Aptiv和研究社区已发布nuScenes的多个扩展。nuScenes-devkit是一个开源的Python库,提供数据加载、可视化和评估的实用工具,降低了入门门槛。2020年,nuScenes-lidarseg基准为激光雷达数据添加了逐点语义分割标签,将范围扩展到对象检测之外的场景理解。该数据集还包括带有详细车道和可行驶区域信息的地图扩展,支持路径规划和行为预测研究。这些资源使nuScenes不仅是一个静态数据集,而是一个不断发展的自动驾驶Artificial intelligence开发生态系统。
局限性与批评
尽管有其优势,nuScenes存在已知的局限性。数据主要是在晴朗天气条件下收集的,雨、雪或夜间场景有限,这可能降低模型对不利条件的泛化能力。传感器套件虽然全面,但使用32束激光雷达,其分辨率低于其他一些数据集中使用的64束或128束传感器。此外,标注过程虽然严格,但在密集交通或遮挡场景中可能引入错误。研究人员指出,该数据集的城市重点可能无法捕捉高速公路或乡村驾驶场景,限制了其对所有自动驾驶环境的适用性。在将nuScenes作为生产级系统的唯一基准时,这些因素值得考虑。
参见
- Waymo - 另一个主要的自动驾驶数据集和公司
- Cruise - 使用类似传感器设置的自动驾驶公司
- Tesla - 一种基于视觉的自动驾驶方法,与nuScenes的多传感器设计形成对比
- Deep learning - nuScenes基准中使用的核心方法论