译自英文

ADE20K是一个大规模场景解析数据集,包含超过20,000张图像,这些图像具有跨150个物体和材质类别的密集像素级标注,广泛用于计算机视觉中语义分割模型的训练与评估。

ADE20K是一个用于场景解析的大规模数据集,场景解析是一项计算机视觉任务,涉及为图像中的每个像素标注语义类别,例如“人”、“汽车”、“墙壁”或“天空”。该数据集由麻省理工学院计算机科学与人工智能实验室的研究人员于2016年发布,旨在解决早期数据集覆盖对象类别较少或标注较粗糙的局限性。ADE20K包含超过20,000张训练图像和2,000张验证图像,,并附有一个用于基准评估的额外测试集。图像来源于多样化的真实世界场景,,包括厨房和客厅等室内环境,,以及街道、公园和海滩等室外环境。

该数据集为150个语义类别提供了密集的像素级标注,,其中包括“物质”类别(例如天空、道路、草地)和“物体”类别(例如人、椅子、狗)等。标注由人类标注员按照详细的标注协议创建,,每张图像可以包含同一类别的多个实例,,从而也支持实例级分割。ADE20K还为某些对象提供了额外属性,,例如遮挡和深度排序,,这有助于更高级的场景理解任务。该数据集常被用作语义分割、实例分割和场景解析的标准基准,,并已被纳入主要的计算机视觉挑战赛,,包括人工智能社区的年度识别竞赛中。

构建与标注

ADE20K数据集是基于LabelMe数据集和其他公共图像库中的图像集合构建的。标注过程涉及一组训练有素的标注员,,他们使用自定义的基于网络的工具绘制每个对象的多边形边界并分配语义标签。为确保一致性,,数据集包含一份详细的标注指南,,定义了150个类别中的每一个,,包括模糊案例和边缘情况。标注工作最终在训练集和验证集中产生了超过500,000个标记的对象实例。该数据集以学术研究的宽松许可发布,,此后已被计算机视觉社区广泛采用。

在场景解析研究中的作用

场景解析是计算机视觉中的一个基本问题,,要求理解图像的完整上下文,,而不仅仅是检测单个对象。ADE20K旨在通过提供涵盖常见对象和背景元素的丰富类别集来支持这一目标。该数据集已被用于训练和评估各种模型,,从早期的全卷积网络到现代的基于Transformer架构中。例如,,2021年推出的SegFormer模型在ADE20K上报告了最先进的性能,,在验证集上实现了超过51%的平均交并比(mIoU)得分中。该数据集也被用于研究域适应、少样本学习和开放词汇分割,,其中模型需要分割训练期间未见过的对象。

对计算机视觉的影响

ADE20K已成为评估场景解析算法的事实标准,,与Cityscapes和COCO等其他数据集并列中其大量的类别和多样的场景类型使其成为一个具有挑战性的基准,,推动了模型性能的边界中该数据集还影响了相关资源的开发,,例如专注于场景分类的ADE20K Places365子集,,以及提供不同方法比较排行榜的MIT场景解析基准中研究人员利用ADE20K研究场景上下文与对象识别之间的关系,,从而深入了解模型如何利用全局场景信息来改进局部预测中

局限性与扩展

尽管取得了成功,,ADE20K仍有局限性中该数据集与最近的大规模数据集相比相对较小,,且其类别是固定的,,这可能限制对新型对象类型的泛化能力中标注质量虽然较高,,但仍可能包含错误,,尤其是对于小或严重遮挡的对象中为解决这些问题,,研究人员提出了扩展方案,,例如包含更多图像和类别的ADE20K-Full,,以及测试模型对异常对象放置鲁棒性的ADE20K-OutOfContext中该数据集也被用作预训练来源,,用于在其他任务上进行微调的模型,,展示了其在场景解析之外的实用性中

未来方向

截至2020年代中期,,ADE20K仍然是一个相关的基准,,但该领域正朝着更大和更多样化的数据集发展,,例如用于训练大型语言模型和多模态系统的数据集中场景解析与其他任务的整合,,例如基于深度学习的图像生成和生成式人工智能,,为使用ADE20K作为评估模型对视觉场景理解的测试平台开辟了新途径中该数据集在学术研究和行业应用中的持续使用,,凸显了其作为计算机视觉基础资源的重要性中

参见

参考文献

ADE20K数据集在Bolei Zhou等人于2017年发表的论文《Semantic Understanding of Scenes through the ADE20K Dataset》中首次介绍中该数据集可从MIT CSAIL网站下载,,其官方文档提供了关于标注指南和评估协议的详细信息中

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:computer-vision·dataset·semantic-segmentation·scene-parsing
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史