NUS-WIDE是一个从照片分享平台Flickr上传的图片构建的多标签图像数据集。它于2009年由新加坡国立大学的研究人员发布,其中包括蔡达成(Tat-Seng Chua)及其同事。该数据集旨在支持图像标注、检索和多标签分类研究,提供了一个大规模、真实世界的图像集合,包含多样的视觉内容和相关的文本元数据。
该数据集包含269,648张图像,每张图像标注有一个或多个81个概念标签(标签),涵盖广泛的日常场景和物体,例如“天空”、“水”、“人物”、“动物”和“建筑物”。这些标签源自用户在Flickr上最初为照片分配的标签,但随后由数据集创建者进行了清理和标准化。除了概念标签外,NUS-WIDE还提供了基于SIFT描述子的500维词袋特征、64维颜色直方图、144维颜色相关图,以及225维分块颜色矩。这些预计算特征使研究人员无需处理原始图像即可对算法进行基准测试。
构建与标注
该数据集通过从Flickr下载大量图像构建,重点关注那些已用81个预定义概念进行标签的图像。选择过程确保了各概念之间的平衡分布,每个概念都有最少数量的图像。真实标签由人工标注者手动验证以确保准确性,这使NUS-WIDE区别于仅依赖用户生成标签的数据集。最终集合包括原始图像和预计算的特征向量,使其适用于广泛的机器学习任务。
研究中的应用
NUS-WIDE已成为计算机视觉和人工智能领域的标准基准,特别是在涉及多标签分类和图像检索的任务中。研究人员使用它来评估自动图像标注方法,其目标是预测给定图像的一组相关标签。它还被用于数据增强和深度学习架构的研究,例如残差网络和U-Net变体,尽管后者在分割任务中更为常见。该数据集的多标签特性使其成为处理概念间相关性(如“天空”通常与“云”共现)的算法的具有挑战性的测试平台。
特征与基线
提供的特征集支持快速实验,无需大量预处理。500维词袋特征捕获局部视觉模式,而颜色直方图和相关图提供全局颜色信息。许多已发表的论文报告了在NUS-WIDE上使用传统方法(如支持向量机和K近邻)以及更近期的神经网络方法的基线结果。该数据集还包括训练集和测试集的划分,通常有161,789张图像用于训练,107,859张用于测试,尽管一些研究使用不同的划分。
影响与遗产
NUS-WIDE影响了后续数据集的发展,例如Microsoft COCO和Visual Genome,这些数据集提供了更丰富的标注但规模较小。它对真实世界、用户生成内容的强调提供了与更精选数据集的对比,使其对研究噪声和多样视觉数据的挑战具有价值。截至2020年代初,它仍被广泛引用并用于学术研究,特别是在多标签学习和迁移学习等领域。该数据集可免费用于研究目的,其官方网站提供文档和下载链接,尽管原始图像托管在Flickr上,可能受可用性影响。
局限性
NUS-WIDE的一个局限性是其标签相对粗糙,仅涵盖81个概念,可能无法捕获细粒度区分。此外,预计算特征基于SIFT等较旧技术,这些技术已被来自深度学习模型的学习表示所取代。研究人员通常使用现代架构从原始图像中提取新特征,但这需要额外的存储和计算。该数据集还存在标签不平衡问题,某些概念出现的频率远高于其他概念,这可能会使评估指标产生偏差。
尽管存在这些局限性,NUS-WIDE仍然是基准测试和理解多标签图像分析的宝贵资源。其规模、真实世界图像和多标签标注的组合继续支持广泛的机器学习研究,从经典方法到当代深度学习方法。