译自英文

ActivityNet是一个用于时间动作定位与识别的大规模视频数据集,包含200个动作类别和超过28,000个带有密集时间标注的视频,在计算机视觉研究中被广泛使用。

ActivityNet是一个大规模视频数据集,旨在推动时间动作定位和动作识别的研究。它提供了密集标注的视频片段,使模型不仅能够识别发生了哪些动作,还能确定动作在视频中的发生时间。自推出以来,它已成为评估视频理解算法(尤其是涉及未裁剪视频的任务,其中动作嵌入在更长的序列中)的标准基准。

该数据集于2015年首次发布,由密歇根大学及其他机构的研究人员开发,主要贡献者包括Fabian Caba Heilbron、Victor Escorcia、Bernard Ghanem和Juan Carlos Niebles。初始版本ActivityNet-200包含200个动作类别和超过28,000个视频,总计超过648,000条时间标注。视频来源于YouTube等公共平台,涵盖体育、家务和社交互动等多种活动。每个视频都标注了多个动作实例,每个实例都有开始和结束时间,为时间定位提供了丰富的真实标注。

结构与标注

ActivityNet分为三个子集:训练集、验证集和测试集,分布比例约为50/25/25。标注以JSON格式提供,包括视频URL、动作标签和时间边界。对于每个动作实例,数据集还包含标注质量的置信度分数。动作类别按层次组织为多个类别,如“体育”、“家务”和“个人护理”,这有助于在不同粒度上评估模型。

ActivityNet的一个关键特点是其专注于未裁剪视频,这与早期包含裁剪片段的数据集(如UCF101或HMDB51)形成对比。这种设计迫使模型处理完整的时空上下文,使任务更加真实。数据集还包含一个“背景”类别,用于不属于200个动作中的任何片段的段,这对训练定位模型至关重要。

基准任务

与ActivityNet相关的主要任务是时间动作定位和动作识别。在时间动作定位中,模型必须预测未裁剪视频中每个动作实例的开始和结束时间,以及动作标签。这通常使用不同时间交并比(IoU)阈值(如0.5和0.75)下的平均精度(mAP)进行评估。另一方面,动作识别涉及对视频中的主导动作进行分类,通常使用top-1和top-5准确率进行评估。

ActivityNet还举办年度挑战赛,即ActivityNet大规模动作识别挑战赛,该挑战赛与CVPR和ICCV等主要计算机视觉会议联合举办。该挑战赛吸引了来自学术和工业研究团体的众多提交,推动了该领域的进展。多年来,数据集已扩展了额外的标注,如ActivityNet Captions子集,它为视频片段提供自然语言描述,支持视频字幕和密集视频字幕的研究。

对计算机视觉的影响

ActivityNet显著影响了视频理解模型的发展。它已被用于训练和评估各种架构,从传统的基于手工特征的方法到现代的深度学习方法。许多用于时间动作定位的最先进模型,如边界匹配网络(BMN)和ActionFormer,都在ActivityNet上报告了结果。该数据集还促进了弱监督定位的研究,其中模型仅使用视频级标签进行训练,以及高效视频处理的研究,考虑到数据的大规模。

数据集对时间结构的强调已为更广泛的人工智能领域做出贡献,特别是在监控中的活动识别、人机交互和自动驾驶等领域。它还被与其他数据集(如kinetics(尽管不在提供的列表中,但它是已知的相关数据集)和Something-Something(也不在列表中))结合使用,以创建更全面的基准。

局限性与未来方向

尽管取得了成功,ActivityNet仍存在局限性。视频来源于YouTube,这可能在内容和质量方面引入偏差。动作类别是预定义的,可能无法覆盖所有可能的人类活动。此外,时间标注是手动创建的,耗时且可能存在不一致性。为解决这些问题,研究人员提出了扩展版本,如ActivityNet-1.3,它包含更多视频和精炼的标注,并探索使用数据增强技术来提高模型的鲁棒性。

未来的工作可能涉及将ActivityNet与其他模态(如音频或文本)集成,以创建多模态基准。大型语言模型Transformer架构的兴起也为视频理解开辟了新的途径,而ActivityNet仍然是这些新兴方法的相关测试平台。随着领域向更复杂的任务(如视频问答和长期视频理解)发展,像ActivityNet这样的数据集可能会不断演变以应对这些挑战。

结论

ActivityNet是计算机视觉领域的基础资源,为时间动作定位提供了严格的基准。其密集标注和真实的未裁剪视频使其成为评估视频理解算法的标准。通过实现精确的时间建模,它推动了自动化视频分析的可能性边界,对众多现实世界应用具有深远影响。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:computer-vision·dataset·video-understanding·temporal-action-localization
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史