Charades是一个用于日常活动识别的大规模数据集,包含来自267位用户的9,848个视频。该数据集由卡内基梅隆大学和多伦多大学的研究人员于2016年提出,专注于识别家庭环境中执行的日常动作。每个视频都标注了多个动作标签,为计算机视觉领域的机器学习模型训练和评估提供了丰富资源。
该数据集的创建旨在解决早期活动识别基准的局限性,这些基准通常包含编排或脚本化的动作。Charades捕捉了自发的、非脚本化的活动,如烹饪、清洁和阅读,使其成为更贴近真实世界应用的基准。视频附有文本描述和动作标签,支持视觉识别和语言 grounding 方面的研究。
数据集构成
Charades包含9,848个视频,平均时长约30秒,总计约82小时的素材。数据集涵盖157个动作类别,包括“打开冰箱”、“看电视”和“使用手机”等广泛的日常活动。每个视频都标注了多个动作实例,且标注包含时间边界,支持帧级动作识别。
这些视频通过Amazon Mechanical Turk收集,参与者被要求在自己家中录制执行活动的过程。这种众包方式带来了多样化的环境、光照条件和拍摄角度,增加了识别任务的难度。数据集还包含27,847条视频描述,用于视频字幕生成和检索等任务。
评估与基准
Charades常用于基准测试动作识别模型,尤其是基于深度学习的模型。标准评估指标是所有动作类别上的平均精度均值(mAP),在视频级别计算。研究人员通常报告在Charades v1划分上的结果,该划分包含7,984个训练视频和1,864个测试视频。
多个知名模型已在Charades上进行了评估,包括双流卷积网络、时间片段网络,以及最近的基于Transformer的架构。该数据集也被用于研究多标签分类,因为每个视频可能包含多个同时发生的动作。截至2025年,最先进的模型mAP得分超过60%,但该数据集因其真实且嘈杂的特性仍具有挑战性。
在人工智能中的应用
Charades在推进人工智能研究方面发挥了重要作用,特别是在机器学习和深度学习领域。它被广泛用于训练视频理解模型,这是监控、人机交互和机器人等应用的关键组成部分。该数据集还支持神经网络架构的研究,包括残差网络和Transformer模型。
除了动作识别,Charades还被用于时间动作定位等任务,其中模型必须识别动作在视频中发生的时间。它也被用于多模态学习,结合视觉和文本信息。数据集的标注支持序列到序列模型在视频字幕生成中的研究,其目标是生成活动的自然语言描述。
相关数据集与影响
Charades是更广泛的活动识别数据集家族的一部分,包括UCF101、ActivityNet和Kinetics。与这些通常包含短视频片段的数据集不同,Charades提供了更长的、未裁剪的视频,更好地反映真实世界条件。这使其成为开发能够处理时间依赖性和嘈杂输入的鲁棒模型的宝贵资源。
该数据集已被数百篇研究论文引用,并影响了后续基准的设计,例如专注于自我中心视频的Charades-Ego数据集。Charades还被用于主要会议上的挑战赛,包括ActivityNet大规模活动识别挑战赛,促进了学术界和工业界之间的合作。
局限性与未来方向
尽管有其优势,Charades仍存在局限性。视频由非专业人士录制,导致质量参差不齐,偶尔出现标注错误。动作类别仅限于日常活动,可能无法泛化到体育或医疗程序等其他领域。此外,与较新的基准相比,该数据集相对较小,这可能限制超大型模型的训练。
未来的研究可能通过扩展数据集或将其与合成数据结合来解决这些局限性。生成式人工智能和大型语言模型的兴起也为使用Charades进行多模态推理任务开辟了新途径,其中模型必须同时理解视觉和文本信息。截至2025年,Charades仍是评估视频理解进展的标准基准。