译自英文

EPIC-KITCHENS是一个大规模的第一人称视角视频数据集,记录了日常厨房活动,用于推动动作识别与预测研究的发展。

EPIC-KITCHENS是一个大规模的第一人称视频数据集,旨在用于人工智能研究,特别是在动作识别和动作预测领域。该数据集包含使用头戴式摄像头拍摄的日常厨房活动的第一人称(自我中心)视频记录。它为开发和评估从第一人称视角理解人类与物体及环境交互的算法提供了丰富的资源。

该数据集于2018年由布里斯托大学、卡塔尼亚大学和多伦多大学等机构合作推出。它包含来自32名参与者在自家厨房中的超过55小时视频,涵盖了各种烹饪和准备任务。这些视频被密集标注了动作标签,包括动词和名词组合(例如“切洋葱”、“倒水”),以及物体边界框,从而支持对活动的细粒度分析。

数据收集与标注

EPIC-KITCHENS数据集使用参与者佩戴的头戴式摄像头(如GoPro)在自然烹饪过程中录制。录制发生在参与者自己的家中,提供了真实且无脚本的场景。标注过程涉及手动标记每个视频帧的动作片段,识别动作的开始和结束时间,并从预定义词汇表中分配动词和名词标签。此外,每个帧都标注了物体边界框,从而支持物体检测和跟踪任务。

该数据集包含训练集和测试集,共有39,594个动作片段和454,714个物体边界框。动作标签涵盖125个动词类别和352个名词类别,形成了大量可能的动作组合空间。

基准任务与评估

EPIC-KITCHENS已成为自我中心视觉任务的标准基准,特别是动作识别和动作预测。动作识别涉及对给定视频片段中正在执行的动作进行分类,而动作预测则要求在动作发生之前预测下一个动作。该数据集还支持物体检测、跟踪和视频检索等任务。

评估指标通常包括动作识别的top-1和top-5准确率,以及预测任务的均值平均精度(mAP)。该基准已用于多个挑战赛,包括在CVPR和ECCV等主要计算机视觉会议上举办的EPIC-KITCHENS动作识别挑战赛。

影响与应用

该数据集显著推进了自我中心视觉研究,并被机器学习深度学习社区广泛采用。它使得开发能够从第一人称视角理解人类活动的模型成为可能,这对机器人技术、增强现实和辅助技术等应用至关重要。例如,神经网络架构(如基于Transformer的模型)已被应用于EPIC-KITCHENS进行动作预测,利用时间上下文和多模态信息。

此外,EPIC-KITCHENS还促进了长期视频理解和多模态(如音频和运动)集成的研究。该数据集的真实场景和密集标注使其成为训练和评估旨在泛化到现实世界场景的模型的宝贵资源。

扩展与相关数据集

在EPIC-KITCHENS成功之后,同一团队发布了EPIC-KITCHENS-100,这是一个扩展版本,包含来自45名参与者的100小时视频,并增加了额外标注和更大的词汇表。其他相关的自我中心数据集包括Ego4D,它涵盖了更广泛的日常活动,以及Charades-Ego,它专注于家庭环境中的自我中心动作识别。这些数据集共同推动了自我中心视频理解的边界。

结论

EPIC-KITCHENS仍然是自我中心视觉领域的基石数据集,为动作理解提供了独特且具有挑战性的基准。其贡献推动了人工智能领域的众多创新,并持续影响着人机交互和智能系统的研究。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:egocentric-vision·dataset·action-recognition·computer-vision
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史