译自英文

Kinetics-400是一个大规模视频动作识别数据集,包含400个人类动作类别,由DeepMind于2017年推出,旨在推动机器学习和计算机视觉领域中的视频理解发展。

Kinetics-400是一个用于视频动作识别的大规模数据集,包含约306,245个视频片段,涵盖400个人类动作类别。它由DeepMind的研究人员于2017年提出,此后已成为机器学习人工智能领域评估视频理解模型的标准基准。该数据集聚焦于人类动作,涵盖从“弹吉他”和“拥抱”等日常活动到体育运动及与物体交互,提供了多样化的视觉和运动模式。

Kinetics-400的主要目的是支持对能够自动识别未剪辑视频序列中动作的模型进行训练和评估。与ImageNet等图像数据集不同,Kinetics-400捕捉时间动态,这对于开发理解随时间变化的运动和上下文的算法至关重要。其规模和多样性使其成为视频分类、时空特征学习和动作定位研究的基础资源。

数据集构建

Kinetics-400通过从YouTube收集视频构建而成,每个片段时长约为10秒。该数据集结合了自动搜索和人工标注的方式。最初,针对400个动作类别中的每一个,使用查询检索候选视频,然后由人工标注者验证并标记片段以确保准确性。每个类别包含400至1,150个片段,完整数据集总计约306,245个片段。

动作涵盖广泛的类别,包括“打鼓”、“滑板”、“切蔬菜”和“握手”。数据集分为训练集、验证集和测试集,其中测试集标签被保留用于评估目的。为支持可复现性,数据集以知识共享许可发布,允许研究人员将其用于学术和商业用途。

对视频理解的影响

Kinetics-400显著影响了视频动作识别领域。在其发布之前,UCF-101和HMDB-51等数据集规模较小且多样性不足,限制了模型的泛化能力。Kinetics-400提供了更大且更多样化的动作集合,推动了更深层、更复杂架构的发展。它已被用于预训练模型,随后在较小的数据集上进行微调,这种做法已成为视频分析中的标准流程。

该数据集还推动了模型设计的创新。例如,3D卷积网络(如I3D(膨胀3D卷积网络))的引入,直接源于处理Kinetics-400规模的需求。I3D将2D ResNet架构膨胀为3D,在Kinetics-400上取得了当时最先进的结果,并为该领域树立了新基准。后续模型,包括SlowFast和X3D,在该数据集上进一步提升了性能,彰显了其作为架构进步驱动力的作用。

扩展与变体

在Kinetics-400成功之后,DeepMind的同一团队发布了扩展版本:Kinetics-600和Kinetics-700,分别包含600和700个动作类别。这些更大的数据集提供了更多多样性,并已用于训练具有更高准确率的模型。此外,Kinetics-400已被改编用于其他任务,如时间动作定位和视频字幕生成,通过添加标注或修改评估协议实现。

Kinetics-400也被纳入更广泛的基准中。例如,Something-Something数据集专注于细粒度的人-物交互,作为Kinetics-400的补充而创建,两者常一起用于评估模型泛化能力。该数据集的影响力超越了学术界,OpenAIAnthropic等工业实验室使用它来基准测试其视频模型,尽管它们通常不公开确切的训练细节。

局限性与考量

尽管有其效用,Kinetics-400存在已知的局限性。视频来源于YouTube,这引入了内容、文化和人口统计方面的偏差。动作通常由西方环境中的个体执行,这可能限制模型泛化到其他情境的能力。此外,10秒的片段长度可能无法捕捉更长的时间依赖关系,而标注过程虽然严谨,仍可能包含错误。

另一个担忧是隐私和伦理问题的潜在风险,因为数据集包含未经明确同意用于研究的人员视频。研究人员已通过制定负责任使用指南来应对这一问题,但该数据集仍是讨论的主题。截至2025年,Something-Something-v2和Ego4D等较新的数据集旨在弥补其中一些不足,但Kinetics-400仍是该领域广泛使用和引用的资源。

参见

参考文献

  • Kay, W., et al. (2017). The Kinetics Human Action Video Dataset. arXiv preprint.
  • Carreira, J., & Zisserman, A. (2017). Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset. CVPR.
  • Feichtenhofer, C., et al. (2019). SlowFast Networks for Video Recognition. ICCV.
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:video-recognition·dataset·computer-vision·machine-learning
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史