译自英文

Kinetics-700是一个大规模视频动作识别数据集,包含700个人类动作类别,于2019年作为Kinetics系列的扩展引入,用于训练和评估深度学习模型。

Kinetics-700是一个用于视频动作识别的大规模数据集,包含700个人类动作类别和约65万个视频片段。它于2019年由DeepMind(现为Google DeepMind的一部分)的研究人员推出,作为早期Kinetics-400和Kinetics-600数据集的后续版本。该数据集广泛用作训练和评估深度学习模型在视频理解任务(如动作分类和时间定位)中的基准。

Kinetics-700中的视频来源于公开可用的YouTube片段,每个片段被裁剪为固定的10秒时长。动作类别涵盖了广泛的日常人类活动,包括体育、烹饪、个人护理和社交互动。每个类别包含600到1000个视频片段,确保类别间的分布均衡。数据集分为训练集、验证集和测试集,其中测试集标签被保留用于官方评估。

构建与标注

Kinetics-700的构建遵循半自动化流程。候选视频最初通过每个动作类别的搜索查询检索,然后通过自动化检查和人工标注的组合进行过滤。标注者验证每个片段是否正确描绘了目标动作,模糊或低质量的片段被丢弃。最终数据集经过策划以确保时间一致性,每个片段包含一个清晰可识别的动作。

与其前身相比,Kinetics-700引入了更多样化的动作类别,包括细粒度区分,如“演奏手风琴”与“演奏口琴”。这种增加的粒度对模型提出了更大挑战,要求它们捕捉细微的运动和上下文线索。

对视频识别研究的影响

Kinetics-700已成为视频动作识别领域的标准基准。它通常用于在大规模视频数据上预训练模型,然后在下游任务(如时空动作定位或视频字幕生成)上进行微调。该数据集推动了3D残差网络视频变换器等架构的进展,这些架构在其验证集上取得了最先进的结果。

研究人员还使用Kinetics-700来研究视频模型在不同领域的泛化能力。例如,在Kinetics-700上训练的模型已被证明在适当微调后能很好地迁移到其他视频数据集,如Something-Something和UCF101。该数据集的规模和多样性使其成为推进机器学习视频理解方法的关键资源。

评估与指标

Kinetics-700上的标准评估使用验证集上的top-1和top-5准确率。由于测试集标签未公开发布,大多数已发表结果报告验证准确率。官方评估协议要求模型为每个10秒片段预测单个动作标签,无需时间定位。这种设置强调从短裁剪视频片段中识别动作的能力。

在实践中,许多模型在Kinetics-700上达到70-80%的top-1准确率,最佳性能架构结合了多尺度时间建模和注意力机制。该数据集还支持视频表示学习的评估,其中模型在Kinetics-700上预训练,然后通过线性探测或微调在其他任务上进行评估。

局限性与考虑

尽管有其用途,Kinetics-700存在已知的局限性。该数据集偏向于在YouTube上表现良好的动作,这可能无法反映现实世界中人类活动的全部多样性。此外,10秒的片段长度可能不足以涵盖在更长时间尺度上展开的动作,如烹饪一顿饭或组装家具。研究人员指出,数据集的类别分布可能导致模型对背景上下文过于敏感,而非动作本身。

使用公开可用的YouTube视频也引发隐私和伦理问题,因为个人可能在未明确同意的情况下出现。该数据集旨在用于研究目的,鼓励用户在使用基于其训练的模型时考虑这些问题。

相关数据集与扩展

Kinetics-700是更广泛的Kinetics数据集家族的一部分,包括Kinetics-400、Kinetics-600以及最近的Kinetics-700-2020,后者更新了类别列表并添加了新片段。其他相关基准,如Something-Something和ActivityNet,侧重于视频理解的不同方面,如细粒度对象交互或时间活动检测。为Kinetics-700开发的数据增强技术也影响了其他视频数据集和模型训练流程。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:video-action-recognition·dataset·computer-vision·benchmark
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史