译自英文

COCO Keypoints是用于姿态估计的人物关键点标注数据集,属于Microsoft COCO数据集的一部分。它提供了超过200,000个人体实例的17个标注身体关节点,在计算机视觉研究中被广泛使用。

COCO Keypoints是微软通用对象上下文(COCO)数据集的一个子集,专门用于人体姿态估计和关键点检测任务。它提供了17个身体关节的详细标注,包括鼻子、眼睛、耳朵、肩膀、肘部、手腕、臀部、膝盖和踝关节,覆盖了多样化的真实世界图像中的人物实例。该数据集已成为计算机视觉人工智能领域的标准基准,使研究人员能够在无约束环境中训练和评估定位人体部位的模型。

COCO Keypoints数据集于2014年与主COCO数据集一同由微软研究人员推出。它包含超过200,000个人体实例的关键点标注,来源于超过118,000张训练图像和5,000张验证图像。每个关键点都带有可见性标志(可见、被遮挡或未标注),使模型能够处理部分遮挡情况。标注遵循严格格式,关键点按一致顺序排列,每个人体实例还提供边界框和分割掩码。

标注格式与质量

COCO Keypoints中的每个人体标注包含17个关键点的列表,以(x, y, 可见性)三元组表示。可见性标志取值为0(未标注)、1(已标注但被遮挡)和2(已标注且可见)。这种细粒度标注支持区分检测准确性和定位精度的评估指标。数据集由专业标注员使用定制工具进行标注,并通过质量控制流程确保一致性。关键点顺序遵循固定的解剖学序列,简化了模型输出格式和评估过程。

评估指标

COCO Keypoints的主要评估指标是对象关键点相似度(OKS),它测量预测关键点与真实关键点之间的距离,并按人体尺度进行归一化。标准指标是在多个OKS阈值(0.50、0.75和0.90)上计算的平均精度(AP)。该指标考虑了关键点定位相对于人体尺寸的难度。COCO Keypoints挑战赛从2016年至2019年每年举办,吸引了众多研究团队,推动了姿态估计架构的重大进步。

对姿态估计研究的影响

COCO Keypoints在推进深度学习姿态估计方法方面发挥了重要作用。早期方法使用残差网络骨干网络配合反卷积头部,而后期方法引入了Transformer架构和多尺度特征融合。数据集的多样性(包括复杂背景、多变光照和多人物场景的图像)推动模型超越了简单的受控环境。许多最先进的系统,如基于U-Net变体和注意力机制的系统,都在该数据集上进行了基准测试。高质量标注数据的可用性对监督学习至关重要,因为手动生成此类标注既昂贵又耗时。

扩展与相关数据集

针对专门任务,已开发了COCO Keypoints的多个扩展。COCO-WholeBody数据集增加了133个关键点,包括面部、手部和脚部标注。CrowdPose数据集专注于多人物交互的拥挤场景。COCO Keypoints标注还被用于生成半监督学习的伪标签,以及为动作识别和人机交互等其他姿态相关任务预训练模型。该数据集在学术研究和工业应用中仍被广泛使用,包括机器人技术、体育分析和医疗保健监控。

可用性与使用

COCO Keypoints在COCO许可下免费用于研究目的。标注以JSON文件形式分发,图像来源于Flickr。数据集托管在COCO网站上,可通过各种机器学习框架和工具访问。许多开源库提供加载和处理COCO Keypoints数据的实用工具,使其可供全球研究人员使用。该数据集已被数千篇同行评审出版物引用,反映了其在姿态估计算法发展中的核心作用。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:computer-vision·pose-estimation·dataset·keypoint-detection
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史