译自英文

物体检测是一项计算机视觉任务,旨在识别并定位图像中的物体,结合分类与定位功能,输出边界框和类别标签。

目标检测是计算机视觉中的一项基本任务,涉及识别数字图像中的物体实例并确定其位置。与为整张图像分配单一标签的图像分类不同,目标检测输出一个或多个边界框,每个边界框与一个类别标签和置信度分数相关联。这一能力支撑着从自动驾驶、监控到医学影像和零售分析等众多应用。

该领域已从经典的手工特征方法演进到现代深度学习方法。早期技术,如Viola-Jones检测器(2001年)和带支持向量机的方向梯度直方图(HOG)(2006年),依赖于手工设计的特征。深度学习的出现,特别是卷积神经网络(CNN),彻底改变了这一领域。2012年,AlexNet在图像分类中的成功推动了基于CNN的检测器的发展。关键里程碑包括2014年的区域卷积神经网络(R-CNN),它引入了选择性搜索以生成区域提案;2015年的Fast R-CNN和Faster R-CNN通过集成区域提案网络提高了速度和准确性。与此同时,2016年的YOLO(You Only Look Once)和SSD(Single Shot MultiBox Detector)等单阶段检测器通过直接从特征图预测边界框和类别,提供了实时性能。

核心概念与架构

目标检测模型可以大致分为两阶段和单阶段检测器。两阶段检测器,如Faster R-CNN,首先生成区域提案,然后对每个提案进行分类,实现高准确性但计算成本较高。单阶段检测器,如YOLO和SSD,在单次通过中完成检测,以部分准确性换取速度。最近的进展包括基于变换器的检测器,如2020年的DETR(Detection Transformer),它将检测视为集合预测问题,消除了对锚框和非极大值抑制等手工组件的需求。

现代架构通常采用特征金字塔网络(FPN)来检测多尺度的物体。骨干网络,如ResNet、EfficientNet或视觉变换器(ViT),提取层次化特征。骨干网络和检测头的选择显著影响性能和效率。例如,YOLOv8(2023年)集成了CSPDarknet骨干、PANet颈部和解耦头,实现了最先进的速度-准确性权衡。

训练与评估

训练目标检测器需要带有边界框标签的大规模标注数据集。著名数据集包括PASCAL VOC(2005-2012年)、MS COCO(2015年)和Open Images(2016年)。这些数据集提供从数千到数百万张图像,涵盖多种类别的物体实例。损失函数通常结合分类损失(如交叉熵)和定位损失(如平滑L1或基于IoU的损失)。数据增强技术,如随机裁剪、缩放和颜色抖动,对泛化至关重要。

评估指标包括平均精确率均值(mAP),它计算跨类别和IoU阈值的精确率-召回率曲线下面积。MS COCO的mAP@[.5:.95]是标准基准。推理速度以每秒帧数(FPS)或延迟衡量,通常与准确性进行权衡。

应用与影响

目标检测是众多现实世界系统不可或缺的组成部分。在自动驾驶车辆中,它识别行人、车辆和交通标志,如Waymo特斯拉自动驾驶等公司所展示的。在监控中,它支持人员计数和异常检测。在零售中,它驱动库存管理和无人收银商店。在医疗保健中,它辅助放射影像中的肿瘤检测。该技术还实现了增强现实、机器人和图像搜索。

挑战与未来方向

尽管取得了进展,目标检测仍面临挑战:检测小物体、处理遮挡、适应域偏移,以及确保边缘情况下的鲁棒性。效率对于在嵌入式设备上的部署仍然至关重要,推动了对模型压缩和量化的研究。大型语言模型变换器的集成开辟了新途径,如开放词汇检测,其中模型可以使用文本描述检测超出训练类别的物体。研究继续在自监督和少样本学习方面进行,以降低标注成本。

著名研究人员与机构

关键贡献者包括Karen Simonyan(VGG、R-CNN)、Ross Girshick(R-CNN、Fast R-CNN、Faster R-CNN)和Joseph Redmon(YOLO)。伯克利AI研究斯坦福AI实验室MIT CSAIL的学术团队推动了该领域的发展。Google DeepMindOpenAI和微软研究等工业实验室也做出了贡献。目标检测的持续演进继续塑造着人工智能计算机视觉的更广泛格局。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:computer-vision·object-detection·deep-learning·image-processing
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史