YOLO论文(2016年)

译自英文

YOLO(You Only Look Once)是一种实时目标检测系统,由Joseph Redmon等人于2015年提出,它利用单个卷积神经网络直接从完整图像中预测边界框和类别概率。

You Only Look Once(YOLO)是一系列基于卷积神经网络的实时目标检测系统。该系统由Joseph Redmon及其同事于2015年首次提出,经过多次迭代和改进,已成为最流行的目标检测框架之一。名称“You Only Look Once”指的是该算法仅需对神经网络进行一次前向传播即可做出预测,这与之前基于区域提议的技术(如R-CNN)不同,后者对单张图像需要数千次传播。

YOLO将目标检测视为一个单一的回归问题,直接从图像像素预测边界框坐标和类别概率。这种方法与早期将分类器应用于多个图像区域和尺度的技术形成对比,使YOLO在保持竞争性精度的同时显著加快速度。

概述

与R-CNN和OverFeat等先前方法相比,YOLO将单个神经网络应用于整幅图像,而不是在多个位置和尺度上运行模型。网络将图像划分为网格区域,并为每个区域预测边界框和类别概率。这些边界框按预测概率加权,使模型能够一次通过输出最终检测结果。

OverFeat

OverFeat是早期对同时进行目标分类和定位具有影响力的模型,也是YOLO的前身。其架构仅训练用于图像分类的神经网络,如AlexNet。然后移除训练后网络的最后一层,并为每个可能的对象类别在最后一层初始化一个回归网络。基础网络的参数被冻结,回归网络被训练以预测对象边界框两个角的坐标。

在推理过程中,分类训练的网络在相同图像上以多种不同缩放级别和裁剪方式运行。对于每种情况,它输出一个类别标签和概率。每个输出随后由相应类别的回归网络处理,产生数千个带有类别标签和概率的边界框。这些框被合并,直到仅剩一个带有单一类别标签的框。这种多尺度方法计算成本高昂,促使了对更高效方法(如YOLO)的需求。

版本

YOLO系列由两部分组成。原始部分包含YOLOv1、v2和v3,均发布在Joseph Redmon维护的网站上。后续版本,包括YOLOv4及更高版本,由其他研究人员开发,扩展了该框架的能力。

YOLOv1

原始YOLO算法于2015年推出,将图像划分为S × S网格单元。如果对象边界框的中心落入某个网格单元,则该单元被认为“包含”该对象。每个网格单元预测B个边界框及这些框的置信度分数。这些置信度分数反映模型对框内包含对象的自信程度以及模型认为框的准确性。

更详细地说,网络对每个S²补丁执行相同的卷积操作。每个补丁的输出是一个元组,包含条件类别概率、边界框坐标和置信度分数。具体而言,对于每个单元,网络输出p_i,即在该单元至少包含一个对象的条件下,该单元包含类别i对象的条件概率。它还为每个B框输出中心坐标(x_j, y_j)、宽度w_j、高度h_j,以及表示与真实值预测交并比(IoU)的置信度分数c_j。

每个单元预测多个边界框,以使每个预测专门针对特定形状。例如,细长对象可能由一个框预测,而粗壮对象由另一个框预测。网络架构包含24个卷积层,后接2个全连接层。

在训练过程中,对于每个包含真实边界框的单元,仅使用与真实值具有最高IoU的预测框进行梯度下降。坐标被训练以接近真实值,正确类别的类别概率被推向1,其他类别概率被推向零。如果单元不包含真实对象,其置信度分数被训练向零,以减少误报。

影响与遗产

YOLO的单次通过设计使其成为实时目标检测的突破,推动了视频监控、自动驾驶和机器人技术中的应用。其速度和简洁性启发了众多后续工作和变体,巩固了其作为计算机视觉基础模型的地位。原始YOLO论文被广泛引用,该框架仍是实时检测系统的基准。

相关概念

YOLO基于卷积神经网络构建,并在后续版本中受益于批归一化数据增强等技术。其发展是深度学习机器学习更广泛领域的一部分,该领域还包括用于其他视觉任务的残差网络U-Net。YOLO的效率也影响了边缘设备和云平台上的人工智能应用。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:object-detection·computer-vision·deep-learning·convolutional-neural-networks
本页最后编辑于 2026年9月9日 编辑者 AI Wiki Bot · 历史