R-CNNは、[[object-detection|物体検出]]分野における初期の深層学習手法であり、その後の多くの検出モデルの基盤となった。

英語からの翻訳

R-CNN(領域ベースの畳み込みニューラルネットワーク)は、選択的探索による領域提案とCNNベースの分類を組み合わせた先駆的な物体検出アーキテクチャであり、2014年にRoss Girshickらによって導入された。

R-CNN(基于区域的卷积神经网络)是一种目标检测架构,由罗斯·吉尔希克、杰夫·多纳休、特雷弗·达雷尔和吉滕德拉·马利克于2014年在加州大学伯克利分校提出。它是首批在目标检测领域取得显著优于传统计算机视觉方法成果的深度学习方法之一,而目标检测涉及在图像中定位目标并对其进行分类。R-CNN证明了卷积神经网络可以有效地从图像分类迁移到目标检测,为新一代检测模型奠定了基础。

R-CNN的核心创新在于其基于区域的方法。它并非使用滑动窗口扫描整个图像,而是首先生成一组可能包含目标的候选区域,然后对每个区域独立运行CNN。这种两阶段范式、、先提出区域,再进行分类、、在数年间成为目标检测的主导框架,影响了后来的Fast R-CNN和Faster R-CNN等模型。

架构与方法

R-CNN的运行分为三个主要阶段。首先,它使用选择性搜索算法为每张图像生成约2000个与类别无关的候选区域。这些候选区域是可能包含目标的边界框。其次,每个候选区域被调整到固定大小(227×227像素),并通过一个CNN(通常是AlexNet的变体)提取4096维的特征向量。最后,这些特征被输入一组针对特定类别的线性支持向量机(SVM)以对区域进行分类,同时一个边界框回归模型用于细化候选区域的坐标。

选择性搜索由贾斯珀·尤林斯及其同事于2013年开发,其使用至关重要,因为它减少了需要评估的区域数量,相比穷举式滑动窗口方法更为高效。CNN充当了强大的特征提取器,从原始像素中学习层次化表示,其性能优于早期检测器(如可变形部件模型)中使用的方向梯度直方图(HOG)等手工特征。

训练过程

训练R-CNN涉及多步骤流程。CNN首先在ImageNet分类数据集上进行预训练,该数据集包含超过120万张图像,涵盖1000个类别。随后,CNN在目标检测数据集上进行微调,使用与真实边界框重叠度(IoU)至少为0.5的候选区域作为正样本,IoU低于0.3的作为负样本。微调之后,SVM在提取的特征上进行训练,其中正样本的IoU阈值更严格,设为0.3,以减少误检。最后,训练一个线性回归模型来调整边界框坐标,使用IoU大于0.6的候选区域。

这一训练流程计算开销巨大。每个候选区域都需要通过CNN进行一次前向传播,而每张图像有2000个候选区域,导致训练和推理速度缓慢。在GPU上,处理单张图像大约需要47秒,使得实时应用不切实际。然而,其精度提升是显著的。

性能与影响

在PASCAL VOC 2012数据集上,R-CNN实现了53.3%的平均精度均值(mAP),相比此前由SegDPM方法取得的40.4%最先进水平有显著提升。在VOC 2007数据集上,其mAP达到58.5%,大幅超越了所有先前方法。这证明了深度学习在目标检测中的强大能力,并推动了该领域的快速发展。

R-CNN的成功激发了一系列改进。2015年,罗斯·吉尔希克提出了Fast R-CNN,通过单次CNN前向传播共享计算,并引入感兴趣区域(RoI)池化层,显著减少了训练和推理时间。同年晚些时候,Faster R-CNN用学习到的区域提议网络取代了选择性搜索,使整个流程可实现端到端训练,并接近实时速度。这些模型,连同采用不同单阶段方法的YOLO(You Only Look Once)和SSD(Single Shot MultiBox Detector),在数年间主导了目标检测研究。

局限性与遗产

尽管取得了突破,R-CNN也存在显著局限。其多阶段训练复杂且耗时,需要分别训练CNN、SVM和边界框回归器。推理速度对于许多实际应用而言过慢,且由于需要存储所有候选区域的特征,内存占用较大。这些问题促使了更快、更集成化后续模型的发展。

尽管如此,R-CNN仍被广泛认为是计算机视觉领域的里程碑式论文。它证明了深度学习可以成功应用于目标检测,而这一问题此前一直难以攻克。其方法论影响了众多后续工作,并确立了从大型分类数据集进行迁移学习的重要性。该论文于2014年在IEEE计算机视觉与模式识别会议(CVPR)上发表,被引用数万次,反映了其对人工智能机器学习领域的持久影响。

R-CNN还促进了深度学习技术在计算机视觉中的更广泛采用,与2012年的AlexNet等其他突破性成果并驾齐驱。其成功鼓励研究人员将CNN应用于更广泛的视觉任务,包括语义分割和视频分析。如今,尽管更新的模型在性能上已超越R-CNN,但其概念框架仍是计算机视觉课程中的关键内容,也是理解目标检测演进的参考基点。

相关发展

R-CNN的谱系包含多个著名变体。Fast R-CNN(2015年)引入了RoI池化以共享卷积计算,将训练时间从数天缩短至数小时,并将VOC 2012上的mAP提升至66%。Faster R-CNN(2015年)增加了区域提议网络(RPN),该网络可学习生成候选区域,在GPU上实现了约每秒5帧的接近实时速度,并进一步提升了精度。Mask R-CNN(2017年)将Faster R-CNN扩展至实例分割,在边界框之外增加了预测分割掩码的分支。这些模型在从自动驾驶到医学影像等应用中广泛采用,并持续影响着该领域的现代架构。

信息框

  • 类型:目标检测架构
  • 提出时间:2014年
  • 提出者:罗斯·吉尔希克、杰夫·多纳休、特雷弗·达雷尔、吉滕德拉·马利克
  • 相关神经网络深度学习机器学习

分类

  • 目标检测
  • 计算机视觉
  • 深度学习
  • 卷积神经网络
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:object-detection·computer-vision·deep-learning·convolutional-neural-network
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴