EfficientDet是由Google的研究人员开发的一系列目标检测模型,于2019年推出。这些模型旨在实现高精度的同时最小化计算成本,使其适用于资源受限环境中的部署,例如移动设备和边缘计算平台。EfficientDet的核心创新在于应用复合缩放技术,该技术同时调整神经网络的深度、宽度和输入分辨率,以在多种资源预算下优化性能。
EfficientDet的架构建立在早期高效图像分类工作的成功基础上,特别是EfficientNet模型系列,该系列证明了网络维度的精细缩放可以显著提升效率。EfficientDet将这一原理扩展到目标检测,该任务不仅需要对图像中的对象进行分类,还需要用边界框对其进行定位。该架构结合了特征金字塔网络(FPN),并增强了双向跨尺度连接和加权特征融合机制,使模型能够有效整合来自不同尺度的信息。
架构与设计
EfficientDet的主干网络是预训练的EfficientNet模型,用作特征提取器。主干网络处理输入图像并生成多个分辨率的特征图。这些特征图随后被输入到双向特征金字塔网络(BiFPN)中,该网络迭代地融合来自不同层级的特征。与传统使用简单加法的FPN不同,BiFPN对每个输入特征应用学习到的权重,使网络能够强调更具信息量的尺度。
EfficientDet模型的头部同时执行分类和边界框回归。它对所有特征层级使用共享卷积头,这减少了参数数量并提高了效率。该设计还包括一种复合缩放方法,统一缩放主干深度、BiFPN深度和宽度以及输入分辨率,使单一架构能够适应不同的精度和速度权衡。
复合缩放
复合缩放是EfficientDet效率的关键原理。该方法首次在EfficientNet中引入,使用一组缩放系数来控制网络的深度、宽度和分辨率。对于EfficientDet,缩放系数通过在验证集上进行网格搜索确定,目标是在给定的计算预算(以FLOPs衡量)下最大化精度。
这种方法与早期目标检测模型形成对比,后者通常需要针对每个目标平台进行手动架构调整。通过自动化缩放过程,EfficientDet可以生成一系列模型,从EfficientDet-D0(最小)到EfficientDet-D7(最大),每个模型提供不同的速度和精度平衡。例如,EfficientDet-D0在COCO数据集上达到34.6的平均精度(mAP),仅需25亿FLOPs,而EfficientDet-D7达到55.1 mAP,需770亿FLOPs。
性能与比较
EfficientDet在发布时为目标检测的效率设定了新基准。在COCO数据集上,这些模型在精度上超过了之前最先进的检测器,如YOLOv3和Faster R-CNN,同时使用更少的FLOPs和参数。例如,EfficientDet-D2以110亿FLOPs达到43.0 mAP,优于YOLOv3的33.0 mAP(需650亿FLOPs)。
效率提升在边缘设备上尤为显著。较小的变体,如EfficientDet-D0和D1,设计用于在移动CPU和GPU上实时运行,使其在自动驾驶、监控和增强现实等应用中具有吸引力。这些模型还展示了强大的迁移学习能力,在最小微调下在其他检测数据集上表现良好。
应用与影响
EfficientDet的推出影响了后续高效目标检测和计算机视觉研究。其设计原则,特别是加权双向特征融合和复合缩放的使用,在后续模型中被采用和扩展。EfficientDet已广泛应用于工业领域,如制造业缺陷检测、医学图像分析和零售分析。
该模型的效率也使其成为在ARM设备和其他低功耗硬件上部署的热门选择。其开源实现以Apache 2.0许可证发布,促进了学术研究人员和行业从业者的采用。EfficientDet仍然是比较新目标检测架构(尤其是针对效率的架构)的相关基线。
局限性与未来方向
尽管EfficientDet在效率方面取得了显著改进,但它存在局限性。复合缩放方法假设固定架构,可能并非对所有任务或硬件都是最优的。此外,这些模型主要设计用于2D目标检测,不直接解决实例分割或3D检测等其他任务,尽管主干网络可以适应这些目的。
后续工作探索了神经架构搜索和自动化机器学习,以进一步优化检测模型。基于transformer的检测器(如DETR及其变体)的兴起也将焦点转向简化检测流程的端到端方法。尽管如此,EfficientDet对高效模型设计的贡献继续为现代深度学习研究提供信息。