译自英文

EfficientNet是谷歌人工智能于2019年推出的一系列用于计算机视觉的卷积神经网络(CNN),以其复合缩放方法而闻名,该方法通过统一缩放网络的深度、宽度和分辨率来提高效率和准确性。

EfficientNet是一个为计算机视觉任务开发的卷积神经网络(CNN)家族,由Google AI的研究人员于2019年首次发表。其定义性特征是复合缩放,这是一种使用单一系数统一调整神经网络所有维度(深度、宽度和分辨率)的技术。这种方法与仅缩放单一维度的传统做法(如增加层数或增大输入尺寸)形成对比。EfficientNet模型已被广泛应用于图像分类、目标检测和语义分割等领域,并因在较低计算成本下实现高精度而著称,相较于早期架构表现突出。

最初的EfficientNet论文表明,复合缩放可以在ImageNet基准上超越单独调整维度的模型。通过仔细平衡多个轴上的增长,该家族在保持浮点运算次数(FLOPs)可控的同时实现了最先进的结果。这些模型依赖于通过神经架构搜索发现的基线架构,缩放方法在此基础上构建,产生从紧凑型到高精度的一系列模型。

架构与复合缩放

EfficientNet的核心创新是复合缩放方法。该方法不是单独任意增加深度(层数)、宽度(通道数)或分辨率(输入图像尺寸),而是同时缩放所有三个维度。给定一个基线网络,深度乘数d、宽度乘数w和分辨率乘数r定义为d = α^φ、w = β^φ和r = γ^φ,其中φ是控制整体规模的复合系数。这些乘数受条件α · β² · γ² ≈ 2约束,这确保将φ增加φ₀倍会使网络的总计算成本大约增加2^φ₀倍。超参数α、β和γ通常通过小型网格搜索设置;原始论文建议的值分别为1.2、1.1和1.15。

在架构上,基线EfficientNet-B0是通过神经架构搜索(NAS)发现的,该搜索确定了倒置瓶颈卷积(称为MBConv)作为高效构建块,这一构建块此前在MobileNet中得到了推广。完整的EfficientNet家族由堆叠的MBConv层组成,具体层数和滤波器大小由复合缩放方程决定。原始出版物引入了八个模型,即EfficientNet-B0至EfficientNet-B7,每个模型在深度、宽度和分辨率上逐步增加,从而在图像分类等任务上带来相应的精度提升。

变体与改编

除了原始的B0-B7模型外,EfficientNet还通过进一步的神经架构搜索为专用硬件进行了改编。变体已针对边缘TPU(优先考虑低延迟和能效)以及集中式TPU或GPU集群(吞吐量至关重要)进行了调整。这些改编通常以略微降低精度为代价,换取推理速度的显著提升,使其适用于嵌入式系统和云服务中的实时应用。

EfficientNet V2于2021年6月发表,引入了多项架构改进。更新后的设计纳入了通过扩展NAS搜索发现的更广泛的卷积层类型,包括融合MBConv块。一个显著进展是新的训练程序,在训练期间逐步增加输入图像尺寸,并结合了诸如dropout、RandAugment和Mixup等正则化技术。作者报告称,这种方法缓解了渐进式调整大小时常见的精度下降问题,从而加快训练速度并改善最终性能。EfficientNet V2还引入了S、M和L等变体,以针对不同的资源约束。

影响与应用

EfficientNet影响了深度学习领域后续关于模型缩放和架构设计的研究。其复合缩放原理已应用于其他架构,包括transformer,并启发了多维缩放策略。在实践中,EfficientNet模型通常用作目标检测系统(如You Only Look Once(YOLO))和分割模型(如U-Net)的骨干网络,这得益于其强大的特征提取能力和效率。它们也常用于迁移学习流程,其中在ImageNet等大型数据集上预训练的权重被微调以用于特定领域任务。

该模型家族对计算效率的重视使其成为移动设备和边缘硬件部署的热门选择,补充了AppleQualcomm等公司在优化神经网络推理方面的工作。其开源可用性(通常采用宽松许可证)促进了学术界和工业界的广泛采用,巩固了其作为现代CNN设计基准的地位。

局限性与未来方向

尽管有其优势,EfficientNet仍存在局限性。复合缩放方法依赖于粗略的FLOPs近似,可能并不总能针对特定硬件或约束产生最优权衡。此外,原始的MBConv层虽然高效,但可能不如transformer模型中发现的基于注意力的新机制有效。此后,研究探索了将卷积块与注意力相结合的混合架构,旨在结合CNN的效率与多头注意力的上下文理解能力。近年来,EfficientNet仍是一个具有竞争力的基线,但更新的模型越来越多地融入神经架构搜索和自动缩放的思想,以进一步推动精度和效率的边界。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:convolutional-neural-network·computer-vision·model-scaling·google-ai
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史