MobileNet是一系列为图像分类、目标检测及其他计算机视觉任务而开发的卷积神经网络(CNN)架构。这些模型旨在实现小尺寸、低延迟和低功耗,适用于资源受限设备(如手机和嵌入式系统)上的设备端推理和边缘计算。最初,它们被设计为使用TensorFlow Lite(一种用于机器学习模型的轻量级运行时)在移动设备上高效运行。
移动设备对高效深度学习模型的需求促使Google的研究人员开发了MobileNet。截至2025年6月,该系列包含五个主要版本,每个版本都在前代基础上改进性能和效率,同时保持对受限环境的适用性。
架构原理
MobileNet架构通过多种关键技术专注于降低计算成本。核心创新在于使用深度可分离卷积,它将标准卷积分解为两个独立操作:深度卷积(独立过滤每个输入通道)和逐点卷积(1×1卷积,用于组合输出)。这种分解显著减少了参数数量和浮点运算次数,相比标准卷积,能够在处理能力有限的设备上实现高效推理。
另一个重要策略是引入控制模型大小和计算负载的超参数。宽度乘数(记为α)调整每层中的通道数;较小的α值会产生更小、更快的模型,但会牺牲准确性。分辨率乘数(ρ)调整输入图像分辨率,较低的分辨率会加快处理速度,但可能降低精度。
该架构还结合了批量归一化和数据增强等技术,以提高训练稳定性和泛化能力。这些设计选择使MobileNet成为移动和嵌入式环境中实时应用的流行选择。
MobileNetV1
MobileNetV1于2017年4月发布。其主要架构创新是引入了深度可分离卷积,这一概念最初由Laurent Sifre于2013年在Google Brain实习期间提出,作为AlexNet的一种变体,旨在提高收敛速度并减小模型大小。深度可分离卷积将每个标准卷积分解为深度滤波器(按通道操作)和逐点组合(1×1卷积,用于合并深度层的输出)。
MobileNetV1的默认设置包括宽度乘数为1.0,分辨率乘数为224x224。然而,通过调整这些乘数,开发人员可以在外形因素和准确性之间取得平衡。该架构还在每次卷积后使用ReLU激活函数,并应用批量归一化以加速训练。
MobileNetV2
MobileNetV2于2019年3月发布,引入了两个重要改进:倒残差层和线性瓶颈。倒残差翻转了传统残差块的结构,首先扩展输入通道,然后执行深度卷积,最后投影回较少的通道数。这种扩展使得深度卷积能够在更高维空间中操作,保留更多信息流。
线性瓶颈从投影层中移除ReLU激活函数,基于非线性在低维空间中会导致信息丢失的直觉。通过保持这些层为线性,模型即使在通道数较少时也能保留更多表达能力。这些改进带来了比V1更高的准确性和更低的延迟,使V2成为移动视觉任务的常见选择。
MobileNetV3和V4
MobileNetV3于2019年发布,引入了三个变体:MobileNetV3-Large、MobileNetV3-Small和MobileNetEdgeTPU,后者针对Pixel 4智能手机进行了优化。这些模型通过直接测量移动延迟的神经架构搜索(NAS)发现,实现了准确性和推理速度之间的理想权衡。V3还包括swish和sigmoid激活函数的分段线性近似(h-swish和h-sigmoid)、挤压-激励模块,并继承了V2的倒瓶颈结构。
MobileNetV4于2024年9月发布,通过NAS扩展了该系列,包含众多架构。V4引入了受视觉Transformer启发的多查询注意力机制,并提出了一种新的后混合块,称为通用倒瓶颈,统一了早期版本中的倒残差和倒瓶颈概念。
MobileNetV5与未来方向
MobileNetV5的架构在2025年6月Gemma 3n(一种语言模型)发布后不久被宣布。尽管公告提到技术报告将很快发布,但截至2025年10月,尚未提供此类报告。据报道,V5网络比最大的V4变体大约大十倍,这表明其向更高容量模型转变,同时保持移动部署的可实现效率。
在其发展过程中,MobileNet影响了许多架构,并仍然是嵌入式视觉系统的基石,使得自动驾驶、机器人和移动摄影等领域的实际应用成为可能。