译自英文

DeepLab是一系列用于语义分割的深度学习模型,以其使用空洞卷积来捕获多尺度上下文同时保持空间分辨率而闻名。

DeepLab是一个用于语义分割的深度神经网络架构家族,语义分割是一项计算机视觉任务,旨在为图像中的每个像素分配一个类别标签。该模型由Google的研究人员开发(最初在Google Research,后来隶属于Google DeepMind),其显著特点是使用空洞(扩张)卷积,这种技术可以在不增加参数数量或损失空间分辨率的情况下扩大滤波器的感受野。该家族经历了多个版本的演进,每个版本都在架构和训练方法上引入了改进,并持续在PASCAL VOC和Cityscapes等基准数据集上取得最先进的结果。

DeepLab的核心创新是将空洞卷积(也称为扩张卷积)应用于语义分割。在标准卷积中,滤波器应用于输入的连续区域。空洞卷积在滤波器权重之间插入零(空洞),从而有效地将它们间隔开。扩张率控制间隔大小;率为1时是标准卷积,而更高的率则扩大视野。这使得网络能够从更大的上下文中捕获信息,而无需对特征图进行下采样,这对于保留分割边界的精细细节至关重要。DeepLab还采用了空洞空间金字塔池化(ASPP),该模块并行应用多个具有不同扩张率的空洞卷积,然后融合其输出。这种多尺度方法帮助模型识别不同大小的物体。

早期版本:DeepLabv1和DeepLabv2

第一个版本DeepLabv1于2015年推出,将空洞卷积与全连接条件随机场(CRF)结合用于后处理。CRF通过强制空间一致性来细化网络的粗糙输出,锐化物体边界。DeepLabv2于2016年提出,添加了ASPP模块,并将VGG-16骨干网络替换为ResNet,提高了准确性和效率。v2模型在PASCAL VOC 2012基准上取得了顶尖结果,为该领域树立了新标准。

DeepLabv3和DeepLabv3+

DeepLabv3于2017年发表,简化了架构,移除了CRF后处理,因为带有批归一化的ASPP模块已被证明足以捕获多尺度上下文。它还在随后的DeepLabv3+版本中引入了一种更有效的编码器-解码器结构,该版本添加了解码器模块以细化分割边界,特别是针对小物体。DeepLabv3+成为机器学习社区中广泛采用的基线,通常用作实例分割和全景分割等其他任务的骨干。该模型在Cityscapes和其他自动驾驶数据集上的表现使其成为实际应用中的热门选择。

技术细节与训练

DeepLab模型通常使用预训练的骨干网络(如ResNet或Xception),并移除最后的全连接层。输出步长(决定输入图像大小与输出特征图大小之比的超参数)是关键参数。DeepLabv3+通常在训练时使用输出步长16,推理时使用8,以平衡速度和准确性。训练涉及标准技术,如数据增强批归一化以及使用随机梯度下降或其变体进行优化。损失函数通常是逐像素的交叉熵损失,有时会结合中间层的辅助损失。

应用与影响

DeepLab已应用于众多领域,包括自动驾驶(Waymo和其他公司使用类似的分割模型进行场景理解)、医学图像分析(例如,在扫描中分割器官或肿瘤)、卫星图像分析和增强现实。其影响超越了语义分割;空洞卷积技术已被其他架构采用,如U-Net变体和物体检测模型。DeepLab家族也是更大系统(包括图像编辑和需要精确物体边界的生成式AI应用)中的常见组件。

DeepLab的发展反映了深度学习的更广泛趋势:从手工特征到端到端学习表示的转变、多尺度处理的重要性,以及追求在准确性和计算效率之间取得平衡的架构。虽然更新的模型(如基于变换器和适用于视觉的大语言模型的模型)在某些基准上已超越DeepLab,但DeepLab家族仍然是语义分割领域的基础参考点。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:semantic-segmentation·computer-vision·deep-learning·convolutional-neural-networks
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史