译自英文

全卷积网络(FCN)是一类用于语义分割的深度神经网络,通过将全连接层替换为卷积层,以生成像素级的类别预测。

全卷积网络(FCN)是一类用于语义分割的深度学习架构,其任务是为图像中的每个像素分配一个类别标签。与传统的分类网络不同,后者为整张图像输出一个单一标签,而FCN则生成与输入空间维度相同的密集输出图,从而实现像素级理解。该架构由Jonathan Long、Evan Shelhamer和Trevor Darrell于2015年在加州大学伯克利分校提出,是现代计算机视觉的基础性贡献,影响了后来的架构,如U-Net等众多模型。

FCN的关键创新在于将分类网络(如AlexNet或VGG)中通常使用的全连接层替换为卷积层。这使得网络能够接受任意尺寸的输入,并输出空间图而非固定长度的向量。该架构通常包含一个下采样路径(编码器),用于提取特征,以及一个上采样路径(解码器),用于恢复空间分辨率。上采样通常通过转置卷积(也称为反卷积)或双线性插值实现,并可添加跳跃连接以细化边界。

架构与设计

FCN建立在基础分类网络(如VGG-16或ResNet)之上,将其全连接层转换为1x1卷积。随后,网络使用一系列转置卷积层将特征图上采样回输入分辨率。原始FCN论文提出了三种变体:FCN-32s、FCN-16s和FCN-8s,它们在用于结合粗粒度高层特征与细粒度低层特征的跳跃连接数量上有所不同。其中,FCN-8s添加了来自较早层的预测,在三种变体中取得了最佳的分割精度。

训练FCN需要像素级损失函数,通常是交叉熵,并使用标准优化技术,如带动量的随机梯度下降。作者还采用了批归一化丢弃法等技术来改善收敛性和泛化能力。

应用与影响

FCN已被广泛应用于语义分割之外的多种任务,包括医学图像分析、自动驾驶和遥感。在医学成像中,FCN用于分割CT和MRI扫描中的器官或肿瘤,通常作为U-Net等更高级模型的基础。在自动驾驶中,FCN帮助从摄像头画面中识别道路边界、行人及车辆,为Waymo特斯拉自动驾驶等公司开发的系统做出贡献。

FCN的影响延伸至更广泛的人工智能领域,因为它们证明了卷积网络可以端到端地训练以完成密集预测任务,而无需单独的后处理步骤。这一范式转变影响了后续架构,包括编码器-解码器模型和基于注意力机制的方法。

局限性与演变

尽管FCN取得了成功,但其仍存在局限性。由于下采样过程中空间细节的丢失,它们可能产生粗糙的分割图,并且可能难以处理小物体或细薄结构。转置卷积的使用也可能引入棋盘伪影。这些问题推动了更复杂架构的发展,例如具有大量跳跃连接的U-Net,以及后来融入多头注意力机制的模型。

现代语义分割模型通常将FCN风格的编码器与Transformer解码器相结合,如SegFormer等模型,它们利用位置编码交叉注意力来捕捉长距离依赖。尽管如此,FCN仍然是计算机视觉课程中教授的基本概念,也是评估新方法的基线。

训练与优化

训练FCN需要谨慎处理内存和计算资源,因为密集输出非常消耗内存。通常采用数据增强(如随机裁剪、翻转)和学习率调度等技术。原始实现使用Caffe框架,并在PASCAL VOC数据集上训练,在当时取得了最先进的结果。后续工作已将FCN适配到其他框架和数据集,包括COCO和Cityscapes。

在实践中,FCN通常从预训练的分类网络进行微调,这能加速收敛并提高准确性。这种迁移学习方法在机器学习中是标准做法,并已在神经网络研究中被广泛采用。

遗产

FCN的引入标志着计算机视觉的一个转折点,证明了深度网络可以直接解决密集预测任务。其原理已嵌入无数现代系统中,从医学诊断到自动驾驶车辆。截至2020年代中期,FCN在学术文献中仍被引用,并作为更高级模型的构建模块,凸显了其在深度学习领域的持久相关性。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:computer-vision·semantic-segmentation·deep-learning·neural-network
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史