实例分割是一项计算机视觉任务,结合了目标检测和语义分割,用于识别并描绘图像中的每个不同对象实例。与语义分割不同,语义分割对给定类别的所有像素使用单一标签,而实例分割则为每个单独对象分配唯一标签,从而能够精确分离同一类别中重叠或相邻的对象。这一能力在从自动驾驶、医学影像到机器人和增强现实等应用中至关重要。
该任务通常被表述为逐像素分类问题,其中每个像素既被分配类别标签,也被分配实例标识符。现代方法严重依赖深度学习,尤其是卷积神经网络和基于Transformer的架构,以实现最先进的结果。实例分割是图像分割三大主要类别之一,另外两类是语义分割和全景分割,后者通过分类每个像素并区分可计数类别的实例来统一前两者。
历史背景
实例分割源于早期图像分割和目标检测的研究。经典计算机视觉技术,如阈值分割、聚类和边缘检测,提供了基础方法,但缺乏分离单个实例的能力。深度学习的引入,尤其是2014年前后基于区域的卷积神经网络(R-CNN)的成功,使得同时进行目标检测和分割成为可能。2017年,何恺明及其在Facebook AI Research的同事提出的Mask R-CNN架构,通过添加掩码分支扩展了Faster R-CNN,成为实例分割的基准。后续发展包括YOLACT,它实现了实时实例分割,以及基于Transformer的模型如Mask2Former,它统一了语义分割和实例分割任务。
核心技术
实例分割的经典方法包括阈值分割、聚类和基于运动的方法。阈值分割是最简单的技术,通过选择阈值将灰度图像转换为二值图像,常用方法包括Otsu方法和k-means聚类。聚类算法,如k-means和均值漂移,根据颜色、强度或纹理将像素分组,但本质上不区分实例。基于运动的分割利用连续帧之间的差异来隔离运动物体,交互式分割系统通过物理戳动物体以生成运动线索便展示了这一点。
现代深度学习方法主导该领域。两阶段检测器,如Mask R-CNN,首先提出候选区域,然后在每个区域内预测掩码。单阶段方法,如YOLACT和SOLO,直接预测掩码而无需区域提议,提供更快的推理速度。基于Transformer的架构,包括DETR和Mask2Former,将实例分割视为集合预测问题,利用注意力机制捕获全局上下文。这些模型在大型标注数据集(如COCO)上训练,该数据集提供超过20万张带有实例级掩码的图像。
应用
实例分割具有广泛的实际应用。在医学影像中,它能够实现组织病理学图像中的细胞核实例分割,从而支持细胞计数、形态特征提取和肿瘤分级。它还可用于定位肿瘤、测量组织体积和规划手术。在自动驾驶中,实例分割有助于检测和跟踪行人、车辆及障碍物,提升安全系统。其他应用包括卫星图像分析以定位道路、森林和农作物,视频监控中的目标跟踪,以及基于内容的图像检索。在机器人领域,实例分割支持物体操作和场景理解。
挑战与未来方向
尽管取得了进展,实例分割仍面临挑战。处理重叠或融合的物体,如拥挤场景或接触的细胞,仍然困难。对大量标注数据的需求是一个瓶颈,尤其是在医学影像等专业领域,专家标注稀缺。实时性能是自动驾驶和机器人等应用的另一个关注点。未来研究侧重于提高效率,通过半监督和少样本学习减少标注需求,以及将实例分割与全景分割等其他任务整合以实现全面的场景理解。截至2025年,基于Transformer的模型因其灵活性和准确性而日益受到青睐。