Panoptic segmentation(全景分割)是一种计算机视觉任务,它将语义分割(为每个像素分配一个类别标签)和实例分割(区分单个对象实例)结合到一个统一的框架中。该术语由 Alexander Kirillov 等人于 2018 年提出,源自希腊语,意为“全视”,反映了其目标:提供对场景完整且连贯的理解。与语义分割(将同一类别的所有像素统一处理)不同,全景分割区分同一类别的不同实例(例如,不同的人或不同的车辆)。与仅关注“事物”(可计数的对象)的实例分割不同,全景分割还涵盖“stuff”(无定形的背景区域,如天空、道路或草地)。这种整体方法使得诸如自动驾驶、机器人和增强现实等应用能够同时感知对象级别和场景级别的信息。
背景与动机
传统的图像分割方法分为两类:语义分割和实例分割。语义分割为每个像素分配一个类别标签,但不区分同一类别的多个对象。实例分割则检测并勾勒出每个单独的对象,但通常会忽略背景区域。这种二分法造成了场景理解上的缺口,因为许多实际应用需要同时获取对象级别和区域级别的信息。全景分割通过提供一个统一的输出来弥补这一缺口,该输出同时包含“事物”(具有可数实例的对象)和“stuff”(不可数的背景区域)。该任务在 2018 年由 Kirillov 等人发表的论文《Panoptic Segmentation》中被正式定义,该论文还引入了全景质量(PQ)指标用于评估。
技术方法
全景分割方法通常采用深度学习架构,常基于卷积神经网络(CNN)或 Transformer。一种常见的方法是双分支设计:一个分支处理语义分割,生成逐像素的类别概率图;另一个分支处理实例分割,生成对象提议和掩码。然后,通过融合模块将这些输出合并,以解决冲突(例如,重叠区域)并为每个对象分配唯一的实例 ID。最近的前沿方法,如 Panoptic FPN(特征金字塔网络)和 Mask2Former,使用基于 Transformer 的架构,在统一的框架内联合预测类别标签和实例掩码。这些模型在大型数据集(如 COCO(常见对象上下文)和 Cityscapes)上进行训练,这些数据集为“事物”和“stuff”类别都提供了标注。
应用
全景分割具有众多实际应用。在自动驾驶中,它使车辆不仅能够识别行人、车辆和交通标志(事物),还能识别车道、人行道和天空(stuff),从而促进安全导航。在机器人领域,它帮助机器人通过区分背景表面上的单个对象来理解和与杂乱环境进行交互。在医学影像中,全景分割可以在组织区域内描绘出单个细胞(实例),有助于诊断和研究。此外,它还被用于增强现实,以在真实场景上叠加虚拟对象并实现精确的遮挡处理,以及在视频监控中,在保持场景上下文的同时跟踪多个对象。
评估指标
全景分割的主要评估指标是全景质量(PQ),由 Kirillov 等人提出。PQ 结合了分割质量(SQ)和识别质量(RQ)。SQ 衡量匹配片段(segments)的平均交并比(IoU),而 RQ 衡量实例匹配的 F1 分数。PQ 是 SQ 和 RQ 的乘积,并对所有类别取平均。该指标同时奖励准确的像素级分割和正确的实例判别。有时也会单独报告分割质量和识别质量等指标,以便进行更详细的分析。
挑战与未来方向
尽管取得了显著进展,全景分割仍面临若干挑战。“事物”和“stuff”类别之间的类别不平衡可能会使训练产生偏差,因此需要仔细的损失加权。实时性能对于自动驾驶等应用至关重要,但许多最先进的模型计算量很大。遮挡和重叠的实例仍然难以处理,尤其是在拥挤的场景中。未来的研究方向包括通过模型压缩和知识蒸馏来提高效率,利用时间信息进行视频全景分割,以及利用自监督学习来减少对昂贵标注的依赖。此外,将全景分割与深度估计和 3D 重建等其他任务相结合,也是一个活跃的研究领域。