计算机视觉是人工智能的一个子领域,致力于使机器能够从图像和视频中提取有意义的信息,包括识别物体、理解场景、跟踪运动,以及在生成式应用中产生新的视觉内容。它借鉴了机器学习、信号处理和几何学,并且一直是深度学习研究中最持续多产的试验场之一。
历史
早期的计算机视觉,从20世纪60年代到21世纪初,依赖于研究人员设计的手工特征、边缘检测器和几何模型,并结合经典的机器学习分类器。进展缓慢,在真实世界图像上的表现仍然有限。该领域的决定性转变始于2009年发布的ImageNet数据集,以及围绕它举办的年度ILSVRC竞赛,这为研究人员提供了一个大规模、标准化的物体识别基准。2012年,AlexNet,一个在GPU上训练的卷积神经网络,以巨大优势赢得了ILSVRC,这一事件常被视为现代深度学习时代的开端,在ImageNet 2012 (AlexNet moment)条目中有进一步讨论。卷积网络在接下来的十年中主导了该领域。
核心任务
经典的计算机视觉任务包括图像分类,即为图像分配标签;物体检测,即在图像中定位并标记多个物体;语义和实例分割,即按类别或物体实例标记每个像素;以及姿态估计。视频任务增加了跨帧跟踪物体和随时间识别动作。每个任务在历史上都需要专门的架构,尽管后来的基于Transformer的视觉模型越来越多地在共享骨干下统一了多个任务。
从CNN到Transformer
卷积网络在2010年代中期之前一直是主导架构,设计上越来越深、越来越高效。大约从2020年开始,研究人员将最初为自然语言处理开发的Transformer (architecture)架构改编到图像上,将图像视为一系列补丁,这种方法被称为Vision Transformer。基于Transformer的视觉模型在规模上被证明与CNN相当或更优,并且更容易与文本结合,促进了视觉语言模型的兴起,例如CLIP,它学习图像和标题的共享表示。
生成式与多模态视觉
自2020年代初以来,计算机视觉越来越多地与生成式建模重叠:生成对抗网络和后来的扩散模型使得不仅解释图像,还能生成图像成为可能,为文本到图像和文本到视频系统提供了动力。嵌入通用系统中的视觉语言模型将计算机视觉从狭窄的识别任务扩展到开放式的视觉问答和作为多模态AI一部分的图像推理。
应用与关切
计算机视觉支撑着面部识别、医学图像分析、自动驾驶感知、工业质量检测和内容审核等众多用途。其部署引起了关于算法偏见的审查,特别是在面部识别跨人口群体中记录在案的准确性差异,以及引发公民自由关切的监控用途,这些都融入了关于该技术可接受用途的更广泛辩论中。