基于内容的图像检索(CBIR),又称基于图像内容的查询(QBIC)和基于内容的视觉信息检索(CBVIR),是将计算机视觉技术应用于图像检索问题:即在大型数据库中搜索数字图像的任务。CBIR的定义性特征在于,搜索分析的是图像本身的内容,如颜色、形状、纹理或其他可推导信息,而非关键词、标签或描述等元数据。这种方法直接与传统基于概念的方法相对立,后者依赖于人工标注的质量和完整性,而这种依赖性在规模极大或自动生成的图像集合中会变得问题重重。
CBIR系统采用来自统计学、模式识别、信号处理和计算机视觉等领域的计算方法。该领域自20世纪90年代初起源以来已显著发展,其驱动力来自数字图像库的增长以及大规模人工标注的不切实际。虽然早期系统依赖基本的视觉特征提取,但现代实现越来越多地利用机器学习和深度学习技术来提高检索准确性并处理更复杂的查询。
历史发展
“基于内容的图像检索”一词最早由日本电技术实验室工程师加藤俊和于1992年使用,他描述了基于颜色和形状从数据库中自动检索图像的实验。这标志着从先前仅依赖文本描述的方法的转变。最早的商业CBIR系统由IBM开发,称为QBIC(基于图像内容的查询)。虽然将多幅图像存储为单一实体早于BLOB(二进制大对象)一词的出现,但完全基于内容而非描述进行搜索的能力必须等待IBM的QBIC系统。后来的发展包括基于网络和图的方法,这些方法为现有技术提供了简单且有吸引力的替代方案。
与基于元数据搜索的比较
传统图像搜索要求人工在数据库中为图像标注关键词或元数据,这是一个耗时的过程,且可能无法有效捕捉描述图像所需的准则。基于关键词的搜索效果评估具有主观性且尚未明确定义,CBIR系统在定义成功标准方面也面临类似挑战。关键词还将查询范围限制在预定的一组准则内,且此类标注不如分析实际图像内容可靠。CBIR在大型数据库或自动生成的图像(如来自监控摄像头的图像)中尤为有价值,因为此时人工标注不切实际。将图像分类为语义类别(例如,“猫”作为“动物”的子类)的系统可以减少误分类问题,但需要用户付出更多努力来定位可能仅属于更广泛类别的图像。
查询技术
CBIR系统支持多种查询方法,以适应不同的用户需求。最常见的是按示例查询(QBE),即用户提供示例图像,可以通过提供现有图像、从随机集合中选择一幅,或使用颜色块或一般形状绘制粗略近似图。结果应与提供的示例具有共同元素,且此技术消除了用文字描述图像的困难。
语义检索始于诸如“找到亚伯拉罕·林肯的照片”之类的请求,这对计算机来说具有挑战性,因为主题可能不总是以相同的姿势或方向出现。因此,许多CBIR系统依赖纹理、颜色和形状等较低层特征,要么结合允许更轻松输入准则的界面,要么结合预训练以匹配特定特征(如人脸、指纹或形状)的数据库。一般来说,对更高层概念的图像检索需要人工反馈。
其他查询方法包括浏览示例图像、导航定制或分层类别、按图像区域而非整个图像查询、按多个示例图像查询、按视觉草图查询、直接指定图像特征,以及结合触摸、语音和其他输入的多模态查询。
相关性反馈与机器学习
CBIR成功的一个重要方面是理解用户意图。相关性反馈允许用户通过将图像标记为与查询“相关”、“不相关”或“中性”来逐步细化搜索结果,之后系统结合这些新信息重复搜索。这种交互式方法以及其他以人为中心的设计元素已成为CBIR发展的关键焦点。该领域还越来越多地使用机器学习和迭代技术来提高检索性能。早期CBIR系统基于颜色、纹理和形状属性搜索数据库;在这些系统开发之后,对用户友好界面的需求变得明显,从而推动了包括支持描述性语义的查询方法、用户反馈以及能够理解用户满意度水平的系统在内的努力。
技术进展与挑战
对CBIR的兴趣增长源于基于元数据系统的局限性以及高效图像检索的广泛应用潜力。文本信息易于用现有技术搜索,但对于规模极大或自动生成的集合,人工描述每幅图像不切实际,且使用不同同义词的描述可能导致图像被遗漏。已开发出各种标准来对图像进行分类,但所有标准都面临扩展性和误分类问题。已开发出许多CBIR系统,但截至2006年,基于像素内容检索图像的问题在很大程度上仍未解决。比较两幅图像(通常是示例图像和数据库中的一幅图像)的最常见方法涉及基于提取的视觉特征计算距离度量,并根据结果进行排序。现代系统越来越多地整合深度学习和神经网络架构以改进特征提取和语义理解,尽管在人类水平上实现完全语义检索仍是一个开放的研究挑战。