콘텐츠 기반 이미지 검색(CBIR)은 이미지 콘텐츠 기반 질의(QBIC) 및 콘텐츠 기반 시각 정보 검색(CBVIR)이라고도 하며, 대규모 데이터베이스에서 디지털 이미지를 검색하는 작업인 이미지 검색 문제에 Computer vision 기법을 적용하는 것이다. CBIR의 정의적 특징은 검색이 키워드, 태그 또는 설명과 같은 메타데이터가 아닌 색상, 모양, 질감 또는 기타 파생 가능한 정보와 같은 이미지 자체의 내용을 분석한다는 점이다. 이러한 접근 방식은 인간의 주석 품질과 완전성에 의존하는 전통적인 개념 기반 방법과 직접적으로 대립하며, 이러한 의존성은 매우 크거나 자동으로 생성된 이미지 컬렉션의 경우 문제가 된다.
CBIR 시스템은 통계학, 패턴 인식, 신호 처리 및 Computer vision과 같은 분야의 계산 방법을 사용한다. 이 분야는 1990년대 초 시작된 이후 디지털 이미지 저장소의 성장과 대규모 수동 주석의 비현실성에 힘입어 크게 발전했다. 초기 시스템은 기본적인 시각적 특징 추출에 의존했지만, 현대 구현은 점점 더 Machine learning 및 Deep learning 기법을 활용하여 검색 정확도를 향상시키고 더 복잡한 질의를 처리한다.
역사적 발전
"콘텐츠 기반 이미지 검색"이라는 용어는 1992년 일본 전자기술종합연구소의 엔지니어인 토시카즈 카토가 색상과 모양을 기반으로 데이터베이스에서 이미지를 자동으로 검색하는 실험을 설명하면서 처음 사용했다. 이는 텍스트 설명에만 의존하던 이전 접근 방식에서의 전환을 의미했다. 최초의 상업용 CBIR 시스템은 IBM에서 개발했으며 QBIC(Query By Image Content)이라고 불렸다. 단일 엔티티의 일부로 여러 이미지를 저장하는 것은 BLOB(Binary Large OBject)이라는 용어보다 앞섰지만, 설명이 아닌 콘텐츠만으로 완전히 검색하는 기능은 IBM의 QBIC 시스템을 기다려야 했다. 이후 개발에는 기존 방법에 대한 간단하고 매력적인 대안을 제공하는 네트워크 및 그래프 기반 접근 방식이 포함되었다.
메타데이터 기반 검색과의 비교
전통적인 이미지 검색은 인간이 데이터베이스의 이미지에 키워드나 메타데이터를 수동으로 주석 처리해야 하며, 이는 시간이 많이 걸리는 과정으로 이미지를 효과적으로 설명하는 데 필요한 기준을 포착하지 못할 수 있다. 키워드 기반 검색의 효과 평가는 주관적이며 잘 정의되지 않았고, CBIR 시스템도 성공을 정의하는 데 유사한 어려움에 직면한다. 키워드는 또한 질의 범위를 미리 결정된 기준 집합으로 제한하며, 이러한 주석은 실제 이미지 콘텐츠를 분석하는 것보다 신뢰성이 낮다. CBIR은 수동 주석이 비현실적인 감시 카메라에서 생성된 이미지와 같은 매우 큰 데이터베이스나 자동 생성 이미지의 경우 특히 유용하다. 이미지를 의미론적 클래스(예: "동물"의 하위 클래스로 "고양이")로 분류하는 시스템은 오분류 문제를 줄일 수 있지만, 더 넓은 범주에만 속할 수 있는 이미지를 찾는 데 더 많은 사용자 노력이 필요하다.
질의 기법
CBIR 시스템은 다양한 사용자 요구에 맞춰 여러 질의 방법을 지원한다. 가장 일반적인 것은 QBE(Query By Example)로, 사용자가 기존 이미지를 제공하거나, 무작위 집합에서 선택하거나, 색상 블롭이나 일반적인 모양을 사용하여 대략적인 근사치를 그리는 방식으로 예제 이미지를 제공한다. 결과는 제공된 예제와 공통 요소를 공유해야 하며, 이 기법은 이미지를 단어로 설명하는 어려움을 제거한다.
의미론적 검색은 "에이브러햄 링컨의 사진 찾기"와 같은 요청으로 시작되며, 피사체가 항상 같은 포즈나 방향으로 나타나지 않을 수 있기 때문에 컴퓨터에게는 어려운 작업이다. 따라서 많은 CBIR 시스템은 질감, 색상 및 모양과 같은 하위 수준 특징에 의존하며, 기준 입력을 더 쉽게 할 수 있는 인터페이스나 얼굴, 지문 또는 모양과 같은 특정 특징을 일치시키도록 사전 훈련된 데이터베이스와 결합한다. 일반적으로 더 높은 수준의 개념을 검색하려면 인간의 피드백이 필요하다.
다른 질의 방법으로는 예제 이미지 찾아보기, 맞춤형 또는 계층적 범주 탐색, 전체 이미지가 아닌 이미지 영역별 질의, 여러 예제 이미지별 질의, 시각적 스케치별 질의, 이미지 특징의 직접 지정, 터치, 음성 및 기타 입력을 결합한 다중 모드 질의가 있다.
관련성 피드백 및 머신 러닝
CBIR 성공의 중요한 측면은 사용자 의도를 이해하는 것이다. 관련성 피드백을 통해 사용자는 질의에 대해 이미지를 "관련", "비관련" 또는 "중립"으로 표시하여 검색 결과를 점진적으로 개선할 수 있으며, 시스템은 이 새로운 정보를 통합하여 검색을 반복한다. 이러한 대화형 접근 방식은 다른 인간 중심 설계 요소와 함께 CBIR 개발의 핵심 초점이 되었다. 이 분야는 또한 검색 성능을 향상시키기 위해 Machine learning 및 반복 기법의 사용이 증가하고 있다. 초기 CBIR 시스템은 색상, 질감 및 모양 속성을 기반으로 데이터베이스를 검색했다. 이러한 시스템이 개발된 후 사용자 친화적인 인터페이스의 필요성이 분명해졌고, 설명적 의미론을 지원하는 질의 방법, 사용자 피드백 및 사용자 만족 수준을 이해할 수 있는 시스템을 포함한 노력으로 이어졌다.
기술적 진보와 과제
CBIR에 대한 관심은 메타데이터 기반 시스템의 한계와 효율적인 이미지 검색의 광범위한 잠재적 응용 분야로 인해 증가했다. 텍스트 정보는 기존 기술로 쉽게 검색할 수 있지만, 매우 크거나 자동으로 생성된 컬렉션의 경우 모든 이미지를 수동으로 설명하는 것은 비현실적이며, 다른 동의어를 사용하는 설명은 이미지를 놓칠 수 있다. 이미지를 분류하기 위한 다양한 표준이 개발되었지만 모두 확장성 및 오분류 문제에 직면한다. 많은 CBIR 시스템이 개발되었지만 2006년 현재 픽셀 콘텐츠를 기반으로 이미지를 검색하는 문제는 여전히 대체로 해결되지 않았다. 두 이미지(일반적으로 예제 이미지와 데이터베이스의 이미지)를 비교하는 가장 일반적인 방법은 추출된 시각적 특징을 기반으로 거리 측정값을 계산하고 그에 따라 결과를 순위를 매기는 것이다. 현대 시스템은 특징 추출 및 의미론적 이해를 개선하기 위해 점점 더 Deep learning 및 Neural network 아키텍처를 통합하고 있지만, 인간 수준의 완전한 의미론적 검색은 여전히 공개 연구 과제로 남아 있다.