CLIPScore는 인공지능 시스템이 생성한 이미지 캡션의 품질을 평가하기 위한 지표이다. 이는 참조 기반이 없는 지표로, 비교를 위해 사람이 작성한 정답 캡션이 필요하지 않다. 대신 CLIP(대조 언어-이미지 사전 학습)이라는 사전 훈련된 신경망을 사용하여 이미지와 후보 캡션 간의 의미적 정렬을 직접 측정한다.
이 지표는 2021년 코펜하겐 대학교와 덴마크 공과대학교의 연구자들이 Jack Hessel의 주도로 도입했다. 같은 해 자연어 처리 실증 방법론 학회(EMNLP)에서 발표되었다. 핵심 아이디어는 CLIP이 학습한 공동 임베딩 공간을 활용하는 것으로, 이 공간에서는 이미지와 해당 텍스트 설명이 서로 가까운 벡터로 매핑된다. CLIPScore는 이미지의 CLIP 임베딩과 캡션의 CLIP 임베딩 사이의 코사인 유사도를 계산하며, 지나치게 짧은 캡션에 대한 패널티를 선택적으로 적용한다.
계산 및 변형
기본 CLIPScore는 이미지와 캡션의 정규화된 임베딩 사이의 코사인 유사도에 캡션 길이를 고려한 계수를 곱한 값으로 정의된다. 구체적으로 공식은 CLIPScore(I, c) = w * max(cos(I, c), 0)이며, 여기서 w는 캡션의 토큰 수가 특정 기준(일반적으로 10개) 미만일 때 2.5이고 그 외에는 1인 가중치 항이다. 이 패널티는 이미지와 사소하게 일치할 수 있는 지나치게 간결한 캡션을 억제한다.
RefCLIPScore라는 변형은 이미지와 각 참조 캡션 간의 CLIPScore를 평균한 다음, 이를 기본 CLIPScore와 조화 평균으로 결합하여 참조 캡션을 통합한다. 이 변형은 사람이 작성한 참조가 있을 때 사용되지만, CLIPScore의 주요 장점은 참조 없이 작동할 수 있다는 점이다.
기존 지표 대비 장점
BLEU, ROUGE, METEOR, CIDEr와 같은 이미지 캡셔닝의 기존 지표는 생성된 캡션과 참조 캡션 간의 n-그램 중복에 의존한다. 이러한 지표는 참조 기반이며 의미적 유사성을 포착하지 못하는 경우가 많아, 언어적으로 다르지만 의미적으로 동등한 의역에 불이익을 준다. CLIPScore는 대규모 이미지-텍스트 쌍 코퍼스에서 학습된 고차원 의미 공간에서 작동하여 이 문제를 해결한다. 이를 통해 "개가 공을 가지고 놀고 있다"와 "개의 견종이 공을 회수하고 있다"가 공유 단어가 없더라도 동일한 장면을 설명한다는 것을 인식할 수 있다.
실증 연구에 따르면 CLIPScore는 Flickr8k, Flickr30k, MS COCO를 포함한 여러 벤치마크 데이터셋에서 기존 지표보다 캡션 품질에 대한 인간 평가와 더 높은 상관관계를 보인다. 또한 참조 기반이 없는 특성 덕분에 참조 캡션이 없는 새로운 도메인이나 제로샷 캡셔닝 모델의 캡션을 평가하는 데 특히 유용하다.
응용 및 한계
CLIPScore는 이미지 캡셔닝 및 텍스트-이미지 생성을 위한 생성형 AI 모델 평가에 널리 채택되었다. 종종 다른 지표와 함께 사용되어 종합적인 평가를 제공한다. 예를 들어, 텍스트-이미지 모델에서는 생성된 이미지와 텍스트 프롬프트 간의 정렬을 측정하는 데 CLIPScore 변형이 사용되어 연구자가 모델 매개변수를 조정하는 데 도움을 준다.
강점에도 불구하고 CLIPScore는 알려진 한계가 있다. CLIP 모델 체크포인트 선택에 민감하며, 다른 체크포인트는 다른 점수를 생성할 수 있다. 또한 일반적인 객체나 속성을 언급하는 캡션에 편향될 수 있으며, 세부적인 사항이나 구성적 추론을 완전히 포착하지 못할 수 있다. 추가로 문법적 정확성이나 유창성을 직접 측정하지 않으므로 언어 모델 기반 유창성 지표와 함께 사용되는 경우가 많다.
다른 AI 지표와의 관계
CLIPScore는 기계 학습 평가에서 n-그램 기반 지표에서 벗어나 학습된 임베딩 기반 지표로 이동하는 더 넓은 추세의 일부이다. 텍스트 요약 및 번역을 위한 BERTScore와 같은 지표와 개념적으로 유사하며, 이는 대규모 언어 모델 트랜스포머의 임베딩을 사용한다. 그러나 CLIPScore는 시각과 언어를 연결하는 교차 양식으로 작동한다는 점에서 독특하다.
CLIPScore의 개발은 2021년 초 OpenAI의 CLIP 모델 출시로 가능해졌으며, 이 모델 자체는 4억 개의 이미지-텍스트 쌍으로 훈련된 트랜스포머 기반 신경망이다. CLIPScore의 성공은 비디오 캡셔닝 및 시각적 질문 응답과 같은 다른 다중 양식 작업에서 참조 없는 평가에 대한 후속 연구에 영감을 주었다.