NoCaps(대규모 신규 객체 캡셔닝)는 이미지 캡셔닝 시스템이 학습 데이터에 없던 객체를 포함한 이미지를 설명하는 능력을 평가하기 위해 설계된 벤치마크 데이터셋이자 평가 프로토콜이다. 2019년 텍사스 오스틴 대학교 연구진 등이 도입했으며, 표준 캡셔닝 벤치마크의 중요한 한계를 해결한다. 즉, 모델이 학습 중에 본 제한된 객체 어휘에 과적합되어 시각적 개념의 긴 꼬리 부분으로 일반화하지 못하는 문제를 다룬다. NoCaps는 Open Images 데이터셋의 이미지와 널리 사용되는 COCO 데이터셋과 중복되지 않는 대규모 객체 범주 집합을 사용하여 이러한 일반화 능력을 측정하는 통제된 환경을 제공한다.
이 벤치마크는 15,000개 이상의 이미지로 구성되며, 각 이미지에는 여러 개의 사람이 작성한 참조 캡션이 쌍으로 제공된다. 이미지는 포함된 신규 객체 수에 따라 세 가지 평가 하위 집합으로 나뉜다. 즉, 도메인 내(신규 객체 없음), 근접 도메인(신규 객체 소수), 개방 도메인(신규 객체 다수)이다. 이러한 계층적 구조는 연구자들이 시각적 콘텐츠의 신규성과 복잡성이 증가함에 따라 성능 저하를 분석할 수 있게 한다. 주요 평가 지표는 생성된 캡션과 참조 캡션 간의 일치도를 측정하는 표준 캡셔닝 지표인 CIDEr이지만, BLEU, METEOR, SPICE와 같은 다른 지표도 함께 보고된다.
동기 및 과제
COCO와 같은 전통적인 캡셔닝 데이터셋은 80개의 객체 범주만 포함하며, 이는 시각적 세계의 극히 일부에 불과하다. 이러한 데이터셋으로 학습된 모델은 빈번한 객체 동시 발생을 암기하는 경향이 있으며, 익숙하지 않은 조합이나 완전히 새로운 객체를 만나면 실패한다. NoCaps는 더 견고하고 일반화 가능한 캡셔닝 시스템으로 분야를 발전시키기 위해 만들어졌다. 핵심 과제는 모델이 신규 객체를 인식할 뿐만 아니라(시각적 인식 문제), 학습 중에 해당 시각적 입력과 짝지어 본 적 없는 단어를 사용하여 유창하고 맥락에 맞는 언어로 이를 설명해야 한다는 점이다.
구축 및 주석
NoCaps의 이미지는 수백만 개의 다양한 객체 주석이 포함된 Open Images 데이터셋에서 가져온다. 제작자는 이미지 하위 집합을 선택하고 세 가지 난이도 계층 간 균형 잡힌 분포를 보장하도록 필터링했다. Open Images의 500개 객체 범주 어휘를 사용했으며, 그중 200개는 COCO의 80개 범주에 비해 신규로 간주된다. Amazon Mechanical Turk의 인간 주석자는 자연스럽고 서술적인 문장을 장려하는 지침에 따라 이미지당 5개의 참조 캡션을 작성했다. 주석 과정에는 캡션의 정확성과 다양성을 보장하기 위한 품질 관리 조치가 포함되었다.
평가 프로토콜
NoCaps에서 모델을 평가하려면 시스템이 테스트 세트의 각 이미지에 대한 캡션을 생성한다. 생성된 캡션은 CIDEr를 사용하여 인간 참조와 비교되며, CIDEr는 후보 및 참조 n-gram 벡터 간의 평균 코사인 유사도를 계산하고 용어 빈도-역문서 빈도로 가중치를 부여한다. 벤치마크는 개발을 위한 공개 검증 세트와 최종 평가를 위한 숨겨진 테스트 세트를 제공하며, 결과는 공식 리더보드에 보고된다. 이러한 설정은 고전적인 Sequence-to-Sequence (Seq2Seq) 모델부터 현대적인 Transformer (architecture) 기반 아키텍처까지 다양한 접근 방식 간의 공정한 비교를 장려한다.
영향 및 사용
NoCaps는 특히 이미지 캡셔닝 모델의 일반화 능력을 평가하는 데 있어 Machine learning 및 computer vision 커뮤니티에서 표준 벤치마크가 되었다. 이는 Data Augmentation, Curriculum Learning, 그리고 Large language model과 같은 외부 지식 소스 통합과 같은 기술의 효과를 입증하는 데 사용되었다. 예를 들어, 일부 접근 방식은 사전 학습된 객체 감지기를 사용하여 신규 객체를 식별한 다음 감지된 레이블에 언어 모델을 조건화하는 반면, 다른 접근 방식은 Cross-Attention 메커니즘을 사용하여 시각적 및 텍스트 특징을 더 효과적으로 정렬한다. 이 벤치마크는 또한 학습 데이터와 모델 용량의 확장 중요성을 강조했는데, 대규모 데이터셋으로 학습된 더 큰 Neural network은 개방 도메인 하위 집합에서 더 나은 성능을 보이는 경향이 있기 때문이다.
한계 및 비판
영향력에도 불구하고 NoCaps에는 몇 가지 한계가 있다. 벤치마크는 고정된 신규 객체 집합에 의존하며, 이는 실제 세계 신규성의 개방형 특성을 완전히 포착하지 못할 수 있다. 평가 지표인 CIDEr는 스타일과 길이에 민감한 것으로 알려져 있으며 의미적 정확성을 완전히 반영하지 못할 수 있다. 또한 인간 참조는 품질이 높지만 수가 제한되어 있어 이미지를 설명하는 모든 유효한 방식을 포함하지 못할 수 있다. 일부 연구자들은 벤치마크의 객체 수준 신규성에 대한 초점이 신규 관계나 속성과 같은 일반화의 다른 측면을 가린다고 주장한다. 그럼에도 불구하고 NoCaps는 견고한 이미지 캡셔닝의 진전을 추적하는 데 유용한 도구로 남아 있다.
향후 방향
분야가 더 유능한 Generative AI 시스템으로 이동함에 따라 NoCaps는 구성적 일반화, 제로샷 학습, 사용자 지시와의 상호작용을 테스트하는 벤치마크로 확장되거나 보완될 가능성이 높다. 디코더로서의 Large language model 통합은 종종 비전-언어 모델과 결합되어 광범위한 세계 지식을 활용함으로써 신규 객체를 처리하는 데 이미 유망함을 보여주었다. 향후 작업은 모델의 학습 데이터에 적응하여 신규성이 항상 진정으로 새로운 것을 보장하는 동적 벤치마크를 탐구할 수도 있다. NoCaps는 일반화의 엄격한 평가를 위한 선례를 세웠으며, 그 원칙은 멀티모달 AI의 향후 벤치마크 설계에 영향을 미칠 가능성이 높다.