Flickr30k Entities는 자연어 구문을 이미지의 해당 영역에 연결하는 작업인 구문 접지(phrase grounding)를 위한 데이터셋이다. 이 데이터셋은 Flickr30k 이미지 캡셔닝 데이터셋을 확장하여, 텍스트에서 언급된 개체를 시각적 위치와 연결하는 상세한 주석을 추가함으로써 만들어졌다. 이 데이터셋은 언어와 시각적 콘텐츠 간의 관계를 이해해야 하는 모델을 훈련하고 평가하기 위해 컴퓨터 비전 및 다중 모달 머신 러닝 연구에서 널리 사용된다.
이 데이터셋은 이미지 내 명사구의 시각적 지시 대상을 국소화하는 31,783개의 경계 상자를 포함한다. 또한 단일 이미지에 대한 여러 캡션에서 동일한 개체의 서로 다른 언급을 그룹화하는 244k개의 상호참조 체인(coreference chain)을 제공한다. 이러한 구조를 통해 연구자들은 직접적인 구문-영역 정렬뿐만 아니라 다중 모달 맥락에서의 문장 간 상호참조 해결도 연구할 수 있다. 주석은 일상적인 사물, 사람, 동물의 광범위한 어휘를 포괄하여, 이 데이터셋을 접지된 언어 이해를 위한 현실적인 벤치마크로 만든다.
주석 구조
Flickr30k Entities의 각 이미지는 다섯 개의 독립적인 인간 작성 캡션과 연관된다. 주석자는 이 캡션에서 명사구를 식별하고, 시각적 지시 대상이 존재할 때 각 구문을 이미지의 경계 상자에 연결했다. 동일한 개체가 캡션 내에서 또는 다섯 개의 캡션에 걸쳐 여러 번 언급된 경우, 해당 언급은 상호참조 체인으로 그룹화되었다. 이 설계는 구문 국소화와 개체 수준 추론 모두에서 모델을 평가할 수 있게 하며, 여기서 모델은 여러 텍스트 참조에서 증거를 집계해야 한다.
경계 상자는 참조된 객체를 밀접하게 둘러싸는 축 정렬 사각형이다. 이 데이터셋은 분할 마스크를 제공하지 않으며, 접지 작업에 충분한 대략적인 국소화에 초점을 맞춘다. 상호참조 체인은 개체 상태에 기반한 시각적 질문 응답이나 이미지 검색과 같이 모델이 서로 다른 설명에서 개체를 추적해야 하는 작업에 필수적이다.
구축 및 통계
이 데이터셋은 사진 공유 웹사이트 Flickr에서 수집된 31,783개의 이미지로 구성된 원래 Flickr30k 코퍼스를 기반으로 구축되었다. 이미지는 활동 중인 사람, 동물, 일상적인 사물을 포함한 다양한 장면을 묘사한다. 개체 주석은 품질 관리 조치를 통해 일관성을 보장하는 크라우드소싱 파이프라인으로 생성되었다. 최종 데이터셋에는 244k개의 상호참조 체인과 31,783개의 경계 상자가 포함되며, 이미지당 평균 약 하나의 경계 상자가 있지만 많은 이미지에는 여러 개체가 포함된다.
주목할 만한 특징은 이미지에 시각적으로 존재하지 않는 개체를 지칭하는 구문의 포함이다. 이러한 구문은 그렇게 표시되어 모델이 접지된 참조와 접지되지 않은 참조를 구별하는 법을 학습할 수 있게 한다. 이 측면은 캡션이 프레임 외부의 객체를 언급할 수 있는 실제 응용 프로그램에서 중요하다.
연구에서의 사용
Flickr30k Entities는 구문 접지 및 지시 표현 이해를 위한 표준 벤치마크가 되었다. 모델은 일반적으로 주어진 명사구에 대한 올바른 경계 상자를 예측하는 능력으로 평가된다. 이 데이터셋은 Transformer (architecture) 모델 및 Neural network 접근법을 포함한 다양한 아키텍처를 훈련하고 테스트하는 데 사용되었다. 또한 Large language model 기반 비전-언어 시스템의 평가에서 일반적인 구성 요소로, 미세한 시각적 이해를 측정하는 데 자주 사용된다.
연구자들은 이 데이터셋을 사용하여 명시적인 경계 상자 감독 없이 이미지-캡션 쌍에서 학습하는 약한 감독 접지 방법과 완전 감독 접지 방법을 개발했다. 상호참조 주석은 또한 언어적 상호참조와 시각적 증거를 결합하는 작업인 다중 모달 상호참조 해결에 대한 연구를 가능하게 했다. 이 데이터셋은 Visual Genome 및 referitgame과 같은 다른 리소스를 보완하며, 각각 다른 주석 세분성과 과제를 제공한다.
한계 및 확장
이 데이터셋은 서양의 소비자 중심 사진을 특징으로 하는 경향이 있는 원래 Flickr30k 수집에서 비롯된 편향을 상속받는다. 캡션은 비교적 짧고 현저한 객체를 설명하며, 이는 더 전문화된 영역의 복잡성을 반영하지 못할 수 있다. 경계 상자는 대략적이며 폐색이나 부분 수준의 세부 사항을 포착하지 못한다. 이러한 한계에도 불구하고, 이 데이터셋은 규모와 상호참조 주석의 풍부함 때문에 여전히 가치 있는 리소스로 남아 있다.
여러 확장이 제안되었으며, 추가 속성으로 데이터셋을 보강하거나 다른 작업을 위한 합성 훈련 데이터를 생성하는 데 사용하는 것이 포함된다. 이 데이터셋은 또한 여러 접지 데이터셋을 결합하여 도메인 간 일반화를 테스트하는 더 큰 벤치마크에 통합되었다. 2020년대 초반 현재, 이 데이터셋은 컴퓨터 비전 및 자연어 처리 분야의 수백 편의 논문에서 계속 인용되고 있다.
같이 보기
- phrase-grounding
- Visual Genome
- referitgame
- image-captioning