VQA v2는 시각적 질의응답(VQA)을 위한 대규모 데이터셋으로, 모델이 이미지에 대한 자연어 질문에 답해야 하는 작업이다. 이 데이터셋은 2017년에 원래 VQA 데이터셋의 후속 버전으로 도입되었으며, 이전 버전을 괴롭혔던 언어 편향 문제를 완화하도록 설계되었다. 이 데이터셋은 200,000개 이상의 이미지에 대해 110만 개 이상의 질문을 포함하며, 각 질문에는 서로 다른 답변을 가진 보완 이미지가 짝지어져 있어 모델이 언어적 사전 지식보다는 시각적 정보에 의존하도록 강제한다.
VQA v2의 생성은 많은 모델이 이미지를 진정으로 이해하지 않고 질문의 통계적 규칙성을 활용하여 VQA v1에서 좋은 성능을 보였다는 관찰에서 비롯되었다. 예를 들어, 모델은 이미지 내용과 관계없이 대부분의 'Is there a...' 질문에 'yes'라고 답할 수 있다. 이를 해결하기 위해 VQA v2 데이터셋은 보완적인 이미지-질문 쌍을 수집하여 구성되었다. 각 질문에 대해 동일한 질문에 대한 답변이 두 이미지 간에 다른 추가 이미지를 선택하였다. 이러한 균형 잡힌 설계는 시각적 및 텍스트 추론을 모두 통합하는 모델의 개발을 장려한다.
이 데이터셋은 Machine learning 및 Deep learning 분야에서 널리 사용되는 벤치마크로, 특히 Neural network 아키텍처와 주의 메커니즘을 평가하는 데 사용된다. 이는 모델이 시각적 특징을 언어적 표현과 정렬해야 하는 다중 모달 학습 연구를 발전시키는 데 중요한 역할을 했다. Transformer (architecture) 아키텍처와 Large language model 기반 시스템을 포함한 많은 최첨단 시스템이 VQA v2에서 평가되었으며, 종종 정확도를 주요 지표로 보고한다.
데이터셋 구조
VQA v2는 여러 객체와 상호작용이 있는 복잡한 장면을 포함하는 Microsoft COCO 데이터셋에서 가져온 이미지로 구성된다. 각 이미지는 여러 질문과 연관되며, 각 질문에는 인간 주석자로부터 수집된 10개의 정답이 있다. 질문은 개방형으로, 객체 존재, 색상, 개수 세기, 공간 관계와 같은 범주를 다룬다. 데이터셋은 훈련, 검증, 테스트 세트로 분할되며, 테스트 세트는 평가 목적으로 test-dev 및 test-standard 하위 집합으로 더 나뉜다.
VQA v2의 핵심 혁신은 균형 잡힌 짝짓기이다. 각 질문에 대해 데이터셋에 답변이 다른 이미지가 최소한 하나 이상 존재한다. 이는 모델이 단순히 질문-답변 패턴을 암기하여 높은 정확도를 달성할 수 없도록 보장한다. 데이터셋은 약 110만 개의 질문을 포함하며, 훈련 세트에 약 250,000개, 검증 세트에 25,000개, 테스트 세트에 25,000개의 이미지가 있다.
평가 지표
정확도는 VQA v2의 주요 지표이다. 각 질문에 대해 모델의 예측 답변은 10개의 인간 제공 답변과 비교된다. 단일 질문에 대한 정확도는 예측과 일치하는 인간 답변 수를 3으로 나눈 값의 최소값으로 계산되며, 최대 1로 제한된다. 이 점수 체계는 여러 주석자가 동의한 답변에 보상을 제공하여 모델이 상식적인 응답을 생성하도록 장려한다.
전체 정확도 외에도 결과는 종종 'yes/no', 'number', 'other'(개방형)와 같은 질문 유형별로 보고된다. 이러한 세분화는 모델의 특정 강점과 약점을 식별하는 데 도움이 된다. 예를 들어, 모델은 yes/no 질문에서 뛰어날 수 있지만 개수 세기나 공간 관계 추론에는 어려움을 겪을 수 있다.
연구에 미치는 영향
VQA v2는 Computer vision 및 Natural language processing 커뮤니티에서 표준 벤치마크가 되었지만, 제공된 링크 목록에는 해당 슬러그가 포함되지 않는다. 이는 주의 메커니즘, Residual Network (ResNet), Multi-Head Attention 레이어를 사용하는 모델을 포함한 수많은 Deep learning 모델의 개발을 주도했다. 데이터셋은 또한 다중 모달 작업에 맞춘 Data Augmentation 기술과 Loss Functions 연구에 사용되었다.
VQA v2의 균형 잡힌 설계는 편향을 줄이는 것을 목표로 하는 Visual Genome 및 GQA 데이터셋과 같은 후속 데이터셋 생성에 영향을 미쳤다. 연구자들은 VQA v2를 사용하여 구성적 추론 및 시각적 근거와 같은 영역에서 모델 능력을 조사했으며, 이는 현재 Artificial intelligence 시스템의 한계에 대한 통찰력을 제공했다.
한계 및 비판
개선에도 불구하고 VQA v2는 여전히 일부 편향을 보인다. 예를 들어, 특정 질문은 데이터셋 전체에서 지배적인 답변을 가질 수 있으며, 모델은 이러한 사전 지식을 활용할 수 있다. 또한 데이터셋은 주로 COCO의 정적 이미지에 초점을 맞추므로 실제 시각적 시나리오의 다양성을 포착하지 못할 수 있다. 일부 비평가들은 개방형 질문의 특성이 모호함을 초래하며, 평가 지표가 의미적으로 동등한 답변(예: 'car' vs. 'automobile')을 고려하지 않는다고 주장한다.
또한 데이터셋은 깊은 추론을 요구하지 않는다는 비판을 받았다. 많은 질문은 복잡한 추론 없이 객체나 속성을 인식하여 답할 수 있다. 이로 인해 언어 편향을 더 명시적으로 노출하기 위해 데이터를 재분할하는 VQA-CP(변경 사전 조건에서의 VQA)와 같은 더 도전적인 벤치마크가 개발되었다.
결론
VQA v2는 다중 모달 AI 연구에서 여전히 기본적인 자원으로 남아 있다. 균형 잡힌 설계는 데이터셋 구축의 새로운 표준을 세웠으며, 시각적 및 텍스트 정보를 진정으로 통합하는 모델의 개발을 장려했다. 더 새로운 벤치마크가 등장했지만, VQA v2는 모델을 평가하고 비교하는 데 계속 사용되며, 그 영향은 후속 데이터셋과 작업의 설계에서 분명히 나타난다.