Visual Question Answering (VQA)는 인공지능과 머신러닝 분야의 연구 영역으로, 컴퓨터 비전과 자연어 처리를 결합한다. 이 작업은 이미지와 그 이미지에 대한 자유 형식의 개방형 질문을 제공하고, 시스템이 자연어로 올바른 답변을 생성해야 한다. VQA는 객체 인식과 장면 이해뿐만 아니라 추론, 상식 지식, 그리고 언어를 시각적 콘텐츠에 근거시키는 능력이 필요하기 때문에 어려운 문제로 간주된다. 이는 특히 딥러닝 아키텍처를 기반으로 하는 다중 모드 AI 시스템의 능력을 평가하는 핵심 벤치마크 역할을 한다.
VQA 작업은 2015년 버지니아 공대, 마이크로소프트, 토론토 대학의 연구자들이 VQA 데이터셋을 공개하면서 공식화되었다. 원래 데이터셋인 VQA v1은 마이크로소프트 COCO 데이터셋과 추상 장면의 20만 개 이상의 이미지를 포함했으며, 76만 개 이상의 질문과 1천만 개의 답변이 짝을 이루었다. 각 이미지에는 세 개의 질문이 있었고, 각 질문에는 인간 주석자가 제공한 10개의 정답이 있었다. 이 데이터셋은 단순한 세기와 색상 인식부터 공간 관계와 활동에 대한 더 복잡한 추론까지 다양한 기술을 요구하도록 설계되었다. 후속 버전인 VQA v2는 2017년에 출시되어 각 질문 유형에 대한 답변을 균형 있게 조정하여 언어 편향을 해결하고, 모델이 사전 확률에만 의존할 수 없도록 보장했다.
아키텍처와 접근 방식
초기 VQA 시스템은 이미지 특징 추출을 위한 합성곱 신경망(CNN)과 질문 인코딩을 위한 순환 신경망(RNN) 또는 장단기 메모리(LSTM) 네트워크의 조합을 사용했다. 이러한 특징은 종종 요소별 곱셈이나 연결을 통해 융합된 후 고정 어휘에서 답변을 예측하는 분류기를 통과했다. 주목할 만한 초기 모델로는 데이터셋 제작자들이 만든 "VQA 기준 모델"이 있었으며, 이는 단어 가방 질문 표현과 VGGNet 이미지 인코더를 사용했다.
트랜스포머 아키텍처의 등장과 함께 VQA 모델은 주의 기반 메커니즘으로 전환되었다. 멀티 헤드 어텐션 메커니즘을 통해 모델은 질문 단어에 따라 관련 이미지 영역에 동적으로 집중할 수 있었다. 인코더-디코더 프레임워크가 표준이 되었으며, 이미지와 질문이 함께 인코딩되고 답변이 자동 회귀 방식으로 생성되었다. 최근에는 대규모 언어 모델 백본을 기반으로 하는 대규모 사전 훈련 모델이 이미지-텍스트 쌍에 대한 교차 모달 사전 훈련을 활용하여 VQA에 미세 조정되고 있다. 이러한 모델은 종종 교차 어텐션 레이어를 사용하여 시각적 토큰과 텍스트 토큰을 정렬한다.
주요 데이터셋과 벤치마크
원래의 VQA v1과 v2 외에도 여러 다른 데이터셋이 작업의 범위를 확장했다. 2016년에 출시된 Visual Genome 데이터셋은 객체, 속성, 관계에 대한 밀집된 주석을 제공하여 더 구성적인 질문 응답을 가능하게 했다. 2019년에 도입된 GQA 데이터셋은 추론과 구성적 질문에 초점을 맞추었으며, 편향을 줄이기 위해 균형 잡힌 분할을 사용했다. 2017년의 CLEVR 데이터셋은 합성 3D 모양을 사용하여 체계적 추론을 테스트했으며, 다단계 추론이 필요했다. 실제 응용을 위해 2018년의 VizWiz 데이터셋은 시각 장애인 사용자로부터 질문을 수집하여 더 실용적이지만 노이즈가 많은 환경을 제시했다. 2019년에 출시된 OK-VQA 데이터셋은 이미지 콘텐츠를 넘어 외부 지식이 필요한 질문을 강조했다.
평가 지표
VQA 모델은 일반적으로 정확도를 사용하여 평가되며, 예측된 답변은 인간의 10개 정답 중 최소 3개와 일치하면 올바른 것으로 간주된다. VQA 정확도로 알려진 이 지표는 개방형 답변의 주관성을 처리하도록 설계되었다. 객관식 변형의 경우 표준 정확도가 사용된다. 최근 벤치마크는 모델의 주의가 관련 이미지 영역과 정렬되는지 여부와 같은 일관성 및 근거 지표도 보고한다. VQA v2 리더보드는 표준 참조 자료였지만, 많은 현대 모델은 일반화를 입증하기 위해 다양한 데이터셋에 대한 결과를 보고한다.
과제와 한계
VQA의 주요 과제는 언어 편향으로, 모델이 이미지를 실제로 이해하기보다는 훈련 데이터의 통계적 규칙성을 활용하는 것이다. 예를 들어, 모델은 객체를 보지 않고도 모든 세기 질문에 "2"라고 답할 수 있다. VQA v2 데이터셋은 각 질문 유형에 균형 잡힌 답변 세트를 보장하여 이를 완화하도록 특별히 설계되었다. 또 다른 과제는 구성적 일반화로, 모델이 보지 못한 방식으로 개념을 결합한 질문에 실패하는 경우다. 외부 지식 통합도 어려운데, 많은 질문이 이미지에 없는 상식 추론이나 사실 정보를 요구하기 때문이다. 마지막으로, 적대적 섭동과 분포 변화에 대한 견고성은 여전히 해결되지 않은 문제로, 모델은 이미지나 질문의 작은 변화에도 쉽게 속을 수 있다.
응용 분야와 향후 방향
VQA는 VizWiz 프로젝트에서 볼 수 있듯이 시각 장애인 사용자가 주변 환경을 이해하도록 돕는 보조 기술에 실용적인 응용 분야가 있다. 또한 인간-로봇 상호작용, 의료 영상(예: X-ray에 대한 질문에 답변), 콘텐츠 기반 이미지 검색에도 사용된다. 향후 방향으로는 신경망 아키텍처를 통해 기호적 구성 요소를 통합하여 추론 능력을 개선하고, 생성형 AI 모델을 통합하여 더 상세하고 개방형 답변을 생성하며, 의미적 동등성을 포착하는 더 나은 평가 지표를 개발하는 것이 포함된다. 2020년대 중반 현재, 최첨단 모델은 종종 웹 규모 데이터에 대한 대규모 사전 훈련을 활용하지만, 세밀한 공간 추론과 희귀 객체 인식에는 여전히 어려움을 겪고 있다.