MultimodalQA는 텍스트와 시각적 양식 모두로 제시된 정보에 대해 추론해야 하는 질문 응답 시스템을 평가하기 위해 설계된 벤치마크 데이터셋이다. 이 데이터셋은 텍스트 전용 또는 이미지 전용 질문 응답에 초점을 맞춘 초기 데이터셋의 한계를 해결하기 위해 도입되었으며, 인공지능 시스템에 더 현실적이고 도전적인 테스트 환경을 제공한다. 이 데이터셋은 이질적 주석(heterogeneous annotations)을 사용하는 것으로 유명한데, 이는 데이터셋의 서로 다른 질문들이 텍스트 구절과 이미지의 정보를 결합하거나, 두 양식을 순차적으로 포함하는 다단계 추론을 수행하는 등 서로 다른 유형의 추론을 요구한다는 것을 의미한다.
MultimodalQA의 주요 목표는 머신러닝과 딥러닝에서의 다중 양식 이해의 경계를 넓히는 것이다. 단일 출처 내에서 답을 찾는 것만 요구할 수 있는 더 단순한 벤치마크와 달리, MultimodalQA는 양식 간 정보 비교, 이미지에서 추출한 데이터에 대한 산술 연산 수행, 또는 텍스트와 시각적 증거를 번갈아 따르는 추론 체인을 따르는 것과 같은 복잡한 추론을 요구하는 질문을 포함한다. 이러한 설계는 시각적 이해와 텍스트 이해를 통합하려는 대규모 언어 모델 및 기타 신경망 아키텍처를 개발하고 평가하는 연구자들에게 귀중한 자원이 되게 한다.
데이터셋 구조 및 구성
MultimodalQA는 Wikipedia 문서에서 파생된 질문과 답변을 포함하는 WebQA 데이터셋을 기반으로 구축되었다. MultimodalQA의 제작자들은 WebQA 데이터의 하위 집합을 선택하고 추가 질문-답변 쌍을 보강하여 더 균형 잡히고 도전적인 벤치마크를 만들었다. 이 데이터셋은 훈련, 검증, 테스트 세트로 분할되며, 테스트 세트는 공개 테스트 세트와 공식 평가에 사용되는 비공개 테스트 세트로 더 나뉜다. 비공개 테스트 세트는 과적합을 방지하고 모델이 보지 못한 데이터에 잘 일반화되도록 하는 데 특히 중요하다.
MultimodalQA의 핵심 특징은 요구되는 추론 유형에 따른 질문 분류이다. 이 데이터셋에는 답이 텍스트 구절과 이미지 모두의 정보를 결합해야 하는 'Text + Image'와 같은 범주와, 잠재적으로 여러 출처를 포함하는 일련의 추론 단계를 요구하는 'Multi-step'과 같은 범주가 포함된다. 다른 범주로는 'Image' 전용 및 'Text' 전용 질문이 있으며, 이는 동일한 프레임워크 내에서 단일 양식 작업에 대한 모델의 성능을 측정하는 대조군 역할을 한다. 이러한 분류를 통해 연구자들은 모델의 특정 강점과 약점을 자세히 분석할 수 있다.
평가 및 지표
MultimodalQA의 주요 평가 지표는 정확도로, 모델이 예측한 답이 정답과 정확히 일치하는 질문의 백분율로 정의된다. 여러 허용 가능한 답이 있는 질문의 경우, 예측이 제공된 답 중 하나와 일치하면 올바른 것으로 간주된다. 이 데이터셋에는 인간 주석자가 질문 샘플에 답변하여 설정된 '인간 성능' 기준선도 포함된다. 이 기준선은 AI 시스템이 이 작업에서 인간 수준의 성능에 얼마나 가까운지 평가하기 위한 참조점을 제공한다.
MultimodalQA를 소개한 원래 논문에서 저자들은 VisualBERT 아키텍처에서 변형된 다중 양식 트랜스포머 기반 모델을 포함한 여러 기준 모델을 평가했다. 시각적 및 텍스트 특징을 결합하기 위해 늦은 융합 접근 방식을 사용한 이 모델은 비공개 테스트 세트에서 약 46%의 정확도를 달성했으며, 이는 약 88%의 인간 성능보다 상당히 낮은 수치였다. 이 큰 격차는 벤치마크의 어려움을 강조하고 AI 시스템에서 더 정교한 추론 능력의 필요성을 강조했다.
중요성 및 영향
MultimodalQA는 다중 양식 AI 연구 분야에서 널리 사용되는 벤치마크가 되었다. 주요 기술 기업 및 학술 기관을 포함한 많은 연구 그룹과 회사에서 모델 성능을 평가하기 위해 채택했다. 이질적 추론에 대한 데이터셋의 강조는 단순한 특징 연결을 넘어서는 새로운 아키텍처와 훈련 기술의 개발을 촉진했다. 예를 들어, 일부 후속 연구는 시각적 및 텍스트 인코더 간에 정보를 동적으로 라우팅할 수 있는 모듈식 신경망의 사용을 탐구했으며, 다른 연구는 추론을 지원하기 위해 외부 지식 베이스의 사용을 조사했다.
이 벤치마크는 인공지능 평가에 대한 더 넓은 논의에도 기여했다. 단일 양식 벤치마크에서의 높은 성능이 다중 양식 작업에서의 성공으로 반드시 이어지지 않는다는 것을 입증함으로써, MultimodalQA는 커뮤니티가 더 포괄적인 평가 스위트를 개발하도록 장려했다. 또한 SuperGLUE 스위트의 다중 양식 버전과 같은 더 큰 벤치마크의 구성 요소로 사용되어 AI 능력 평가를 위한 표준 도구로서의 역할을 더욱 공고히 했다.
한계 및 향후 방향
강점에도 불구하고 MultimodalQA에는 특정 한계가 있다. 이 데이터셋은 주로 영어이며 Wikipedia에서 파생되었으므로 실제 다중 양식 데이터의 다양성을 완전히 포착하지 못할 수 있다. 또한 질문은 도전적이지만 여전히 상대적으로 짧으며 대화형 설정에서 자연스러운 인간 질문의 복잡성을 반영하지 못할 수 있다. 연구자들은 정확히 일치하는 정확도에 대한 데이터셋의 의존성이 취약할 수 있으며, 의미적으로 동등하지만 다르게 표현된 답변을 고려하지 않는다고 지적했다.
다중 양식 질문 응답에 대한 향후 작업은 더 다양한 출처, 더 길고 대화적인 질문, 더 유연한 평가 지표를 가진 데이터셋을 만들어 이러한 한계를 해결할 가능성이 높다. 또한 OpenAI 및 Google DeepMind와 같은 조직에서 개발한 통합 비전 기능을 갖춘 대규모 언어 모델을 사용하여 MultimodalQA와 같은 벤치마크를 해결하는 데 대한 관심이 증가하고 있다. 이러한 모델이 계속 개선됨에 따라 MultimodalQA에서 AI와 인간 성능 간의 격차가 좁혀질 것으로 예상되지만, 이 벤치마크는 수년 동안 다중 양식 추론의 진전을 측정하는 귀중한 도구로 남을 가능성이 높다.