MMQA(멀티모달 질의응답)는 텍스트, 이미지, 표, 비디오를 포함한 여러 유형의 데이터에 걸쳐 추론을 요구하는 질문에 답하는 인공지능 시스템의 능력을 평가하기 위해 설계된 벤치마크 데이터셋이다. 2019년 Facebook AI Research(현재 Meta AI의 일부)의 연구자들이 도입한 이 데이터셋은 텍스트 전용 또는 이미지 전용 입력과 같은 단일 양식에 초점을 맞춘 초기 질의응답 벤치마크의 한계를 해결한다. MMQA는 서로 다른 출처의 정보 통합을 필요로 하는 다양한 질문과 해당 답변을 제공하며, 머신러닝 및 딥러닝 모델의 경계를 더 인간다운 이해 수준으로 확장한다.
이 데이터셋은 정보가 다양한 형식에 분산되어 있는 실제 세계의 질문을 처리할 수 있는 모델 개발을 지원하기 위해 만들어졌다. 단일 진실 출처를 가정하는 기존 데이터셋과 달리, MMQA는 시스템이 여러 양식의 증거를 동시에 찾아 결합하고 추론해야 한다. 이는 특히 자연어 처리 및 멀티모달 이해에서 지배적인 접근 방식이 된 트랜스포머 모델을 기반으로 하는 신경망 아키텍처에 도전적인 테스트베드를 제공한다.
구성 및 구조
MMQA는 각각 텍스트, 이미지, 표, 그리고 일부 경우 비디오를 포함하는 일련의 Wikipedia 문서를 보여준 크라우드워커로부터 질문을 수집하여 구성되었다. 작업자들은 최소 두 가지 다른 양식의 정보를 결합해야만 답할 수 있는 질문을 생성하도록 요청받았다. 예를 들어, 통계 표를 읽고 이미지를 보아 관계를 추론하거나, 비디오 클립을 시청하고 텍스트 구절을 읽어 사실적 질문에 답해야 하는 질문이 있을 수 있다.
최종 데이터셋은 12,000개 이상의 질문-답변 쌍으로 구성되며, 각 질문은 특정 Wikipedia 페이지에 연결된다. 답변은 일반적으로 몇 단어로 된 짧은 텍스트 구간으로, 원본 콘텐츠에서 추출된다. 데이터셋은 훈련, 검증, 테스트 세트로 분할되며, 테스트 세트는 공식 평가에 사용된다. 질문은 복잡하게 설계되어 종종 다단계 추론을 요구하므로, SQuAD나 VQA와 같은 단일 양식 벤치마크보다 훨씬 어렵다.
평가 및 지표
모델은 MMQA에서 표준 질의응답 지표, 주로 정확한 일치(EM)와 F1 점수를 사용하여 평가된다. EM은 모델의 예측 답변이 정답과 정확히 일치하는 질문의 비율을 측정하고, F1은 예측과 정답 간의 토큰 중복을 계산하여 부분 점수를 허용한다. 답변이 짧은 구간이므로 이러한 지표는 정확도의 간단한 측정을 제공한다.
MMQA에서 성공하려면 모델은 각 양식을 개별적으로 이해할 뿐만 아니라 양식 간의 정렬과 융합을 학습해야 한다. 이를 위해 이미지, 표, 비디오를 공통 표현 공간으로 인코딩할 수 있는 정교한 아키텍처가 필요하며, 종종 사전 훈련된 비전 및 언어 모델을 사용한다. 특징의 단순 연결과 같은 초기 기준선은 성능이 낮아, 더 고급 멀티모달 융합 기술의 필요성을 강조했다.
영향 및 관련 연구
MMQA는 이후 멀티모달 이해 연구에 영향을 미쳤으며 많은 연구에서 벤치마크로 사용되었다. 이는 Visual Question Answering(VQA) 및 TextVQA와 같은 다른 멀티모달 데이터셋과 함께 자주 인용되지만, 다른 벤치마크에서는 덜 일반적인 표와 비디오를 포함한다는 점에서 두드러진다. 이 데이터셋은 텍스트와 이미지에 걸쳐 공동 추론할 수 있는 모델 개발을 촉진했으며, 이후 확장판은 오디오 및 기타 양식을 통합했다.
MMQA의 출시는 멀티모달 작업에서 놀라운 능력을 보여준 대규모 언어 모델 및 생성형 AI 시스템의 부상과 시기를 같이했다. 그러나 2024년 기준 최첨단 모델조차도 특히 표나 비디오에 대한 세밀한 추론을 요구하는 질문에서 MMQA를 여전히 어려워한다. 이로 인해 MMQA는 실제 세계 시나리오에서 인공지능 시스템의 견고성을 평가하는 귀중한 스트레스 테스트가 되었다.
한계 및 향후 방향
MMQA의 한계 중 하나는 주로 영어로 되어 있고 서구 중심적 편향이 있는 Wikipedia 문서에 의존한다는 점이다. 이는 데이터셋에 표현된 문화적 및 언어적 맥락의 다양성을 제한한다. 또한 답변이 짧은 구간으로 제한되어 더 긴 설명이 필요한 일부 질문의 전체 복잡성을 포착하지 못할 수 있다.
이 분야의 향후 작업은 MMQA를 더 많은 언어, 더 다양한 출처, 더 긴 형식의 답변으로 확장하는 것을 포함할 수 있다. 연구자들은 또한 모델이 답변 뒤의 추론 과정을 설명할 수 있도록 더 해석 가능하게 만드는 방법을 탐구하고 있다. 멀티모달 AI가 계속 진화함에 따라 MMQA와 같은 데이터셋은 진행 상황을 측정하고 모델이 인간 수준의 이해에 여전히 부족한 영역을 식별하는 데 필수적으로 남을 것이다.