SQuAD v2.0(스탠포드 질문 응답 데이터셋 버전 2.0)은 기계 독해 및 질문 응답을 위한 벤치마크 데이터셋이다. 이는 원래 SQuAD 1.1 데이터셋을 확장하여 상당한 수의 답변 불가능한 질문을 추가하였으며, 모델이 정확한 답변 구간을 추출할 뿐만 아니라 주어진 문맥에서 질문에 답할 수 없는 경우를 인식하도록 요구한다. 이러한 설계는 모델이 텍스트를 실제로 이해하지 않고 답변 구간을 추측하여 높은 점수를 얻을 수 있었던 초기 데이터셋의 주요 한계를 해결한다.
이 데이터셋은 2018년 6월 스탠포드 대학의 Pranav Rajpurkar, Robin Jia, Percy Liang이 이끄는 팀에 의해 소개되었다. 이는 SQuAD 1.1에서 사용된 동일한 위키백과 문서 집합에서 파생된 100,000개의 답변 가능한 질문과 50,000개의 답변 불가능한 질문으로 구성된다. 답변 불가능한 질문은 인간 주석자들이 문서 텍스트에서 실제로 뒷받침되지 않는 그럴듯한 질문을 바꾸어 표현하여 작성하며, 이는 답변 가능한 질문과 구별하기 어렵게 만든다.
동기 및 설계
SQuAD v2.0의 주요 동기는 독해 시스템의 "과신" 문제를 해결하는 것이었다. SQuAD 1.1에서는 모든 질문이 문맥에서 보장된 답변 구간을 가졌기 때문에, 모델은 부정확하더라도 항상 무언가를 추출하도록 훈련될 수 있었다. 이는 벤치마크에서 잘 수행되지만 질문에 답이 없는 경우가 흔한 실제 응용 프로그램에서는 실패하는 시스템을 초래했다. 답변 불가능한 질문을 도입함으로써 SQuAD v2.0은 모델이 구간을 추출하기 전에 답변 가능성을 결정하는 더 강력한 기술을 학습하도록 강제한다.
구축 과정에는 크라우드워커들이 먼저 문단을 기반으로 답변 가능한 질문을 작성한 다음, 종종 엔터티, 숫자 또는 관계를 변경하여 그럴듯하지만 답변 불가능한 추가 질문을 작성하는 것이 포함되었다. 이는 답변 불가능한 질문이 답변 가능한 질문과 의미적으로 유사하도록 보장하여 작업을 진정으로 어렵게 만든다.
평가 지표
SQuAD v2.0은 두 가지 주요 지표인 Exact Match(EM)와 F1 점수를 사용한다. 그러나 SQuAD 1.1과 달리, 점수 계산은 답변 불가능한 질문을 특별히 처리한다. 답변 불가능한 질문의 경우, 모델이 "답변 없음"(빈 구간)을 예측하면 완전한 점수(EM=1, F1=1)를 받는다. 비어 있지 않은 구간을 예측하면 두 지표 모두에서 0점을 받는다. 답변 가능한 질문의 경우 표준 구간 수준의 EM과 F1이 계산된다. 전체 점수는 모든 질문에 대한 평균이며, 답변 가능한 인스턴스와 답변 불가능한 인스턴스에 동일한 가중치를 부여한다.
이 점수 체계는 모델이 보수적이도록 유도한다. 즉, 답변 가능한 질문에 대한 정확성과 답변 불가능한 질문에 잘못 답할 위험 사이의 균형을 맞춰야 한다. 항상 답변을 추측하는 모델은 답변 불가능한 절반에서 거의 0점을 받는 반면, 항상 기권하는 모델은 답변 가능한 절반에서 0점을 받는다.
연구에 미친 영향
SQuAD v2.0은 전작과 함께 자연어 처리 커뮤니티에서 빠르게 표준 벤치마크가 되었다. 이는 답변 가능성 예측을 명시적 구성 요소로 통합하는 더 정교한 모델의 개발을 촉진했다. 트랜스포머 기반과 같은 많은 초기 딥러닝 접근 방식이 이 데이터셋에서 평가되어 빠른 개선을 이끌었다.
이 데이터셋은 자연스럽게 답변 불가능한 질문을 포함하는 Natural Questions 및 TriviaQA와 같은 후속 벤치마크의 설계에도 영향을 미쳤다. 이는 현대 대규모 언어 모델에서 여전히 관련 있는 주제인 질문 응답에서의 교정과 기권의 중요성을 강조했다.
리더보드 및 최신 기술 수준
출시 당시 최고 모델은 EM 점수가 약 60-65%였으며, 추가된 난이도를 반영하여 SQuAD 1.1의 80% 이상 점수보다 크게 낮았다. 시간이 지남에 따라 모델은 상당히 개선되었다. 2019년까지 BERT 및 그 변형을 사용하는 시스템은 EM 점수가 80% 이상에 도달했다. 2023년 현재 공식 리더보드의 상위 항목은 종종 앙상블 방법과 외부 지식을 사용하여 EM 점수가 90% 이상을 달성한다.
이러한 높은 점수에도 불구하고, 연구자들은 SQuAD v2.0이 여전히 위키백과에 의존하고 답변 불가능한 질문이 인위적으로 구성된다는 점과 같은 한계가 있음을 지적한다. 그럼에도 불구하고, 이는 독해 견고성을 평가하기 위한 귀중한 도구로 남아 있다.
관련 작업 및 확장
SQuAD v2.0은 여러 후속 데이터셋과 작업에 영감을 주었다. 예를 들어, squad-shift는 일반화를 테스트하기 위한 분포 변화를 도입했으며, 다른 작업은 적대적 변형을 탐구했다. 답변 가능성 개념은 Google Cloud 및 Amazon Web Services와 같은 회사의 생산 시스템을 포함한 많은 질문 응답 시스템에 통합되었다.
이 데이터셋은 연구 목적으로 자유롭게 사용할 수 있으며, 평가 스크립트와 공개 리더보드와 함께 공식 SQuAD 웹사이트에서 호스팅된다. 이는 기계 독해 분야에서 새로운 아키텍처와 훈련 기법을 비교하기 위한 기준점으로 계속 사용되고 있다.