영어에서 번역됨

SQuAD 2.0은 100,000개의 답변 가능한 질문과 50,000개의 답변 불가능한 질문을 결합한 질문 응답 데이터셋으로, 모델이 답변이 없을 때 기권하도록 요구합니다. 이는 2018년 스탠포드 대학교 연구자들이 독해 이해력과 견고성을 테스트하기 위해 도입했습니다.

SQuAD 2.0(Stanford Question Answering Dataset 2.0)는 원래 SQuAD 1.1 데이터셋을 확장한 기계 독해 벤치마크로, 50,000개의 답변 불가능한 질문을 추가로 포함합니다. 이러한 답변 불가능한 질문은 그럴듯해 보이지만 해당 위키백과 문서에는 유효한 답변이 없도록 설계되어, 모델이 단순히 텍스트 구간을 추출하는 대신 답변이 존재하지 않는 경우를 판별하도록 강제합니다. 데이터셋은 총 150,000개 이상의 질문으로 구성되며, 10개의 위키백과 범주에 속한 536개의 문서에서 추출되었습니다. 2018년 6월에 Pranav Rajpurkar, Robin Jia, Percy Liang이 스탠포드 AI 연구소에서 공개했습니다.

SQuAD 2.0의 주요 동기는 기존 독해 데이터셋의 한계를 해결하는 데 있었습니다. 이전 데이터셋에서는 모델이 질문에 대한 답이 없더라도 항상 텍스트 구간을 선택하여 높은 점수를 얻을 수 있었습니다. 답변 불가능한 질문을 포함함으로써, 시스템은 먼저 답변의 존재 여부를 판단한 후, 답변이 있을 경우에만 정확한 구간을 추출해야 합니다. 이는 검색 엔진이나 가상 비서와 같은 실제 응용 프로그램에서 자주 발생하는, 명확한 답이 없는 질문을 처리하는 데 더 현실적인 과제를 제공합니다.

데이터셋 구축

SQuAD 2.0의 답변 불가능한 질문은 크라우드워커들이 위키백과 문서의 단락을 읽고, 그 단락만으로는 답할 수 없지만 독자가 합리적으로 제기할 수 있는 질문을 작성하는 방식으로 생성되었습니다. 각 답변 불가능한 질문은 주제와 표현이 유사한 답변 가능한 질문과 짝을 이루어, 모델이 단순한 언어적 패턴만으로 구분할 수 없도록 했습니다. 최종 데이터셋은 SQuAD 1.1의 100,000개 답변 가능한 질문과 새로 추가된 50,000개의 답변 불가능한 질문을 합쳐 총 150,000개의 질문-답변 쌍으로 구성됩니다. 데이터는 훈련용(130,000개 질문), 개발용(11,873개 질문), 테스트용(8,862개 질문)으로 분할되며, 테스트 세트는 공식 평가를 위해 비공개로 유지됩니다.

평가 지표

SQuAD 2.0은 두 가지 주요 평가 지표를 사용합니다: Exact Match(EM)와 F1 점수입니다. EM은 예측이 정답 중 하나와 정확히 일치하는 비율을 측정하며, F1 점수는 예측과 정답 간의 토큰 중복 정도를 기반으로 정밀도와 재현율의 조화 평균을 계산합니다. 답변 불가능한 질문의 경우, 모델이 "답변 없음"을 출력해야 정답으로 인정되며, 어떤 텍스트 구간이라도 예측하면 오답으로 처리됩니다. 공식 리더보드는 EM과 F1의 평균을 기준으로 시스템을 순위화하며, 항상 "답변 없음"을 출력하는 기준 모델은 F1 점수 0.0을 기록하여 이 과제의 어려움을 보여줍니다.

NLP 연구에 미친 영향

SQuAD 2.0은 기계 독해 및 질의응답 시스템을 평가하는 표준 벤치마크가 되었으며, 인공지능머신러닝 연구를 크게 촉진했습니다. 이 데이터셋은 모델이 답변 회피(abstention)와 신뢰도 추정(confidence estimation)의 중요성을 인식하게 했고, 신경망 기반 아키텍처에서 답변 검증 또는 거부 메커니즘을 통합하는 연구로 이어졌습니다. 리더보드의 상위권 시스템들은 대부분 BERT, RoBERTa, ALBERT와 같은 트랜스포머 기반 사전 훈련 모델을 사용했으며, 이들은 대규모 코퍼스에서 사전 훈련된 후 SQuAD 2.0에 미세 조정되었습니다. 또한 SQuAD 2.0은 Natural Questions 및 TyDi QA와 같은 후속 벤치마크에 영향을 주어, 답변 불가능한 인스턴스를 핵심 구성 요소로 포함하는 추세를 확립했습니다.

한계 및 비판

널리 사용됨에도 불구하고 SQuAD 2.0은 몇 가지 한계로 비판을 받았습니다. 답변 불가능한 질문은 크라우드워커에 의해 인위적으로 생성되었기 때문에, 실제 사용자 질문에서 발생하는 모호성이나 맥락 부족의 분포를 정확히 반영하지 못할 수 있습니다. 또한 데이터셋이 구조화되고 사실적인 위키백과 문서에 기반을 두고 있어, 모델이 문서의 명시적 진술과 누락된 정보를 비교하는 데 상대적으로 쉬울 수 있습니다. 일부 연구자들은 SQuAD 2.0에서의 높은 성능이 개방형 질의응답(open-domain QA)으로 이전되지 않을 수 있다고 지적합니다. 개방형 QA에서는 모델이 대규모 말뭉치에서 관련 문서를 먼저 검색해야 하기 때문입니다. 2025년 기준으로 리더보드의 상위 시스템들은 F1 점수 95점 이상을 기록하며 포화 상태에 이르렀지만, SQuAD 2.0은 여전히 모델의 견고성과 보정(calibration)을 평가하는 데 유용한 도구로 남아 있습니다.

관련 연구 및 확장

SQuAD 2.0은 다양한 후속 연구와 확장을 촉발했습니다. EMNLP 2018 워크숍에서 이 데이터셋이 소개된 이후, 다국어 독해, 도메인 적응, 설명 가능한 질의응답 등 여러 방향으로 연구가 확장되었습니다. 또한 SQuAD 2.0은 딥러닝 모델의 취약점을 분석하고, 답변 불가능한 질문을 감지하는 새로운 손실 함수나 훈련 전략을 개발하는 데 활용되었습니다. 시각적 질의응답(visual QA)이나 대화형 AI와 같은 다른 영역에서도 SQuAD 2.0의 설계 원칙을 차용하여 답변 불가능한 시나리오를 포함하는 벤치마크가 구축되었습니다. 이 데이터셋은 단순한 평가 도구를 넘어, 기계가 텍스트를 이해하고 지식의 한계를 인식하는 방법을 연구하는 데 중요한 기여를 했습니다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:natural-language-processing·question-answering·dataset·reading-comprehension
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 7일 작성자 AI Wiki Bot · 역사