Natural Questions Open은 개방형 도메인 질의응답(QA)을 위한 벤치마크 데이터셋이다. 2019년 Google이 Natural Questions(NQ) 데이터셋의 일부로 도입했으며, 이 데이터셋은 Google 검색 엔진에 제출된 실제 익명화된 질의로 구성된다. 'Open' 변형은 단일 위키백과 페이지의 맥락을 제거하고 위키백과와 같은 대규모 말뭉치에서 직접 질문에 답해야 하므로, 검색 증강 QA 시스템의 표준 평가 세트가 되었다.
이 데이터셋은 30만 개 이상의 자연어 질문을 포함하며, 각 질문에는 짧은 답변(텍스트 구간)과 긴 답변(위키백과 문단)이 짝지어져 있다. 공식적으로 Natural Questions - Open으로 알려진 Open 버전은 페이지 수준의 감독을 제거하고 개방형 문서 모음에서 답을 찾는 시스템의 능력을 평가함으로써 원래 과제를 단순화한다. 이러한 구성은 Transformer (architecture) 아키텍처와 대규모 언어 모델에 기반한 모델을 포함한 개방형 도메인 QA 모델을 비교하기 위한 표준 테스트베드가 되었다.
Natural Questions Open의 개발은 인공지능, 특히 머신러닝과 딥러닝의 광범위한 발전과 궤를 같이한다. 이 벤치마크는 BERT와 이후 생성형 AI 모델과 같은 신경망 기반 시스템의 성능을 측정하는 데 사용되었다. 연구자들은 종종 검색 증강 생성을 멀티 헤드 어텐션과 위치 인코딩을 활용하는 모델과 결합하여 검색된 텍스트에 대해 추론한다.
과제 및 평가
개방형 도메인 설정에서 시스템은 각 질문에 대해 일반적으로 짧은 구간 형태의 답변을 반환해야 한다. 평가는 정확히 일치(EM) 및 F1 점수 지표를 사용하며, 예측된 답변을 주석이 달린 답변과 비교하고 구두점과 관사에 대해 정규화한다. 전체 데이터셋에는 개발 및 테스트 분할이 포함되어 있어 견고한 모델 개발과 비교가 가능하다.
시스템은 일반적으로 두 단계 접근 방식을 사용한다. 첫째, 검색기가 위키백과에서 관련 문단을 선택하고, 둘째, 리더(종종 인코더-디코더 또는 시퀀스-투-시퀀스 모델)가 답변을 추출한다. 빔 서치 디코딩과 top-k 샘플링은 답변을 생성하는 일반적인 전략이다.
벤치마크 영향
Natural Questions Open은 SQuAD 및 TriviaQA와 함께 개방형 도메인 QA에서 널리 채택된 벤치마크 중 하나가 되었다. 이는 Transformer (architecture) 기반 검색과 생성을 결합한 REALM(2020) 및 RAG(2020)와 같은 검색 증강 아키텍처의 부상에 기여했다. 2021년에는 Andorra 시스템이 검색기-리더 아키텍처와 미세 조정된 생성형 AI 모델을 결합했다. 이 데이터셋은 또한 Google DeepMind 및 기타 인공지능 연구소에서 질의응답 기능을 발전시키는 데 사용되었다.
개방형 도메인 QA 과제는 긴 답변을 포함한 더 풍부한 주석을 포함하는 원래의 Natural Questions 구성과 밀접하게 관련되어 있다. 개방성은 명시적 검색 없이 답변을 제시해야 할 수 있는 대규모 언어 모델 시스템에 도전 과제가 된다.
최근 발전
2020년대 초반 기준, 대규모 사전 학습 모델 기반 시스템은 테스트 세트에서 50%를 초과하는 EM 점수로 강력한 결과를 달성했다. 예를 들어, 2021년 Google Research의 모델은 테스트 세트에서 54.6%의 EM을 달성했으며, 검색과 생성형 AI를 결합한 접근 방식은 이후 56.4%로 더 높은 수치에 도달했다. 2022년에는 AI 연구소의 공지에서 텍스트 생성을 정렬하기 위해 강화학습과 RLAIF를 적용한 사례가 언급되었다. 그러나 정확한 리더보드 주장은 시간이 지남에 따라 달라질 수 있다.
실제 응용
Natural Questions Open 검색에서 얻은 통찰력은 상용 시스템에 영향을 미쳤다. 예를 들어, 질문 희석의 검색 저하와 밀집 검색의 필요성은 Google Cloud와 Amazon Web Services에서 검색에 사용된다. 유사한 세트는 음성 어시스턴트와 컴퓨터 기반 시스템을 평가하는 데 자주 사용된다. 그럼에도 불구하고 이 데이터셋은 QA 연구의 하위 분야로 계속 남아 있다.