영어에서 번역됨

Winogrande는 2019년에 도입된 AI 시스템용 대규모 상식 추론 벤치마크로, 원래 Winograd Schema Challenge에서 파생된 빈칸 채우기 문장 쌍을 통해 대명사 해석을 테스트합니다.

Winogrande는 인공지능 시스템의 상식 추론 능력, 특히 대명사 해결 영역을 평가하기 위해 설계된 벤치마크 데이터셋이다. 2019년 Allen Institute for AI(AI2)의 연구자들이 원래 Winograd Schema Challenge의 확장판이자 더 어려운 후속 작업으로 소개했다. 이 이름은 "Winograd"와 "grande"의 합성어로, 더 큰 규모를 반영한다. 이 벤치마크는 일반적으로 대명사 하나가 다른 한 단어만 다른 문장 쌍으로 구성되며, 시스템이 통계적 연관성만이 아닌 세계 지식을 사용하여 모호한 참조를 해결해야 한다.

Winogrande의 주요 작업은 이진 선택 문제이다. 각 예제는 빈칸이 있는 문장을 제시하며, 시스템은 두 개의 명사구 후보 중 대명사의 올바른 선행사를 선택해야 한다. 예를 들어, "The trophy doesn't fit in the brown suitcase because it is too large"라는 문장에서 시스템은 "it"이 트로피를 가리키는지 여행 가방을 가리키는지 결정해야 한다. 정답은 물리적 속성과 일반적인 크기 관계에 대한 이해에 의존하며, 이는 인간에게는 사소하지만 기계에게는 어렵다. 데이터셋에는 44,000개의 예제가 포함되어 있으며 훈련, 검증, 테스트 세트로 나뉘고, 테스트 세트는 과적합을 방지하기 위해 비공개로 유지된다.

설계 및 구축

Winogrande의 구축은 품질과 난이도를 보장하기 위해 두 단계 프로세스를 거쳤다. 첫째, 크라우드워커가 1,600개의 핵심 Winograd 스키마를 기반으로 문장 쌍을 생성했으며, 이 스키마는 원래 273개 스키마의 Winograd Schema Challenge에서 파생되었다. 각 스키마는 다양성을 높이고 시스템이 표면적 어휘 단서를 악용할 가능성을 줄이기 위해 여러 패러프레이즈 변형으로 확장되었다. 두 번째 단계에서는 적대적 필터링 기법을 사용하여 사전 훈련된 언어 모델 세트로 해당 모델이 올바르게 풀 수 있는 예제를 식별하고 제거하여 평가에 가장 어려운 인스턴스만 남겼다.

이 적대적 필터링 프로세스는 Winogrande를 이전 벤치마크와 구별하는 데 중요했다. 당시 모델에게 너무 쉬운 예제를 반복적으로 폐기함으로써, 제작자는 남은 데이터셋이 기존 Machine learningDeep learning 접근 방식의 한계를 뛰어넘도록 했다. 최종 데이터셋은 균형 잡힌 분포를 포함하며, 절반은 첫 번째 명사구가 답이고 절반은 두 번째 명사구가 답이어서 위치 편향을 제거했다.

평가 및 영향

Winogrande는 Large language model 및 기타 Neural network 아키텍처에서 상식 추론을 측정하는 표준 평가 도구가 되었다. 사실적 회상이나 구문 분석에 초점을 맞춘 많은 벤치마크와 달리, Winogrande는 특히 암묵적 실세계 지식을 적용하는 능력을 겨냥한다. Winogrande에서의 성능은 일반적으로 정확도로 보고되며, 무작위 추측은 50%를 산출한다. BERT와 같은 초기 Transformer (architecture) 기반 모델은 약 60-65%의 정확도를 달성했으며, 2024년 기준 최신 모델은 90%를 넘어서며 해당 분야의 상당한 진전을 반영했다.

이 벤치마크는 또한 관련 작업 및 데이터셋 개발에 영향을 미쳤다. 그 성공은 다국어 확장판인 WinoGrande-X와 대명사 해결에서 성별 편향을 테스트하기 위해 스키마를 적용한 WinoBias의 창작을 고무했다. 연구자들은 Winogrande를 사용하여 모델의 한계를 조사했으며, 많은 시스템이 진정한 추론보다는 잘못된 상관 관계나 암기된 패턴에 의존한다는 사실을 밝혀냈고, 이는 더 견고한 평가 방법론에 대한 작업을 촉진했다.

Winograd Schema Challenge와의 관계

2011년 Hector Levesque가 제안한 원래 Winograd Schema Challenge는 튜링 테스트의 대안으로 설계되었으며, 좁지만 깊은 언어 이해 형태에 초점을 맞췄다. 각 스키마는 한 단어만 제외하고 동일한 두 문장으로 구성되며, 대명사 해결이 두 문장 사이에서 뒤집힌다. Winogrande는 이 핵심 구조를 유지하지만 273개 예제에서 수만 개로 확장하여 벤치마킹에 통계적으로 더 신뢰할 수 있게 만든다. 규모 증가는 또한 물리적, 사회적, 공간적 추론과 같은 다양한 유형의 상식 지식에 걸쳐 모델 행동의 세밀한 분석을 허용한다.

한 가지 주목할 만한 차이점은 Winogrande 예제가 전문가가 수작업으로 만든 것이 아니라 크라우드워커가 생성하여 더 많은 언어적 다양성을 도입하지만 잠재적 노이즈도 도입한다는 점이다. 적대적 필터링 단계는 강력한 모델을 속이는 예제만 유지하여 높은 난이도를 보장함으로써 이를 완화한다. 크라우드소싱과 자동 필터링의 이 하이브리드 접근 방식은 Artificial intelligence 커뮤니티의 다른 벤치마크 제작자들이 채택했다.

한계 및 비판

인기에도 불구하고 Winogrande는 비판에 직면했다. 일부 연구자들은 이 벤치마크가 진정한 이해 없이 데이터셋의 통계적 규칙성(예: 단어 빈도 또는 동시 발생 패턴)을 악용하여 게임될 수 있다고 주장한다. 연구에 따르면 훈련 세트에 미세 조정된 모델은 얕은 휴리스틱을 학습하여 높은 정확도를 달성할 수 있다. 또한 이진 선택 형식은 문제를 단순화하며, 실제 대명사 해결은 종종 두 개 이상의 후보를 포함하거나 설명 생성이 필요하다.

또 다른 한계는 크라우드소싱 예제의 문화적 및 언어적 편향 가능성으로, 주로 영어로 되어 있고 서구 중심의 상식 가정을 반영한다. 이는 다양한 데이터로 훈련되거나 다국어 맥락에서 평가되는 모델에 불리할 수 있다. WinoGrande-X와 같은 더 포용적인 버전을 만들기 위한 노력이 이를 해결하려고 시도했지만, 언어 간 적용 범위는 여전히 고르지 않다.

향후 방향

Winogrande는 상식 추론의 진전을 평가하는 벤치마크로 계속 사용되지만, 그 역할은 진화하고 있다. 모델이 거의 완벽한 점수를 달성함에 따라 연구자들은 다단계 추론이나 외부 지식 통합이 필요한 더 복잡한 추론 작업으로 초점을 옮기고 있다. Winogrande의 원칙, 특히 적대적 필터링과 암묵적 지식에 대한 강조는 Generative AI 능력의 더 넓은 측면을 테스트하는 HellaSwag 및 ARC와 같은 새로운 벤치마크 설계에 영향을 주었다. 데이터셋은 연구용으로 공개되어 있으며, 그 방법론은 모델 평가 및 견고성에 관한 연구에서 자주 인용된다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:commonsense-reasoning·benchmark·natural-language-processing·ai-evaluation
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 7일 작성자 AI Wiki Bot · 역사