AG News는 뉴스 기사 분류를 위해 널리 사용되는 벤치마크 데이터셋이다. 이 데이터셋은 120,000개 이상의 영어 뉴스 헤드라인과 짧은 설명을 포함하며, 각 항목은 세계, 스포츠, 비즈니스, 과학/기술 중 하나의 클래스에 할당된다. 이 데이터셋은 학술 검색 엔진인 AG's Corpus가 수집한 더 큰 뉴스 기사 말뭉치에서 파생되었으며, 머신 러닝 및 자연어 처리 분야에서 텍스트 분류 모델을 평가하는 표준 테스트베드가 되었다.
.
이 데이터셋은 단순성과 규모로 유명하며, 텍스트 분류에 대한 딥 러닝 접근법을 탐구하는 연구자와 실무자에게 일반적인 출발점이 된다. 각 샘플은 제목과 설명으로 구성되며, 클래스 레이블이 주제를 나타낸다. 네 개의 클래스는 균형을 이루며, 클래스당 약30,000개의 훈련 예제와 약1,900개의 테스트 예제가 있어 모델 성능의 신뢰할 수 있는 측정을 제공한다
역사와 기원
AG News 데이터셋은 2015년 뉴욕 대학의 Xiang Zhang과 동료들의 연구 프로젝트의 일환으로 도입되었다. 연구자들은2,000개 이상의 뉴스 소스에서 수집된1백만 개 이상의 뉴스 기사 모음인 AG's Corpus에서 기사를 추출했다. 그들은 네 개의 범주 중 하나에 속하는 기사를 선택하고 분류 작업을 위한 균형 잡힌 하위 집합을 구성했다. 이 데이터셋은 DBpedia 및 Yahoo! Answers와 같은 유사한 벤치마크와 함께 출시되었으며, 텍스트 분류 알고리즘에 다양한 도전 과제를 제공하는 것을 목표로 했다
AG News의 생성은 신경망 모델을 훈련하고 평가하기 위한 크고 깨끗하며 공개적으로 이용 가능한 데이터셋의 필요성에 의해 동기 부여되었다. 당시 많은 기존 데이터셋은 작거나 상당한 전처리가 필요했다. AG News는 명확한 레이블이 있는 간단한 분류 작업을 제공하여, 연구자들이 데이터 정리보다는 모델 아키텍처와 훈련 기술에 집중할 수 있게 했다
데이터셋 구조
AG News는 훈련용과 테스트용 두 개의 파일을 포함한다. 훈련 세트는120,000개의 샘플을 포함하고, 테스트 세트는7,600개의 샘플을 포함한다. 각 샘플은 클래스 인덱스(1에서4까지), 제목, 설명의 세 필드가 있는 CSV 줄이다. 클래스 인덱스는 각각 세계, 스포츠, 비즈니스, 과학/기술에 해당한다. 제목은 일반적으로 짧으며 종종10단어 미만이고, 설명은 한두 문장으로 헤드라인에 대한 맥락을 제공한다
이 데이터셋은 구두점을 제거하고 모든 텍스트를 소문자로 변환하도록 전처리되지만, 원본 버전에서는 원래 대소문자와 구두점을 사용할 수 있다. 이 전처리는 토큰화를 단순화하고 모델이 형식보다는 단어 패턴에 집중할 수 있게 한다. 균형 잡힌 클래스 분포는 무작위 추측이25% 정확도를 산출하므로 정확도가 의미 있는 지표가 되도록 보장한다
머신 러닝에서의 응용
AG News는 서포트 벡터 머신 및 로지스틱 회귀와 같은 전통적인 방법부터 현대 트랜스포머 기반 아키텍처에 이르기까지 텍스트 분류 모델을 벤치마킹하는 데 자주 사용된다. 이는 새로운 모델 설계의 온전성 검사 역할을 하며, AG News에서 높은 정확도를 달성하는 것은 모델이 텍스트의 기본적인 의미 및 구문 패턴을 포착할 수 있음을 나타낸다
대규모 언어 모델 시대에 AG News는 미세 조정 및 평가에 자주 사용된다. BERT 및 GPT와 같은 모델은 테스트 세트에서 거의 완벽한 정확도를 달성할 수 있어 텍스트 분류의 성숙도를 보여준다. 그러나 이 데이터셋은 교육 목적과 특히 자원이 제한된 환경에서 다양한 아키텍처의 효율성을 비교하는 데 여전히 가치가 있다
연구자들은 또한 전이 학습, 도메인 적응 및 데이터 증강 기술을 연구하기 위해 AG News를 사용한다. 그 단순성은 통제된 실험을 가능하게 하고, 그 규모는 과도한 계산 비용 없이 훈련을 지원한다. 결과적으로 AG News는 수백 편의 학술 논문에 등장하며 머신 러닝 과정의 필수 요소이다
한계 및 비판
그 인기에도 불구하고 AG News에는 한계가 있다. 네 개의 범주는 광범위하며, 일부 기사는 잘못 레이블되거나 모호할 수 있어 레이블에 노이즈가 발생한다. 이 데이터셋은 또한2000년대 초반의 기사로 비교적 오래되어 현재 뉴스 동향이나 어휘를 반영하지 못할 수 있다. 또한 전처리가 구두점을 제거하고 텍스트를 소문자로 만들어 실제 응용에서 관련될 수 있는 문체 차이를 모호하게 할 수 있다
또 다른 비판은 AG News가 현대 모델에게 너무 쉬워 많은 모델이90% 이상의 정확도를 달성한다는 것이다. 이로 인해 일부 연구자들은 세분화된 범주나 불균형 클래스 분포를 가진 것과 같은 더 도전적인 벤치마크를 추구하게 되었다. 그럼에도 불구하고 AG News는 유용한 기준선이자 텍스트 분류 이해의 출발점으로 남아 있다