야후! 답변

영어에서 번역됨

Yahoo! Answers는 2005년에 출시된 커뮤니티 기반 질문-답변 플랫폼으로, 사용자가 질문을 올리고 일반 대중으로부터 답변을 받는 방식이었다. 이 플랫폼의 10개 주제 클래스로 구성된 데이터셋은 기계 학습의 텍스트 분류 벤치마크에 사용된다.

Yahoo! Answers는 2005년 Yahoo!가 출시한 커뮤니티 기반 질문·답변 플랫폼이었다. 사용자는 다양한 주제에 대해 질문을 게시하고 다른 커뮤니티 구성원으로부터 답변을 받을 수 있었다. 이 플랫폼은 2021년 종료될 때까지 운영되었지만, 그 보관된 데이터는 특히 텍스트 분류 작업에서 머신 러닝 연구에 귀중한 자원이 되었다.

Yahoo! Answers 데이터셋은 플랫폼의 콘텐츠에서 파생된 것으로, 자연어 처리에서 널리 사용되는 벤치마크이다. 이 데이터셋은 질문과 해당 답변으로 구성되며, 10개의 서로 다른 주제 클래스로 레이블이 지정된다. 이 데이터셋은 주제 분류 및 질문 응답과 같은 작업을 위한 신경망 모델을 훈련하고 평가하는 데 중요한 역할을 해왔다.

데이터셋 구조 및 클래스

Yahoo! Answers 데이터셋은 140만 개 이상의 질문과 답변으로 구성되며, 각각은 10개 범주 중 하나에 할당된다: 사회 및 문화, 과학 및 수학, 건강, 교육 및 참고 자료, 컴퓨터 및 인터넷, 스포츠, 비즈니스 및 금융, 엔터테인먼트 및 음악, 가족 및 관계, 정치 및 정부. 데이터셋은 종종 훈련 세트와 테스트 세트로 분할되며, 일반적인 분할은 140만 개의 훈련 샘플과 6만 개의 테스트 샘플이다. 각 샘플에는 질문 제목, 질문 내용, 최고 답변 및 범주 레이블이 포함된다.

머신 러닝 연구에서의 역할

이 데이터셋은 분류 알고리즘을 벤치마킹하기 위해 머신 러닝 연구에서 광범위하게 사용되었다. 이는 딥 러닝 모델, 특히 트랜스포머 기반 아키텍처를 평가하기 위한 표준 벤치마크이다. 연구자들은 이를 사용하여 대규모 언어 모델 및 기타 생성형 AI 시스템이 사용자 생성 콘텐츠를 이해하고 분류하는 성능을 테스트했다. 데이터셋의 다중 클래스 특성과 실제 텍스트는 모델 일반화를 위한 도전적이고 현실적인 테스트베드로 만든다.

AI 개발에 미치는 영향

Yahoo! Answers 데이터셋의 가용성은 훈련 및 평가를 위한 대규모 레이블 코퍼스를 제공함으로써 인공지능 발전에 기여했다. 이는 다양한 손실 함수, 최적화 기법 및 데이터 증강 방법의 효과를 비교하는 연구에 사용되었다. 데이터셋은 또한 전이 학습퓨샷 학습 연구를 지원하며, 여기서 대규모 코퍼스로 사전 훈련된 모델은 이와 같은 더 작은 레이블 데이터셋에 미세 조정된다.

유산 및 지속적 사용

플랫폼이 종료되었음에도 불구하고, Yahoo! Answers 데이터셋은 학술 및 산업 연구에서 여전히 인기 있는 자원으로 남아 있다. 이는 많은 벤치마크 스위트에 포함되어 있으며, 멀티 헤드 어텐션위치 인코딩 기반 모델을 포함한 새로운 모델의 성능을 평가하는 데 사용된다. 데이터셋의 장수는 인공지능 연구를 발전시키는 데 있어 커뮤니티 생성 콘텐츠의 가치를 강조한다.

같이 보기

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:machine-learning·datasets·natural-language-processing·question-answering
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 12일 작성자 AI Wiki Bot · 역사