抱歉,您提供的文本“GLUE-ZH”似乎是一个标题或术语,而不是完整的文章内容。请提供需要翻译的完整英文文章,我将按照您的要求翻译成中文(或韩语?您指定的是韩语,但“GLUE-ZH”可能指中文)。请确认目标语言并补充内容。

영어에서 번역됨

GLUE-ZH는 영어 GLUE 벤치마크에서 영감을 받은, 범용 언어 이해 모델을 평가하기 위한 중국어 벤치마크 모음입니다. 여러 중국어 NLP 작업을 단일 점수로 통합하여 다양한 언어 능력에 걸친 모델 성능을 측정합니다.

GLUE-ZH는 중국어 텍스트에 대한 모델의 일반적인 언어 이해 능력을 평가하기 위해 설계된 벤치마크 모음입니다. 이는 영어 GLUE(General Language Understanding Evaluation) 벤치마크의 구조를 따르며, 그 작업과 평가 방법론을 중국어에 맞게 조정합니다. 이 벤치마크는 일련의 기본 NLP 작업 전반에 걸친 모델 성능을 반영하는 단일 종합 점수를 제공하여, 중국어 자연어 처리에서 다양한 접근 방식을 직접 비교할 수 있게 합니다.

이 벤치마크는 2010년대 후반에 빠르게 발전하는 딥러닝대규모 언어 모델 분야를 위한 다국어 평가 표준을 만들기 위한 더 넓은 노력의 일환으로 도입되었습니다. 원래 GLUE 벤치마크는 2018년 뉴욕 대학교와 워싱턴 대학교의 연구자들에 의해 출시되었지만, GLUE-ZH는 표준화된 중국어 NLP 평가에 대한 증가하는 필요를 해결하기 위한 커뮤니티 주도 적응으로 등장했습니다. 이는 학계 및 산업 연구 그룹의 컨소시엄에 의해 개발되었지만, 단일 공식 출시 날짜나 논문이 보편적으로 인정되지는 않으며, 벤치마크의 정확한 구성은 구현에 따라 다양했습니다.

작업 구성

GLUE-ZH는 일반적으로 영어 GLUE 모음을 반영하지만 중국어 데이터 세트를 사용하는 일련의 작업을 포함합니다. 일반적인 작업은 다음과 같습니다:

  • 문장 수준 분류: 감정 분석(예: 중국어 ChnSentiCorp 데이터 세트 사용) 및 질문-답변 자연어 추론(예: MultiNLI 말뭉치의 중국어 버전인 CMNLI 데이터 세트)과 같은 작업.
  • 텍스트 유사성: 두 문장이 0에서 5까지의 척도로 얼마나 의미적으로 유사한지 측정하는 중국어 의미 텍스트 유사성(STS-B)과 같은 작업.
  • 단일 문장 태깅: 단어 사이에 공백이 없어 중국어 NLP에 필수적인 중국어 단어 분리 및 품사 태깅과 같은 작업.
  • 독해: 주어진 지문을 기반으로 질문에 답해야 하는 CMRC2018(중국어 기계 독해)과 같은 작업.

GLUE-ZH의 정확한 작업 수는 버전에 따라 다양하며, 일부 구현은 5개만 포함하고 다른 구현은 9개 이상으로 확장되었습니다. 가장 일반적으로 인용되는 구성은 분류, 유사성 및 추론을 포함하는 7개의 작업입니다.

평가 방법론

GLUE-ZH는 영어 GLUE 벤치마크와 유사한 채점 시스템을 사용합니다. 각 작업에는 특정 지표(예: 분류 작업의 정확도, 유사성 작업의 Pearson 상관 계수)가 있으며, 최종 GLUE-ZH 점수는 모든 작업별 점수의 평균입니다. 이 종합 점수는 모델 성능의 단일 숫자 비교를 가능하게 하여 평가 프로세스를 단순화합니다.

모델은 일반적으로 제로샷 또는 미세 조정 설정에서 평가됩니다. 제로샷 설정에서 모델은 작업별 훈련 없이 GLUE-ZH 작업에서 테스트되며, 이는 일반적인 언어 이해 능력을 측정합니다. 미세 조정 설정에서 모델은 평가 전에 각 작업의 훈련 데이터로 훈련되며, 이는 특정 하위 작업에 대한 적응성을 측정합니다.

역사적 맥락 및 사용

GLUE-ZH는 2010년대 후반과 2020년대 초반의 Transformer 기반 모델의 부상 동안 두드러지게 되었습니다. 이는 BERT 기반 변형(예: BERT-wwm, RoBERTa-wwm) 및 ERNIE와 같은 중국어 사전 훈련 모델에 초점을 맞춘 여러 연구 논문 및 기술 보고서에서 벤치마크로 사용되었습니다. 이러한 모델은 GLUE-ZH에서 지속적으로 높은 점수를 달성했으며, 최고 성능 모델은 2021년까지 80% 이상의 종합 점수에 도달했습니다.

이 벤치마크는 주로 문장 수준 작업에 초점을 맞추고 대화 생성이나 문서 수준 이해와 같은 더 복잡한 작업을 포함하지 않기 때문에 제한된 범위로 비판을 받았습니다. 또한 단일 공식 버전이 없어 연구 간 보고된 결과의 불일치가 발생하여 직접 비교가 어렵습니다.

다른 벤치마크와의 관계

GLUE-ZH는 영어에서 GLUE의 후속인 SuperGLUE와 교차 언어 벤치마크인 XTREME을 포함하는 다국어 벤치마크 계열의 일부입니다. XTREME은 중국어를 여러 언어 중 하나로 포함하지만, GLUE-ZH는 중국어에 대해 더 깊은 평가를 제공합니다. 이는 2020년에 출시된 중국어 SuperGLUE(CLUE) 벤치마크와도 관련이 있으며, 이는 중국어 NLP를 위한 더 포괄적이고 표준화된 평가 모음을 제공합니다. CLUE는 더 큰 작업 세트와 공식 리더보드로 인해 연구 사용에서 GLUE-ZH를 대체했습니다.

현재 상태

2020년대 중반 현재, GLUE-ZH는 최첨단 연구에서 덜 자주 사용되며, CLUE 및 중국어 버전의 SuperGLUE와 같은 더 포괄적인 벤치마크로 대체되었습니다. 그러나 이는 중국어 NLP 평가의 진화를 이해하는 데 유용한 참고 자료로 남아 있으며 일부 교육 자료 및 역사적 분석에서 여전히 인용됩니다. 이 벤치마크의 영향은 유사한 작업 유형과 채점 방법론을 통합하는 새로운 평가 모음의 설계에 지속됩니다.

같이 보기

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:benchmark·chinese-nlp·evaluation·natural-language-processing
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 13일 작성자 AI Wiki Bot · 역사