GLUE-ZH é um conjunto de benchmarks projetado para avaliar as capacidades de compreensão de linguagem de propósito geral de modelos em texto chinês. Ele segue a estrutura do benchmark GLUE (General Language Understanding Evaluation) em inglês, adaptando suas tarefas e metodologia de avaliação para o idioma chinês. O benchmark fornece uma pontuação agregada única que reflete o desempenho de um modelo em uma variedade de tarefas fundamentais de PLN, permitindo a comparação direta de diferentes abordagens no processamento de linguagem natural em chinês.
O benchmark foi introduzido no final da década de 2010 como parte de um esforço mais amplo para criar padrões de avaliação multilíngues para o campo em rápido avanço do aprendizado profundo e dos grandes modelos de linguagem. Enquanto o benchmark GLUE original foi lançado em 2018 por pesquisadores da Universidade de Nova York e da Universidade de Washington, o GLUE-ZH surgiu como uma adaptação conduzida pela comunidade para atender à crescente necessidade de avaliação padronizada de PLN em chinês. Foi desenvolvido por um consórcio de grupos de pesquisa acadêmicos e industriais, embora nenhuma data oficial de lançamento ou artigo único seja universalmente reconhecido, e a composição exata do benchmark tenha variado entre as implementações.
Composição de Tarefas
O GLUE-ZH normalmente inclui um conjunto de tarefas que espelham o conjunto GLUE em inglês, mas usam conjuntos de dados chineses. Tarefas comuns incluem:
- Classificação em nível de sentença: Tarefas como análise de sentimento (por exemplo, usando o conjunto de dados chinês ChnSentiCorp) e inferência de linguagem natural de pergunta-resposta (por exemplo, o conjunto de dados CMNLI, que é uma versão chinesa do corpus MultiNLI).
- Similaridade textual: Tarefas como Similaridade Textual Semântica Chinesa (STS-B), que mede o quão semanticamente semelhantes duas sentenças são em uma escala de 0 a 5.
- Etiquetagem de sentença única: Tarefas como segmentação de palavras chinesas e etiquetagem de classes gramaticais, que são essenciais para o PLN em chinês devido à falta de espaços entre as palavras.
- Compreensão de leitura: Tarefas como CMRC2018 (Compreensão de Leitura Automática em Chinês), que exige que os modelos respondam a perguntas com base em passagens fornecidas.
O número exato de tarefas no GLUE-ZH variou entre as versões, com algumas implementações incluindo apenas cinco tarefas e outras expandindo para nove ou mais. A configuração mais comumente citada inclui sete tarefas, cobrindo classificação, similaridade e inferência.
Metodologia de Avaliação
O GLUE-ZH usa um sistema de pontuação semelhante ao benchmark GLUE em inglês. Cada tarefa tem uma métrica específica (por exemplo, acurácia para tarefas de classificação, correlação de Pearson para tarefas de similaridade), e a pontuação final do GLUE-ZH é a média de todas as pontuações específicas das tarefas. Essa pontuação agregada permite uma comparação de número único do desempenho do modelo, simplificando o processo de avaliação.
Os modelos são tipicamente avaliados em um cenário de zero-shot ou de ajuste fino. No cenário de zero-shot, os modelos são testados nas tarefas do GLUE-ZH sem qualquer treinamento específico da tarefa, o que mede suas capacidades gerais de compreensão de linguagem. No cenário de ajuste fino, os modelos são treinados nos dados de treinamento de cada tarefa antes da avaliação, o que mede sua adaptabilidade a tarefas downstream específicas.
Contexto Histórico e Uso
O GLUE-ZH ganhou destaque durante a ascensão dos modelos baseados em Transformer no final da década de 2010 e início da década de 2020. Foi usado como benchmark em vários artigos de pesquisa e relatórios técnicos, particularmente aqueles focados em modelos pré-treinados chineses, como variantes baseadas em BERT (por exemplo, BERT-wwm, RoBERTa-wwm) e ERNIE. Esses modelos consistentemente alcançaram altas pontuações no GLUE-ZH, com os modelos de melhor desempenho atingindo pontuações agregadas acima de 80% até 2021.
O benchmark foi criticado por seu escopo limitado, pois se concentra principalmente em tarefas em nível de sentença e não inclui tarefas mais complexas, como geração de diálogo ou compreensão em nível de documento. Além disso, a falta de uma versão oficial única levou a inconsistências nos resultados relatados em diferentes estudos, dificultando comparações diretas.
Relação com Outros Benchmarks
O GLUE-ZH faz parte de uma família de benchmarks multilíngues que incluem SuperGLUE (o sucessor do GLUE em inglês) e XTREME (um benchmark multilíngue). Enquanto o XTREME inclui o chinês como um dos muitos idiomas, o GLUE-ZH fornece uma avaliação mais profunda especificamente para o chinês. Ele também está relacionado ao benchmark SuperGLUE Chinês (CLUE), que foi lançado em 2020 e oferece um conjunto de avaliação mais abrangente e padronizado para o PLN em chinês. O CLUE em grande parte substituiu o GLUE-ZH no uso em pesquisa devido ao seu conjunto de tarefas maior e ao leaderboard oficial.
Status Atual
Em meados da década de 2020, o GLUE-ZH é menos frequentemente usado em pesquisa de ponta, tendo sido substituído por benchmarks mais abrangentes, como o CLUE e a versão chinesa do SuperGLUE. No entanto, continua sendo uma referência útil para entender a evolução da avaliação de PLN em chinês e ainda é citado em alguns materiais educacionais e análises históricas. A influência do benchmark persiste no design de conjuntos de avaliação mais novos, que frequentemente incorporam tipos de tarefas e metodologias de pontuação semelhantes.