GLUE-ZH es un conjunto de pruebas de referencia diseñado para evaluar las capacidades de comprensión del lenguaje de propósito general de los modelos en texto chino. Sigue la estructura del benchmark GLUE (Evaluación de Comprensión del Lenguaje General) en inglés, adaptando sus tareas y metodología de evaluación al idioma chino. El benchmark proporciona una puntuación agregada única que refleja el rendimiento de un modelo en una variedad de tareas fundamentales de PLN, permitiendo la comparación directa de diferentes enfoques en el procesamiento del lenguaje natural chino.
El benchmark se introdujo a finales de la década de 2010 como parte de un esfuerzo más amplio para crear estándares de evaluación multilingües para el campo en rápido avance del aprendizaje profundo y los grandes modelos de lenguaje. Mientras que el benchmark GLUE original fue publicado en 2018 por investigadores de la Universidad de Nueva York y la Universidad de Washington, GLUE-ZH surgió como una adaptación impulsada por la comunidad para abordar la creciente necesidad de una evaluación estándar del PLN chino. Fue desarrollado por un consorcio de grupos de investigación académicos e industriales, aunque no se reconoce universalmente una fecha de lanzamiento oficial o un artículo único, y la composición exacta del benchmark ha variado entre implementaciones.
Composición de Tareas
GLUE-ZH típicamente incluye un conjunto de tareas que reflejan el conjunto GLUE en inglés pero que utilizan conjuntos de datos chinos. Las tareas comunes incluyen:
- Clasificación a nivel de oración: Tareas como análisis de sentimiento (por ejemplo, utilizando el conjunto de datos chino ChnSentiCorp) e inferencia de lenguaje natural por pregunta-respuesta (por ejemplo, el conjunto de datos CMNLI, que es una versión china del corpus MultiNLI).
- Similitud textual: Tareas como la Similitud Textual Semántica China (STS-B), que mide cuán semánticamente similares son dos oraciones en una escala de 0 a 5.
- Etiquetado de oración única: Tareas como la segmentación de palabras chinas y el etiquetado de partes del discurso, que son esenciales para el PLN chino debido a la falta de espacios entre palabras.
- Comprensión lectora: Tareas como CMRC2018 (Comprensión Lectora Automática China), que requiere que los modelos respondan preguntas basadas en pasajes dados.
El número exacto de tareas en GLUE-ZH ha variado entre versiones, con algunas implementaciones que incluyen tan solo cinco tareas y otras que se expanden a nueve o más. La configuración más comúnmente citada incluye siete tareas, que cubren clasificación, similitud e inferencia.
Metodología de Evaluación
GLUE-ZH utiliza un sistema de puntuación similar al benchmark GLUE en inglés. Cada tarea tiene una métrica específica (por ejemplo, precisión para tareas de clasificación, correlación de Pearson para tareas de similitud), y la puntuación final de GLUE-ZH es el promedio de todas las puntuaciones específicas de las tareas. Esta puntuación agregada permite una comparación de un solo número del rendimiento del modelo, simplificando el proceso de evaluación.
Los modelos se evalúan típicamente en un entorno de cero disparos o de ajuste fino. En el entorno de cero disparos, los modelos se prueban en las tareas de GLUE-ZH sin ningún entrenamiento específico de la tarea, lo que mide sus capacidades generales de comprensión del lenguaje. En el entorno de ajuste fino, los modelos se entrenan con los datos de entrenamiento de cada tarea antes de la evaluación, lo que mide su adaptabilidad a tareas posteriores específicas.
Contexto Histórico y Uso
GLUE-ZH ganó prominencia durante el auge de los modelos basados en Transformer a finales de la década de 2010 y principios de la década de 2020. Se utilizó como benchmark en varios artículos de investigación e informes técnicos, particularmente aquellos centrados en modelos preentrenados chinos como variantes basadas en BERT (por ejemplo, BERT-wwm, RoBERTa-wwm) y ERNIE. Estos modelos alcanzaron consistentemente puntuaciones altas en GLUE-ZH, con los modelos de mejor rendimiento alcanzando puntuaciones agregadas superiores al 80% para 2021.
El benchmark ha sido criticado por su alcance limitado, ya que se centra principalmente en tareas a nivel de oración y no incluye tareas más complejas como la generación de diálogos o la comprensión a nivel de documento. Además, la falta de una versión oficial única ha llevado a inconsistencias en los resultados reportados entre diferentes estudios, dificultando las comparaciones directas.
Relación con Otros Benchmarks
GLUE-ZH es parte de una familia de benchmarks multilingües que incluyen SuperGLUE (el sucesor de GLUE en inglés) y XTREME (un benchmark translingüístico). Mientras que XTREME incluye chino como uno de muchos idiomas, GLUE-ZH proporciona una evaluación más profunda específicamente para el chino. También está relacionado con el benchmark SuperGLUE chino (CLUE), que fue publicado en 2020 y ofrece un conjunto de evaluación más completo y estandarizado para el PLN chino. CLUE ha reemplazado en gran medida a GLUE-ZH en el uso de investigación debido a su conjunto de tareas más amplio y su tabla de clasificación oficial.
Estado Actual
A mediados de la década de 2020, GLUE-ZH se utiliza con menos frecuencia en la investigación de vanguardia, habiendo sido reemplazado por benchmarks más completos como CLUE y la versión china de SuperGLUE. Sin embargo, sigue siendo una referencia útil para comprender la evolución de la evaluación del PLN chino y todavía se cita en algunos materiales educativos y análisis históricos. La influencia del benchmark persiste en el diseño de conjuntos de evaluación más nuevos, que a menudo incorporan tipos de tareas y metodologías de puntuación similares.