El benchmark MMLU (Medición de Comprensión de Lenguaje Masivo Multitarea) es una herramienta de evaluación ampliamente utilizada para valorar las capacidades de los modelos de lenguaje grandes. Publicado el 7 de septiembre de 2020 por Dan Hendrycks y un equipo de investigadores, fue diseñado para ser más desafiante que benchmarks anteriores como GLUE, ya que los modelos comenzaban a superar a los humanos en pruebas más simples. MMLU consta de 15,908 preguntas de opción múltiple que abarcan 57 materias, desde campos STEM y derecho internacional hasta nutrición y religión. De estas, 1,540 preguntas se reservan para seleccionar configuraciones óptimas del modelo, como temperatura, tamaño de lote y tasa de aprendizaje. Para julio de 2024, el benchmark había sido descargado más de 100 millones de veces, convirtiéndose en una de las herramientas más comunes para comparar el rendimiento de modelos en la comunidad de inteligencia artificial.
Cuando se introdujo MMLU, la mayoría de los modelos existentes puntuaban cerca del azar (25%), y el mejor modelo, GPT-3 175B, alcanzaba un 43.9% de precisión. Los creadores estimaron que los expertos humanos en cada dominio lograrían alrededor del 89.8% de precisión. A mediados de 2024, modelos líderes como Claude 3.5 Sonnet, GPT-4o y Llama 3.1 405B alcanzaban consistentemente alrededor del 88% de precisión. Sin embargo, a partir de 2025, MMLU ha sido parcialmente eliminado en favor de alternativas más difíciles, reflejando el rápido progreso en las capacidades de los modelos.
Estructura y Contenido
El benchmark cubre una amplia gama de materias, incluyendo álgebra abstracta, derecho internacional, medicina profesional y muchas otras. Cada pregunta es de opción múltiple con cuatro opciones, y los modelos se evalúan por su precisión en todas las materias. La diversidad de temas busca probar no solo el conocimiento factual, sino también el razonamiento y la comprensión transversal. El conjunto de desarrollo de 1,540 preguntas se utiliza para ajustar hiperparámetros, asegurando comparaciones justas entre modelos.
MMLU ha inspirado varios spin-offs y variantes, como MMLU-Pro, MMMLU y MMLU-Redux, que buscan abordar algunas limitaciones del benchmark original o proporcionar evaluaciones más desafiantes. Estos derivados han contribuido a la evolución continua de la evaluación de modelos en la investigación de aprendizaje automático.
Limitaciones y Críticas
A pesar de su popularidad, MMLU ha enfrentado críticas significativas. El 5 de junio de 2024, expertos publicaron un artículo detallando un análisis manual de 5,700 preguntas, revelando un número sustancial de errores en las respuestas de referencia. Por ejemplo, el 57% de las preguntas en el subconjunto de "Virología" contenían errores, incluyendo múltiples respuestas correctas (4%), preguntas poco claras (14%) o respuestas completamente incorrectas (33%). En general, el análisis estimó que el 6.5% de las preguntas de MMLU contenían un error, sugiriendo que la puntuación máxima alcanzable era significativamente inferior al 100%.
La contaminación de datos también representó una amenaza seria para la validez del benchmark. Las empresas podían incluir inadvertida o deliberadamente preguntas y respuestas de MMLU en los datos de entrenamiento de sus modelos, volviendo el benchmark inútil como medida de generalización. Este problema es común en el campo de la evaluación de IA generativa, donde los modelos a menudo se entrenan con vastos corpus de internet que pueden incluir preguntas del benchmark.
Preguntas de Ejemplo
Los siguientes ejemplos ilustran los tipos de preguntas en MMLU, tomados de las tareas de "Álgebra Abstracta", "Derecho Internacional" y "Medicina Profesional". Las respuestas correctas están marcadas en negrita.
Pregunta 1 (Álgebra Abstracta):
Encuentra todos los \( c \) en \( \mathbb{Z}_3 \) tales que \( \mathbb{Z}_3[x]/(x^2 + c) \) sea un campo.
(A) 0 (B) 1 (C) 2 (D) 3
Pregunta 2 (Derecho Internacional):
¿Sería aceptable una reserva a la definición de tortura en el Pacto Internacional de Derechos Civiles y Políticos (PIDCP) en la práctica contemporánea?
(A) Esta es una reserva aceptable si la legislación del país que la realiza emplea una definición diferente.
(B) Esta es una reserva inaceptable porque contraviene el objeto y propósito del PIDCP.
(C) Esta es una reserva inaceptable porque la definición de tortura en el PIDCP es consistente con el derecho internacional consuetudinario.
(D) Esta es una reserva aceptable porque, según el derecho internacional general, los Estados tienen derecho a hacer reservas a los tratados.
Pregunta 3 (Medicina Profesional):
Un hombre de 33 años se somete a una tiroidectomía radical por cáncer de tiroides. Durante la operación, una hemorragia moderada requiere la ligadura de varios vasos en el lado izquierdo del cuello. Postoperatoriamente, los estudios séricos muestran una concentración de calcio de 7.5 mg/dL, una concentración de albúmina de 4 g/dL y una concentración de hormona paratiroidea de 200 pg/mL. ¿El daño a cuál de los siguientes vasos causó los hallazgos en este paciente?
(A) Rama del tronco costocervical.
(B) Rama de la arteria carótida externa.
(C) Rama del tronco tirocervical.
(D) Tributario de la vena yugular interna.
Impacto y Futuro
MMLU ha desempeñado un papel clave en el seguimiento del progreso de los modelos de lenguaje grandes y ha sido ampliamente adoptado por laboratorios de investigación y empresas, incluyendo OpenAI, Anthropic y Google DeepMind. Su influencia se extiende a nuevos benchmarks y metodologías de evaluación, impulsando el campo hacia pruebas más robustas y desafiantes. Sin embargo, los errores identificados y los problemas de contaminación han llevado a un cambio gradual hacia benchmarks más nuevos que son más resistentes a estos problemas. A partir de 2025, MMLU sigue siendo un punto de referencia histórico, pero su papel en la comparación de modelos de vanguardia está disminuyendo.