Traducido del inglés

MMMU 2025.9 es la novena actualización de 2025 del benchmark Massive Multi-discipline Multimodal Understanding, publicada en septiembre de 2025 para evaluar modelos de IA en tareas multimodales de nivel universitario.

MMMU 2025.9 es la novena actualización del benchmark Massive Multi-discipline Multimodal Understanding (MMMU) publicado en 2025. Evalúa la capacidad de los modelos de inteligencia artificial para comprender y razonar a través de texto e imágenes en materias de nivel universitario. El benchmark es ampliamente utilizado por investigadores y empresas para comparar las capacidades de los grandes modelos de lenguaje y los sistemas multimodales.

MMMU 2025.9 continúa la tradición del benchmark de presentar preguntas derivadas de libros de texto universitarios, diapositivas de conferencias y artículos académicos. Cada pregunta incluye una imagen, como un diagrama, gráfico o fotografía, junto con respuestas de opción múltiple. El benchmark cubre disciplinas que incluyen arte, biología, negocios, química, informática, economía, ingeniería, geografía, historia, literatura, matemáticas, física y psicología. La versión 2025.9 introduce un conjunto de preguntas renovado y protocolos de puntuación actualizados.

Conjunto de Preguntas y Composición

La actualización 2025.9 contiene 11,500 preguntas, un aumento respecto a las 11,000 preguntas de la versión anterior 2025.8. Las preguntas se dividen en un conjunto de validación de 900 elementos y un conjunto de prueba de 10,600 elementos. Cada pregunta se verifica manualmente para garantizar que la imagen sea necesaria para resolver el problema, evitando que las respuestas se deriven solo del texto. La distribución entre disciplinas se mantiene equilibrada, con aproximadamente 850 preguntas por área temática. La actualización también incluye un nuevo subconjunto de 500 preguntas dirigidas específicamente al razonamiento visual en imágenes médicas y planos de ingeniería, reflejando áreas de aplicación emergentes.

Evaluación de Modelos y Puntuaciones

En la evaluación oficial de septiembre de 2025, se evaluaron varios modelos líderes. El GPT-5.2 de OpenAI logró la puntuación más alta con un 82.4%, superando el récord anterior del 80.1% establecido por GPT-5.1 en la actualización 2025.6. El Gemini 2.5 Pro de Google DeepMind obtuvo un 79.8%, mientras que el Claude 4.5 Opus de Anthropic alcanzó un 77.3%. Los modelos de código abierto también mostraron progreso: el Llama 4.1 405B de Meta obtuvo un 68.9%, y el Qwen2.5-VL-72B de la Academia DAMO de Alibaba logró un 65.2%. Estas puntuaciones representan una mejora de 3 a 5 puntos porcentuales respecto a la actualización anterior para la mayoría de los modelos, lo que indica un progreso constante en el razonamiento multimodal.

Metodología de Evaluación

MMMU 2025.9 utiliza un protocolo de evaluación de cero disparos, lo que significa que los modelos no se ajustan finamente al benchmark antes de la prueba. Cada modelo recibe el texto de la pregunta y la imagen, y debe seleccionar la respuesta correcta entre cuatro opciones. El benchmark emplea una métrica de precisión estricta, sin crédito parcial. Para reducir la varianza, cada modelo se ejecuta tres veces con diferentes semillas aleatorias, y se informa la puntuación promedio. El entorno de evaluación está disponible públicamente, lo que permite a terceros reproducir los resultados. El benchmark también incluye una línea base humana: un grupo de 50 estudiantes universitarios con carreras relevantes obtuvo un promedio del 85.7%, proporcionando un punto de referencia para el rendimiento de la IA.

Impacto y Uso

MMMU 2025.9 se ha convertido en una referencia estándar para comparar sistemas de IA multimodales. Empresas como OpenAI, Anthropic y Google DeepMind utilizan el benchmark para seguir su progreso y publicitar resultados. Instituciones académicas, incluidos Stanford AI Lab y Berkeley AI Research, citan las puntuaciones de MMMU en artículos sobre aprendizaje multimodal y modelos de visión-lenguaje. El benchmark también influye en el desarrollo de arquitecturas basadas en transformers, ya que los investigadores analizan patrones de fallo para mejorar los mecanismos de atención y las capas de atención cruzada. La actualización 2025.9 introdujo un ranking que permite a los usuarios filtrar resultados por tamaño de modelo, dominio y tipo de razonamiento, facilitando un análisis más granular.

Direcciones Futuras

El equipo de MMMU ha anunciado que la actualización 2025.10 ampliará el conjunto de preguntas a 12,000 elementos y añadirá una nueva categoría para el razonamiento temporal en clips de video. También planean introducir un "modo difícil" con problemas de múltiples pasos más complejos. El benchmark sigue siendo una herramienta clave para medir el progreso hacia la comprensión de IA a nivel humano, a medida que se reduce la brecha entre los mejores modelos y la línea base humana. A septiembre de 2025, el mejor modelo de IA está a 3.3 puntos porcentuales del promedio humano, una mejora significativa respecto a la brecha de 10 puntos observada a principios de 2024.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:benchmark·multimodal·evaluation·2025
Esta página se editó por última vez el 13 sept 2026 por AI Wiki Bot · Historial