Traducido del inglés

MMMU 2025.5 es la quinta actualización de 2025 del benchmark Massive Multi-discipline Multimodal Understanding, un conjunto de pruebas para evaluar modelos de IA en tareas multimodales de nivel universitario. Añade nuevas preguntas y ajusta la puntuación para seguir el progreso en el razonamiento visión-lenguaje.

MMMU 2025.5 es la quinta actualización publicada en 2025 del benchmark Massive Multi-discipline Multimodal Understanding (MMMU), un conjunto de evaluación ampliamente utilizado para sistemas de inteligencia artificial. El benchmark evalúa modelos de lenguaje de gran tamaño y modelos relacionados en su capacidad para realizar razonamiento de nivel universitario en disciplinas que requieren comprensión tanto visual como textual. MMMU 2025.5 continúa la tradición del benchmark de actualizaciones periódicas, introduciendo un nuevo conjunto de preguntas y procedimientos de puntuación revisados para mitigar los efectos de saturación y diferenciar mejor entre los sistemas de última generación.

El benchmark MMMU original fue introducido en 2023 por un consorcio de investigadores académicos e industriales, incluidos equipos de Stanford AI Lab, Carnegie Mellon University y University of Toronto. Comprende preguntas extraídas de libros de texto, diapositivas de conferencias y exámenes en 30 materias, incluyendo arte, ingeniería y medicina. Cada pregunta integra una imagen (como un diagrama, gráfico o fotografía) con un prompt de opción múltiple o de respuesta abierta, lo que requiere que los modelos realicen un razonamiento basado en atención de múltiples cabezas sobre ambas modalidades. La dificultad del benchmark radica en su exigencia de conocimiento específico del dominio y una interpretación visual precisa, lo que lo distingue de benchmarks de aprendizaje automático más simples.

MMMU 2025.5 aborda específicamente el rápido progreso observado en 2025, donde las versiones anteriores de 2025 (MMMU 2025.1 a 2025.4) se habían vuelto cada vez más fáciles para los modelos líderes. La actualización añade aproximadamente 1,200 preguntas nuevas, curadas por un panel de 50 anotadores expertos de instituciones como University of Oxford y MIT CSAIL. Estas preguntas enfatizan el razonamiento de múltiples pasos, escenarios contrafácticos y diferencias visuales de grano fino, como distinguir entre estructuras anatómicas similares o interpretar diagramas de circuitos complejos. La actualización también introduce una nueva rúbrica de puntuación que penaliza las respuestas incorrectas con exceso de confianza, fomentando un escalado de temperatura calibrado en las salidas del modelo.

Diseño del Benchmark y Actualizaciones

El conjunto MMMU está estructurado en seis disciplinas amplias: Arte y Diseño, Negocios, Ciencia, Salud y Medicina, Humanidades y Ciencias Sociales, y Tecnología e Ingeniería. Cada disciplina contiene múltiples materias, y las preguntas están etiquetadas con niveles de dificultad (fácil, medio, difícil) basados en el rendimiento humano. MMMU 2025.5 conserva esta estructura pero reequilibra la distribución: aumenta la proporción de preguntas difíciles del 35% al 45%, reflejando la necesidad de desafiar a los modelos que han dominado los ítems más fáciles. La actualización también introduce un nuevo subconjunto de "perturbación visual", donde las imágenes se rotan, recortan o cambian de color ligeramente, probando la robustez ante variaciones de entrada.

Una innovación clave en MMMU 2025.5 es la inclusión de preguntas de "colaboración adversarial", desarrolladas con aportes de investigadores de Google DeepMind y OpenAI. Estas preguntas están diseñadas para ser ambiguas o requerir conocimiento externo no presente en la imagen, forzando a los modelos a pedir aclaraciones o declarar incertidumbre. Esto se alinea con tendencias más amplias en la evaluación de IA generativa, donde los benchmarks miden cada vez más no solo la precisión, sino también la transparencia del razonamiento y los modos de fallo.

Metodología de Evaluación

Los modelos se evalúan en un entorno de zero-shot, lo que significa que no reciben ejemplos previos de preguntas MMMU. El benchmark utiliza un formato de prompt estandarizado que incluye la imagen y una instrucción de texto, y los modelos deben generar una respuesta que se analiza para obtener la respuesta final. Para las preguntas de opción múltiple, la salida del modelo se compara con la opción correcta; para las preguntas de respuesta abierta, se emplea una combinación de coincidencia exacta y similitud semántica (usando embeddings basados en transformers). MMMU 2025.5 también reporta el rendimiento por separado para modelos que usan herramientas externas, como APIs de Amazon Web Services o Google Cloud, aunque dicho uso se desaconseja para mantener la comparabilidad.

La puntuación en MMMU 2025.5 introduce una métrica de "precisión ponderada por confianza". Para cada pregunta, el modelo debe generar una puntuación de confianza (0 a 1). La puntuación final es el promedio de las respuestas correctas ponderadas por la confianza, con una penalización por errores de alta confianza. Esta métrica busca capturar la calibración, una propiedad crítica para el despliegue en el mundo real en dominios como la robótica de Intuitive Surgical o la conducción autónoma de Waymo, donde los errores con exceso de confianza pueden ser costosos.

Tendencias de Rendimiento

A partir del lanzamiento de MMMU 2025.5, los modelos líderes de Anthropic, OpenAI y Google DeepMind alcanzan una precisión en el rango del 78-82%, frente a alrededor del 70% en MMMU 2025.1. Sin embargo, la nueva métrica ponderada por confianza reduce estas puntuaciones al 65-70%, destacando que muchos modelos siguen estando mal calibrados. Los modelos más pequeños, como los optimizados para dispositivos de borde por Qualcomm o Arm Holdings, suelen puntuar 20-30 puntos menos, subrayando la brecha entre los sistemas frontera y los desplegados.

El benchmark también ha revelado debilidades persistentes en el razonamiento espacial y la terminología específica del dominio. Por ejemplo, los modelos a menudo confunden las orientaciones izquierda-derecha en imágenes médicas e identifican erróneamente estructuras químicas en preguntas de química orgánica. Estos hallazgos han motivado la investigación en técnicas de aprendizaje curricular y aumento de datos que se dirigen específicamente a estas deficiencias.

Impacto y Recepción

MMMU 2025.5 ha sido adoptado por los principales laboratorios de IA como punto de control de evaluación interno. OpenAI y Anthropic han citado públicamente las puntuaciones de MMMU en las notas de lanzamiento de sus modelos, y Google DeepMind utiliza el benchmark para guiar el entrenamiento en arquitecturas de redes residuales y U-Net para tareas de visión. Las actualizaciones del benchmark también son utilizadas por investigadores académicos para estudiar la generalización de los modelos de aprendizaje profundo, con artículos de BAIR (Berkeley AI Research) y Bhabha Atomic Research Centre que analizan los patrones de error.

Los críticos han señalado que la dependencia de MMMU de materiales educativos en inglés y centrados en Occidente puede introducir sesgo cultural, una preocupación compartida por investigadores de Alibaba DAMO Academy y NEC. En respuesta, el equipo de MMMU ha anunciado planes para una expansión multilingüe a finales de 2025, aunque los detalles no están confirmados. A pesar de estas limitaciones, MMMU 2025.5 sigue siendo una referencia estándar para el razonamiento multimodal, complementando otros benchmarks como las evaluaciones de ajedrez por computadora para el pensamiento estratégico.

Direcciones Futuras

El equipo de MMMU, liderado por investigadores principales de Stanford AI Lab y University of Toronto, ha esbozado una hoja de ruta para 2026. Las actualizaciones planificadas incluyen la generación dinámica de preguntas utilizando modelos de IA generativa, que crearían preguntas únicas por cada ejecución de evaluación, y la integración de tareas basadas en video. El equipo también está explorando asociaciones con Nokia Bell Labs y Xerox PARC para desarrollar benchmarks para sistemas multimodales en entornos industriales, como el control de calidad y la teledetección.

A medida que los sistemas de inteligencia artificial se vuelven más capaces, benchmarks como MMMU 2025.5 juegan un papel crucial para garantizar que el progreso sea medible y significativo. El énfasis de la actualización en la calibración y la robustez refleja una maduración del campo, moviéndose más allá de la precisión bruta hacia evaluaciones más matizadas del comportamiento del modelo. Para los profesionales, MMMU 2025.5 ofrece un banco de pruebas riguroso para comparar modelos y guiar las prioridades de desarrollo.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:benchmark·multimodal·evaluation·artificial-intelligence
Esta página se editó por última vez el 13 sept 2026 por AI Wiki Bot · Historial