MMMU 2025.10 es la décima actualización programada del benchmark MMMU (Massive Multi-discipline Multimodal Understanding) lanzada en 2025. MMMU es un conjunto de evaluación ampliamente utilizado para sistemas de inteligencia artificial que procesan información tanto visual como textual, como los modelos de lenguaje grandes con capacidades de visión. La versión 2025.10 continúa la tradición del benchmark de añadir nuevas preguntas y tareas para rastrear el progreso en modelos de aprendizaje automático y aprendizaje profundo.
La actualización se introdujo en octubre de 2025, siguiendo el patrón de lanzamientos mensuales que comenzó a principios de ese año. Cada actualización de la serie 2025 ha tenido como objetivo mantener el benchmark al día con la rápida evolución de los modelos multimodales de organizaciones como OpenAI, Anthropic y Google DeepMind. La edición 2025.10 se centra específicamente en ampliar la cobertura en áreas donde las versiones anteriores de 2025 mostraron lagunas, incluyendo el razonamiento complejo con gráficos y diagramas, y la comprensión de fotogramas de video.
Estructura del Benchmark
MMMU 2025.10 conserva la estructura central del benchmark MMMU original, que organiza preguntas en múltiples disciplinas académicas. Estas incluyen arte, negocios, ciencia, ingeniería y humanidades. Cada pregunta combina una imagen - como una fotografía, gráfico o esquema - con una pregunta de opción múltiple. La actualización 2025.10 añade aproximadamente 1,500 preguntas nuevas, elevando el total a más de 12,000. Los nuevos elementos enfatizan el razonamiento de múltiples pasos, donde un modelo debe combinar señales visuales con conocimiento del dominio para llegar a la respuesta correcta.
El benchmark está diseñado para ser desafiante incluso para los sistemas de redes neuronales más avanzados. A diferencia de tareas más simples de respuesta a preguntas visuales, las preguntas de MMMU a menudo requieren experiencia a nivel universitario. Por ejemplo, una pregunta podría mostrar un diagrama de circuito y preguntar sobre sus propiedades eléctricas, o mostrar una pintura histórica y preguntar sobre su contexto cultural.
Puntuación y Evaluación
Los modelos se evalúan en precisión, medida como el porcentaje de preguntas respondidas correctamente. La actualización 2025.10 introdujo un protocolo de evaluación más estricto que penaliza a los modelos por proporcionar respuestas correctas con razonamiento incorrecto. Este cambio se realizó en respuesta a preocupaciones de que algunos modelos adivinaban correctamente sin comprensión genuina. La evaluación también incluye un subconjunto de preguntas sin una única respuesta correcta, diseñado para probar la capacidad de un modelo de reconocer la incertidumbre.
Los resultados de 2025.10 mostraron que los modelos líderes de OpenAI, Anthropic y Google DeepMind alcanzaron puntuaciones de precisión en el rango del 70% alto al 80% bajo, frente al 60% medio a principios de 2025. Los modelos de código abierto más pequeños, como los de Alibaba DAMO Academy, típicamente puntuaron en el rango del 50% al 60%, destacando la brecha entre los modelos frontera y los accesibles.
Impacto en el Desarrollo de Modelos
La actualización 2025.10 ha influido en cómo los desarrolladores entrenan y refinan sistemas multimodales. Muchos equipos usan MMMU como un benchmark clave durante el desarrollo, junto con otras evaluaciones como pruebas de razonamiento de inteligencia artificial. Las nuevas preguntas centradas en el razonamiento han impulsado a los investigadores a mejorar técnicas como el prompting de cadena de pensamiento y Reinforcement Learning from AI Feedback (RLAIF) (aprendizaje por refuerzo con retroalimentación de IA).
Varias arquitecturas basadas en Transformer (architecture) se han ajustado específicamente para rendir bien en MMMU. Por ejemplo, el modelo de visión GPT-5 de OpenAI y el Claude 4.5 de Anthropic informaron haber usado los resultados de MMMU 2025.10 para guiar ajustes posteriores al entrenamiento. El benchmark también ha sido utilizado por laboratorios académicos como MIT CSAIL y Stanford AI Lab para comparar métodos de entrenamiento novedosos, incluyendo estrategias de aprendizaje curricular y aumento de datos.
Críticas y Limitaciones
A pesar de su popularidad, MMMU 2025.10 ha enfrentado críticas. Algunos investigadores argumentan que el formato de opción múltiple del benchmark no refleja el uso en el mundo real, donde los modelos deben generar respuestas abiertas. Otros señalan que el banco de preguntas puede memorizarse con el tiempo, lo que lleva a puntuaciones infladas. La actualización 2025.10 intentó mitigar esto rotando preguntas más antiguas e introduciendo un modo de evaluación dinámico, pero persisten las preocupaciones.
Además, la fuerte dependencia del benchmark en contenido en inglés y currículos académicos occidentales ha sido señalada como una limitación. Los esfuerzos para añadir preguntas multilingües y culturalmente diversas han sido lentos, con la versión 2025.10 añadiendo solo un pequeño número de elementos no ingleses. Esto ha llevado a algunas organizaciones, incluyendo Bhabha Atomic Research Centre y Samsung Research, a desarrollar sus propias evaluaciones internas adaptadas a necesidades regionales.
Direcciones Futuras
El equipo de MMMU ha anunciado planes para la actualización 2025.11, que se centrará en tareas de razonamiento interactivo y de múltiples turnos. Esto requeriría que los modelos hagan preguntas aclaratorias o soliciten imágenes adicionales, yendo más allá de pares estáticos de pregunta-respuesta. El equipo también está explorando asociaciones con grupos industriales como AMD y Qualcomm para optimizar el benchmark para dispositivos de borde, donde las restricciones computacionales son más estrictas.
A finales de 2025, MMMU sigue siendo uno de los benchmarks más citados en el campo del aprendizaje automático multimodal. Su evolución continua refleja la tendencia más amplia hacia una evaluación más rigurosa y realista de los sistemas de IA generativa. Si seguirá siendo el estándar está por verse, pero su influencia en el desarrollo de modelos es innegable.