MMMU 2025 es un punto de referencia diseñado para evaluar las capacidades de los sistemas de inteligencia artificial multimodal, en particular los grandes modelos de lenguaje con comprensión visual. Extiende el punto de referencia original MMMU (Comprensión Multimodal Masiva Multidisciplinaria), que fue lanzado a finales de 2023 por un consorcio de investigadores de instituciones como la Universidad de Alberta y la Universidad de Carleton. La edición de 2025 actualiza el punto de referencia para reflejar el rápido progreso en la investigación de IA generativa y grandes modelos de lenguaje, introduciendo nuevas tareas y preguntas más desafiantes que requieren un razonamiento profundo en múltiples disciplinas.
El punto de referencia evalúa a los modelos en su capacidad para percibir y razonar sobre información visual - como imágenes, diagramas y gráficos - combinada con preguntas textuales. Cubre una amplia gama de materias, incluyendo humanidades, ciencias sociales, campos STEM y dominios profesionales como medicina y derecho. MMMU 2025 está diseñado para ser una prueba rigurosa de comprensión a nivel universitario, requiriendo que los modelos no solo reconozcan elementos visuales, sino que también apliquen conocimiento específico del dominio y razonamiento de múltiples pasos. El punto de referencia se ha convertido en un punto de referencia estándar para comparar el rendimiento de los principales sistemas de IA de organizaciones como OpenAI, Anthropic y Google DeepMind.
Diseño de Tareas y Evaluación
MMMU 2025 consiste en preguntas de opción múltiple, cada una emparejada con una imagen o conjunto de imágenes. Las preguntas están diseñadas para requerir una síntesis de señales visuales y contexto textual, a menudo exigiendo conocimiento que va más allá del simple reconocimiento de patrones. Por ejemplo, una pregunta podría presentar un diagrama de circuito y preguntar sobre el efecto de un cambio de componente, o mostrar una pintura histórica e indagar sobre su significado cultural. El punto de referencia incluye más de 30,000 preguntas en 30 disciplinas, con un enfoque en preguntas que son desafiantes para los modelos actuales.
La evaluación se realiza utilizando la precisión como métrica principal, con modelos que deben generar una única respuesta correcta de un conjunto de opciones. El punto de referencia también rastrea el rendimiento por disciplina y por tipo de pregunta, permitiendo a los investigadores identificar fortalezas y debilidades específicas. En la edición de 2025, se añadió un nuevo subconjunto de preguntas que requiere que los modelos razonen sobre múltiples imágenes simultáneamente, probando su capacidad para comparar y contrastar información visual. Este diseño empuja a los modelos más allá del simple subtitulado de imágenes y hacia el ámbito del razonamiento visual y la resolución de problemas.
Hallazgos Clave y Rendimiento del Modelo
A principios de 2025, los modelos con mejor rendimiento en MMMU 2025 logran puntuaciones de precisión en el rango de mediados de los 80 por ciento, una mejora significativa sobre el MMMU original donde los mejores modelos puntuaban alrededor del 50-60%. Este progreso se atribuye a avances en arquitecturas de transformadores, conjuntos de datos de entrenamiento más grandes y técnicas de entrenamiento mejoradas como RLHF y aprendizaje curricular. Notablemente, los modelos de OpenAI y Google DeepMind han encabezado consistentemente la tabla de clasificación, con sus últimos lanzamientos demostrando un rendimiento casi a nivel humano en ciertas disciplinas como física y biología.
Sin embargo, el punto de referencia revela brechas persistentes. Los modelos todavía luchan con preguntas que requieren razonamiento abstracto, conocimiento de sentido común o comprensión de relaciones espaciales complejas. El rendimiento también varía significativamente entre disciplinas, con humanidades y ciencias sociales a menudo resultando más difíciles que los campos STEM puros. Los creadores del punto de referencia enfatizan que MMMU 2025 no es un problema resuelto, y continúa sirviendo como motivador para la investigación en áreas como mecanismos de atención multi-cabeza y atención cruzada que pueden integrar mejor la información visual y textual.
Comparación con Otros Puntos de Referencia
MMMU 2025 es parte de un ecosistema más amplio de puntos de referencia de evaluación de IA. Complementa otras pruebas bien conocidas como el punto de referencia de Respuesta a Preguntas Visuales (VQA) y el conjunto de Evaluación General de Comprensión del Lenguaje (GLUE). A diferencia de VQA, que se centra en preguntas simples sobre escenas cotidianas, MMMU 2025 se dirige a contenido académico a nivel universitario, lo que lo hace más alineado con el objetivo de desarrollar IA que pueda asistir en educación y trabajo profesional. En comparación con puntos de referencia solo de texto como GLUE, MMMU 2025 añade la dimensión crítica de la comprensión visual, que es esencial para aplicaciones como conducción autónoma, imágenes médicas y robótica.
El punto de referencia también difiere de puntos de referencia multimodales más nuevos como la Comprensión de Lenguaje Multitarea Masiva (MMLU) en que requiere entrada visual para cada pregunta, mientras que MMLU es solo de texto. Esto hace que MMMU 2025 sea una prueba más directa de la capacidad de un modelo para manejar datos del mundo real, que a menudo son multimodales. Los investigadores a menudo usan MMMU 2025 en conjunto con otros puntos de referencia para obtener una visión integral de las capacidades de un modelo, ya que ningún punto de referencia único puede capturar todos los aspectos de la inteligencia.
Impacto y Direcciones Futuras
La introducción de MMMU 2025 ha tenido un impacto significativo en el campo de la inteligencia artificial. Ha estimulado la investigación en codificadores visuales más robustos, mejor fusión de características visuales y textuales, y métodos de entrenamiento más eficientes. Empresas como AMD, Intel y TSMC también han tomado nota, ya que las demandas computacionales del punto de referencia destacan la necesidad de hardware especializado como aceleradores AWS Trainium y Groq para ejecutar estos modelos de manera eficiente.
De cara al futuro, los creadores de MMMU 2025 planean lanzar versiones actualizadas con preguntas aún más desafiantes, incluyendo tareas de respuesta abierta que requieran que los modelos generen explicaciones en lugar de solo seleccionar respuestas. También hay discusión sobre incorporar modalidades de video y audio, lo que empujaría aún más los límites de la comprensión multimodal. A medida que los modelos de IA continúan mejorando, puntos de referencia como MMMU 2025 jugarán un papel crucial en medir el progreso e identificar áreas donde la inteligencia a nivel humano sigue fuera de alcance.