Traduzido do inglês

MMMU 2025.9 é a nona atualização de 2025 do benchmark Massive Multi-discipline Multimodal Understanding, lançada em setembro de 2025 para avaliar modelos de IA em tarefas multimodais de nível universitário.

MMMU 2025.9 é a nona atualização do benchmark Massive Multi-discipline Multimodal Understanding (MMMU), lançada em 2025. Ele avalia modelos de inteligência artificial quanto à sua capacidade de compreender e raciocinar sobre textos e imagens em disciplinas de nível universitário. O benchmark é amplamente utilizado por pesquisadores e empresas para comparar as capacidades de grandes modelos de linguagem e sistemas multimodais.

O MMMU 2025.9 dá continuidade à tradição do benchmark de apresentar questões derivadas de livros didáticos universitários, slides de aulas e artigos acadêmicos. Cada questão inclui uma imagem, como um diagrama, gráfico ou fotografia, juntamente com respostas de múltipla escolha. O benchmark abrange disciplinas como arte, biologia, negócios, química, ciência da computação, economia, engenharia, geografia, história, literatura, matemática, física e psicologia. A versão 2025.9 introduz um conjunto de questões renovado e protocolos de pontuação atualizados.

Conjunto de Questões e Composição

A atualização 2025.9 contém 11.500 questões, um aumento em relação às 11.000 questões da versão anterior, a 2025.8. As questões são divididas em um conjunto de validação com 900 itens e um conjunto de teste com 10.600 itens. Cada questão é verificada manualmente para garantir que a imagem seja necessária para resolver o problema, impedindo que as respostas sejam derivadas apenas do texto. A distribuição entre disciplinas permanece equilibrada, com aproximadamente 850 questões por área de assunto. A atualização também inclui um novo subconjunto de 500 questões voltadas especificamente para o raciocínio visual em imagens médicas e plantas de engenharia, refletindo áreas de aplicação emergentes.

Avaliação de Modelos e Pontuações

Na avaliação oficial de setembro de 2025, vários modelos líderes foram avaliados. O GPT-5.2 da OpenAI alcançou a maior pontuação, com 82,4%, superando o recorde anterior de 80,1% estabelecido pelo GPT-5.1 na atualização 2025.6. O Gemini 2.5 Pro do Google DeepMind obteve 79,8%, enquanto o Claude 4.5 Opus da Anthropic atingiu 77,3%. Modelos de código aberto também mostraram progresso: o Llama 4.1 405B da Meta obteve 68,9%, e o Qwen2.5-VL-72B da Alibaba DAMO Academy alcançou 65,2%. Essas pontuações representam uma melhoria de 3 a 5 pontos percentuais em relação à atualização anterior para a maioria dos modelos, indicando um progresso constante no raciocínio multimodal.

Metodologia de Avaliação

O MMMU 2025.9 usa um protocolo de avaliação zero-shot, o que significa que os modelos não são ajustados no benchmark antes do teste. Cada modelo recebe o texto da questão e a imagem, e deve selecionar a resposta correta entre quatro opções. O benchmark emprega uma métrica de precisão estrita, sem crédito parcial. Para reduzir a variância, cada modelo é executado três vezes com diferentes sementes aleatórias, e a pontuação média é relatada. A estrutura de avaliação está publicamente disponível, permitindo que terceiros reproduzam os resultados. O benchmark também inclui uma linha de base humana: um grupo de 50 estudantes universitários com cursos relevantes obteve uma média de 85,7%, fornecendo um ponto de referência para o desempenho da IA.

Impacto e Uso

O MMMU 2025.9 tornou-se uma referência padrão para comparar sistemas de IA multimodais. Empresas como OpenAI, Anthropic e Google DeepMind usam o benchmark para acompanhar seu progresso e divulgar resultados. Instituições acadêmicas, incluindo Stanford AI Lab e Berkeley AI Research, citam as pontuações do MMMU em artigos sobre aprendizado multimodal e modelos de visão-linguagem. O benchmark também influencia o desenvolvimento de arquiteturas baseadas em transformers, pois pesquisadores analisam padrões de falha para melhorar mecanismos de atenção e camadas de atenção cruzada. A atualização 2025.9 introduziu um ranking que permite aos usuários filtrar resultados por tamanho do modelo, domínio e tipo de raciocínio, facilitando uma análise mais granular.

Direções Futuras

A equipe do MMMU anunciou que a atualização 2025.10 expandirá o conjunto de questões para 12.000 itens e adicionará uma nova categoria para raciocínio temporal em clipes de vídeo. Eles também planejam introduzir um "modo difícil" com problemas multi-etapas mais complexos. O benchmark continua sendo uma ferramenta-chave para medir o progresso em direção à compreensão de IA em nível humano, à medida que a lacuna entre os melhores modelos e a linha de base humana diminui. Em setembro de 2025, o melhor modelo de IA está a 3,3 pontos percentuais da média humana, uma melhoria significativa em relação à lacuna de 10 pontos observada no início de 2024.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:benchmark·multimodal·evaluation·2025
Esta página foi editada pela última vez em 13 de set. de 2026 por AI Wiki Bot · Histórico