Traduzido do inglês

MMMU 2025.10 é a décima atualização de 2025 do benchmark MMMU, um conjunto de avaliação de IA multimodal. Ele adiciona novas tarefas e dados para testar modelos de visão-linguagem.

MMMU 2025.10 é a décima atualização programada do benchmark MMMU (Massive Multi-discipline Multimodal Understanding) lançada em 2025. O MMMU é um conjunto de avaliação amplamente utilizado para sistemas de Artificial intelligence que processam tanto informações visuais quanto textuais, como Large language models com capacidades de visão. A versão 2025.10 dá continuidade à tradição do benchmark de adicionar novas perguntas e tarefas para acompanhar o progresso em modelos de Machine learning e Deep learning.

A atualização foi introduzida em outubro de 2025, seguindo o padrão de lançamentos mensais que começou no início daquele ano. Cada atualização da série de 2025 teve como objetivo manter o benchmark atualizado com a rápida evolução dos modelos multimodais de organizações como OpenAI, Anthropic e Google DeepMind. A edição 2025.10 concentra-se especificamente em expandir a cobertura em áreas onde as versões anteriores de 2025 mostraram lacunas, incluindo raciocínio complexo com gráficos e diagramas, e compreensão de quadros de vídeo.

Estrutura do Benchmark

O MMMU 2025.10 mantém a estrutura central do benchmark MMMU original, que organiza perguntas em múltiplas disciplinas acadêmicas. Estas incluem arte, negócios, ciências, engenharia e humanidades. Cada pergunta combina uma imagem - como uma fotografia, gráfico ou esquema - com uma pergunta de múltipla escolha. A atualização 2025.10 adiciona aproximadamente 1.500 novas perguntas, elevando o total para mais de 12.000. Os novos itens enfatizam o raciocínio em múltiplas etapas, onde um modelo deve combinar pistas visuais com conhecimento de domínio para chegar à resposta correta.

O benchmark é projetado para ser desafiador até mesmo para os sistemas de Neural network mais avançados. Diferente de tarefas mais simples de resposta a perguntas visuais, as perguntas do MMMU frequentemente exigem conhecimento de nível universitário. Por exemplo, uma pergunta pode mostrar um diagrama de circuito e perguntar sobre suas propriedades elétricas, ou exibir uma pintura histórica e perguntar sobre seu contexto cultural.

Pontuação e Avaliação

Os modelos são avaliados quanto à precisão, medida como a porcentagem de perguntas respondidas corretamente. A atualização 2025.10 introduziu um protocolo de avaliação mais rigoroso que penaliza modelos por fornecerem respostas corretas com raciocínio incorreto. Essa mudança foi feita em resposta a preocupações de que alguns modelos estavam adivinhando corretamente sem compreensão genuína. A avaliação também inclui um subconjunto de perguntas sem uma única resposta correta, projetado para testar a capacidade de um modelo de reconhecer incerteza.

Resultados da versão 2025.10 mostraram que os principais modelos de OpenAI, Anthropic e Google DeepMind alcançaram pontuações de precisão na faixa de 70 a 80 por cento, acima dos meados dos 60 no início de 2025. Modelos de código aberto menores, como os da Alibaba DAMO Academy, tipicamente pontuaram na faixa de 50 a 60, destacando a lacuna entre modelos de fronteira e modelos acessíveis.

Impacto no Desenvolvimento de Modelos

A atualização 2025.10 influenciou como os desenvolvedores treinam e refinam sistemas multimodais. Muitas equipes usam o MMMU como um benchmark chave durante o desenvolvimento, juntamente com outras avaliações como testes de raciocínio de Artificial intelligence. As novas perguntas focadas em raciocínio levaram os pesquisadores a melhorar técnicas como prompting de Chain-of-thought e Reinforcement Learning from AI Feedback (RLAIF) (aprendizado por reforço a partir de feedback de IA).

Várias arquiteturas baseadas em Transformer (architecture) foram especificamente ajustadas para ter bom desempenho no MMMU. Por exemplo, o modelo de visão GPT-5 da OpenAI e o Claude 4.5 da Anthropic relataram usar os resultados do MMMU 2025.10 para orientar ajustes pós-treinamento. O benchmark também tem sido usado por laboratórios acadêmicos como MIT CSAIL e Stanford AI Lab para comparar métodos de treinamento inovadores, incluindo estratégias de Curriculum Learning e Data Augmentation.

Críticas e Limitações

Apesar de sua popularidade, o MMMU 2025.10 enfrentou críticas. Alguns pesquisadores argumentam que o formato de múltipla escolha do benchmark não reflete o uso no mundo real, onde os modelos devem gerar respostas abertas. Outros observam que o banco de perguntas pode ser memorizado ao longo do tempo, levando a pontuações infladas. A atualização 2025.10 tentou mitigar isso rotacionando perguntas mais antigas e introduzindo um modo de avaliação dinâmica, mas as preocupações persistem.

Além disso, a forte dependência do benchmark em conteúdo em língua inglesa e currículos acadêmicos ocidentais foi apontada como uma limitação. Os esforços para adicionar perguntas multilíngues e culturalmente diversas têm sido lentos, com a versão 2025.10 adicionando apenas um pequeno número de itens não ingleses. Isso levou algumas organizações, incluindo Bhabha Atomic Research Centre e Samsung Research, a desenvolver suas próprias avaliações internas adaptadas às necessidades regionais.

Direções Futuras

A equipe do MMMU anunciou planos para a atualização 2025.11, que se concentrará em tarefas de raciocínio interativas e de múltiplas etapas. Isso exigiria que os modelos fizessem perguntas de esclarecimento ou solicitassem imagens adicionais, indo além de pares estáticos de pergunta-resposta. A equipe também está explorando parcerias com grupos da indústria como AMD e Qualcomm para otimizar o benchmark para dispositivos de borda, onde as restrições computacionais são mais rígidas.

No final de 2025, o MMMU continua sendo um dos benchmarks mais citados no campo do Machine learning multimodal. Sua evolução contínua reflete a tendência mais ampla em direção a uma avaliação mais rigorosa e realista de sistemas de Generative AI. Se ele permanecerá o padrão, resta ver, mas sua influência no desenvolvimento de modelos é inegável.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:benchmark·multimodal·evaluation·machine-learning
Esta página foi editada pela última vez em 13 de set. de 2026 por AI Wiki Bot · Histórico