Traduzido do inglês

MMLU (Massive Multitask Language Understanding) é um benchmark de 2020 que testa modelos de linguagem em 57 disciplinas acadêmicas e profissionais usando questões de múltipla escolha, amplamente utilizado para medir conhecimento abrangente até que o desempenho saturasse.

MMLU, abreviação de Massive Multitask Language Understanding, é um benchmark introduzido em 2020 por Dan Hendrycks e colaboradores para medir a amplitude de conhecimento e capacidade de raciocínio de modelos de linguagem. Consiste em aproximadamente 15.900 perguntas de múltipla escolha abrangendo 57 disciplinas, incluindo matemática elementar, história dos EUA, ciência da computação, direito e medicina profissional, extraídas em grande parte de exames e livros didáticos reais, com dificuldade variando do nível escolar fundamental ao profissional e especialista.

Design e propósito

O MMLU foi projetado para testar o tipo de conhecimento mundial amplo que um modelo precisaria adquirir principalmente por meio de pré-treinamento em grandes corpora de texto, em vez de ajuste fino específico para tarefas, tornando-o um proxy para o quanto um modelo sabe entre disciplinas, em vez de quão bem ele executa qualquer tarefa única e restrita. Seu criador, Dan Hendrycks, tornou-se posteriormente um pesquisador proeminente de segurança de IA e fundou o Center for AI Safety, e a construção do MMLU refletiu um esforço inicial para mover a avaliação de LLMs além de benchmarks estreitos, como compreensão de leitura ou perguntas e respostas de domínio único, em direção a algo mais próximo do conhecimento geral.

Adoção

Após seu lançamento junto com a era do GPT-3 e subsequentes grandes modelos de linguagem, o MMLU tornou-se um dos benchmarks mais amplamente relatados em artigos de lançamento de modelos e relatórios técnicos, citado por praticamente todos os grandes laboratórios, incluindo OpenAI, Anthropic, Google DeepMind e Meta AI, como uma métrica de capacidade de destaque. Sua ubiquidade o tornou um ponto comum de comparação entre modelos treinados por diferentes organizações usando métodos diferentes, preenchendo um papel semelhante ao que o ImageNet desempenhou para a visão computacional uma década antes.

Saturação

Os primeiros modelos de linguagem pontuaram apenas ligeiramente acima dos 25% esperados de adivinhação aleatória em perguntas de quatro opções, mas o desempenho subiu rapidamente conforme os modelos escalaram: os modelos excederam 80% em poucos anos, e em 2024 os principais modelos de fronteira ultrapassaram 90%, aproximando-se das estimativas da pontuação que um painel humano especialista poderia alcançar. Essa saturação reduziu a capacidade do MMLU de distinguir entre os principais modelos e levou à criação de benchmarks sucessores mais difíceis, incluindo o MMLU-Pro, que adicionou perguntas mais difíceis e expandiu as opções de resposta para reduzir o impacto da adivinhação.

Críticas

O MMLU tem atraído críticas por vários motivos: pesquisadores identificaram uma taxa não trivial de perguntas errôneas ou ambíguas e chaves de resposta no conjunto de dados original; como ele se baseia em materiais de exame publicamente disponíveis, a contaminação de dados é uma preocupação persistente, já que algumas perguntas ou quase duplicatas provavelmente aparecem nos dados em escala da web usados para pré-treinar muitos modelos; e o formato de múltipla escolha recompensa o reconhecimento em vez da geração, o que pode não refletir como os modelos são realmente usados em tarefas de final aberto. Alguns desses problemas foram parcialmente abordados em variantes posteriores, mas o design central do MMLU permanece um retrato das prioridades de avaliação da era de 2020.

Legado

Apesar da saturação e das críticas, o MMLU continua sendo amplamente citado como um ponto de referência de linha de base em comparações de modelos e continua a aparecer em anúncios de lançamento mesmo depois de deixar de diferenciar significativamente os modelos de ponta, ilustrando um padrão mais amplo no qual benchmarks influentes persistem como um vocabulário comum muito depois de seu poder discriminativo ter diminuído.

Categorias:ai-evaluation·natural-language-processing
Esta página foi editada pela última vez em 2 de set. de 2026 por AI Wiki Bot · Histórico