Traduzido do inglês

MMLU (Measuring Massive Multitask Language Understanding) é um benchmark para avaliar grandes modelos de linguagem, lançado em 2020 com 15.908 perguntas em 57 disciplinas. Tornou-se amplamente utilizado, mas enfrentou críticas por erros e contaminação de dados.

O benchmark MMLU (Measuring Massive Multitask Language Understanding) é uma ferramenta de avaliação amplamente utilizada para medir as capacidades de modelos de linguagem de grande porte. Lançado em 7 de setembro de 2020 por Dan Hendrycks e uma equipe de pesquisadores, foi projetado para ser mais desafiador do que benchmarks anteriores, como o GLUE, à medida que os modelos começavam a superar os humanos em testes mais simples. O MMLU consiste em 15.908 perguntas de múltipla escolha abrangendo 57 disciplinas, desde áreas de STEM e direito internacional até nutrição e religião. Dessas, 1.540 perguntas são reservadas para a seleção de configurações ideais do modelo, como temperatura, tamanho do lote e taxa de aprendizado. Em julho de 2024, o benchmark havia sido baixado mais de 100 milhões de vezes, tornando-se uma das ferramentas mais comuns para comparar o desempenho de modelos na comunidade de inteligência artificial.

Quando o MMLU foi introduzido, a maioria dos modelos existentes pontuava próximo ao acaso (25%), com o melhor modelo, o GPT-3 175B, alcançando 43,9% de precisão. Os criadores estimaram que especialistas humanos na área alcançariam cerca de 89,8% de precisão. Em meados de 2024, modelos líderes como Claude 3.5 Sonnet, GPT-4o e Llama 3.1 405B atingiam consistentemente cerca de 88% de precisão. No entanto, a partir de 2025, o MMLU foi parcialmente descontinuado em favor de alternativas mais difíceis, refletindo o rápido progresso nas capacidades dos modelos.

Estrutura e Conteúdo

O benchmark cobre uma ampla gama de disciplinas, incluindo álgebra abstrata, direito internacional, medicina profissional e muitas outras. Cada pergunta é um item de múltipla escolha com quatro opções, e os modelos são avaliados quanto à sua precisão em todas as disciplinas. A diversidade de tópicos visa testar não apenas o conhecimento factual, mas também o raciocínio e a compreensão interdisciplinar. O conjunto de desenvolvimento com 1.540 perguntas é usado para ajustar hiperparâmetros, garantindo comparações justas entre os modelos.

O MMLU inspirou vários spin-offs e variantes, como MMLU-Pro, MMMLU e MMLU-Redux, que visam abordar algumas das limitações do benchmark original ou fornecer avaliações mais desafiadoras. Esses derivados contribuíram para a evolução contínua da avaliação de modelos na pesquisa em aprendizado de máquina.

Limitações e Críticas

Apesar de sua popularidade, o MMLU enfrentou críticas significativas. Em 5 de junho de 2024, especialistas publicaram um artigo detalhando uma análise manual de 5.700 perguntas, revelando um número substancial de erros no gabarito. Por exemplo, 57% das perguntas no subconjunto "Virologia" foram consideradas com erros, incluindo múltiplas respostas corretas (4%), perguntas pouco claras (14%) ou respostas completamente incorretas (33%). No geral, a análise estimou que 6,5% das perguntas do MMLU continham um erro, sugerindo que a pontuação máxima alcançável era significativamente inferior a 100%.

A contaminação de dados também representou uma séria ameaça à validade do benchmark. Empresas poderiam, inadvertidamente ou deliberadamente, incluir perguntas e respostas do MMLU nos dados de treinamento de seus modelos, tornando o benchmark inútil como medida de generalização. Esse problema é comum no campo da avaliação de IA generativa, onde os modelos são frequentemente treinados em vastos corpora da internet que podem incluir perguntas de benchmarks.

Exemplos de Perguntas

Os exemplos a seguir ilustram os tipos de perguntas no MMLU, provenientes das tarefas de "Álgebra Abstrata", "Direito Internacional" e "Medicina Profissional". As respostas corretas estão marcadas em negrito.

Pergunta 1 (Álgebra Abstrata):

Encontre todos os \( c \) em \( \mathbb{Z}_3 \) tais que \( \mathbb{Z}_3[x]/(x^2 + c) \) seja um corpo.

(A) 0 (B) 1 (C) 2 (D) 3

Pergunta 2 (Direito Internacional):

Uma reserva à definição de tortura no Pacto Internacional sobre Direitos Civis e Políticos (PIDCP) seria aceitável na prática contemporânea?

(A) Esta é uma reserva aceitável se a legislação do país que faz a reserva empregar uma definição diferente.

(B) Esta é uma reserva inaceitável porque contraria o objeto e o propósito do PIDCP.

(C) Esta é uma reserva inaceitável porque a definição de tortura no PIDCP é consistente com o direito internacional consuetudinário.

(D) Esta é uma reserva aceitável porque, sob o direito internacional geral, os Estados têm o direito de fazer reservas a tratados.

Pergunta 3 (Medicina Profissional):

Um homem de 33 anos é submetido a uma tireoidectomia radical por câncer de tireoide. Durante a operação, uma hemorragia moderada exige a ligadura de vários vasos no lado esquerdo do pescoço. No pós-operatório, os exames séricos mostram concentração de cálcio de 7,5 mg/dL, concentração de albumina de 4 g/dL e concentração de paratormônio de 200 pg/mL. O dano a qual dos seguintes vasos causou os achados neste paciente?

(A) Ramo do tronco costocervical.

(B) Ramo da artéria carótida externa.

(C) Ramo do tronco tireocervical.

(D) Tributário da veia jugular interna.

Impacto e Futuro

O MMLU desempenhou um papel crucial no acompanhamento do progresso dos modelos de linguagem de grande porte e foi amplamente adotado por laboratórios de pesquisa e empresas, incluindo OpenAI, Anthropic e Google DeepMind. Sua influência se estende a outros benchmarks e metodologias de avaliação, impulsionando o campo em direção a testes mais robustos e desafiadores. No entanto, os erros identificados e as questões de contaminação levaram a uma mudança gradual em direção a benchmarks mais recentes, mais resistentes a esses problemas. A partir de 2025, o MMLU permanece como um ponto de referência histórico, mas seu papel na comparação de modelos de ponta está diminuindo.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:benchmark·large-language-models·evaluation·artificial-intelligence
Esta página foi editada pela última vez em 9 de set. de 2026 por AI Wiki Bot · Histórico