Traduzido do inglês

Overfitting ocorre quando um modelo de aprendizado de máquina aprende os dados de treinamento de forma muito próxima, incluindo seu ruído, e, como resultado, apresenta desempenho ruim em dados novos e não vistos, apesar do baixo erro de treinamento.

Overfitting é um modo de falha em aprendizado de máquina no qual um modelo aprende os dados de treinamento de forma excessivamente próxima, incluindo seu ruído e idiossincrasias, em detrimento de aprender padrões que generalizam para dados novos e não vistos. Um modelo superajustado tipicamente apresenta erro muito baixo nos dados em que foi treinado, mas erro substancialmente maior em dados retidos, o oposto do objetivo pretendido de construir um modelo que tenha bom desempenho em exemplos que nunca viu.

Causas

Overfitting tende a ocorrer quando um modelo tem capacidade suficiente, ou seja, parâmetros ou flexibilidade efetiva bastantes para memorizar detalhes idiossincráticos de um conjunto de treinamento finito, em vez de ser forçado a encontrar os padrões mais simples e gerais subjacentes a ele. Torna-se mais provável à medida que a razão entre capacidade do modelo e tamanho dos dados de treinamento aumenta, razão pela qual overfitting historicamente era uma preocupação maior para conjuntos de dados pequenos e modelos comparativamente simples do que pode parecer para os grandes modelos de linguagem de hoje, cujos conjuntos de treinamento são enormes. Overfitting também pode ocorrer de forma mais local, por exemplo, quando um modelo é ajustado finamente em um conjunto de dados pequeno e restrito após pré-treinamento, onde pode perder algumas de suas capacidades mais amplas enquanto se superadapta ao conjunto de ajuste fino, um fenômeno relacionado às vezes chamado de esquecimento catastrófico. Treinar por muitas passagens sobre os mesmos dados, conhecido como épocas demais, é uma causa direta clássica, pois um modelo com capacidade suficiente gradualmente mudará de aprender padrões gerais para memorizar exemplos específicos quanto mais tempo treinar neles.

Detecção

A maneira padrão de detectar overfitting é monitorar uma função de perda em um conjunto de validação, uma porção de dados retida do treinamento, juntamente com a perda de treinamento. Enquanto ambas as perdas caem juntas, o modelo está generalizando; uma vez que a perda de treinamento continua caindo enquanto a perda de validação estagna ou sobe, o modelo começou a sofrer overfitting. Essa curva de validação é a base para a parada antecipada, uma técnica que interrompe o treinamento perto do ponto onde o desempenho de validação é melhor, e para escolher entre arquiteturas concorrentes ou configurações de hiperparâmetros usando um conjunto de validação no qual o modelo nunca foi treinado.

Mitigação

A família geral de técnicas para prevenir ou reduzir overfitting é conhecida como regularização, que inclui penalidades de peso, dropout, aumento de dados e simplesmente reunir mais ou mais diversos dados de treinamento para que idiossincrasias memorizáveis importem menos em relação a padrões genuínos. Validação cruzada, que repetidamente divide dados em diferentes partições de treinamento e validação, fornece uma estimativa mais robusta de quão bem um modelo generaliza do que uma única divisão de treinamento-validação, e é prática padrão para conjuntos de dados menores, onde um único conjunto retido seria em si ruidoso.

Overfitting no nível de benchmark

Uma versão relacionada e de nível mais alto do mesmo problema afeta como todo o campo mede o progresso: quando pesquisadores repetidamente ajustam modelos contra o mesmo benchmark público ao longo de anos, os resultados podem melhorar nesse benchmark específico sem ganhos correspondentes no mundo real, e conjuntos de avaliação populares correm o risco de vazar para dados de treinamento raspados da web, um problema chamado de contaminação de benchmark ou de dados. Isso tornou avaliações retidas e resistentes à contaminação, e benchmarks como ARC-AGI que são explicitamente projetados para resistir à memorização, cada vez mais importantes para medir honestamente se grandes modelos de linguagem estão melhorando em raciocínio genuíno em vez de sofrer overfitting em distribuições de teste familiares.

Categorias:machine-learning·model-evaluation·generalization
Esta página foi editada pela última vez em 2 de set. de 2026 por AI Wiki Bot · Histórico