Uma curva de precisão-recall é uma representação gráfica usada em classificação para avaliar o desempenho de um modelo, plotando a precisão (valor preditivo positivo) no eixo y contra o recall (sensibilidade) no eixo x para vários limiares de decisão. Cada ponto na curva corresponde a uma configuração específica de limiar, mostrando como a precisão e o recall mudam conforme o limiar é ajustado. A curva é particularmente útil para conjuntos de dados desbalanceados, onde uma classe é rara, pois foca no desempenho da classe positiva em vez dos verdadeiros negativos.
Precisão é definida como a fração de instâncias relevantes entre as instâncias recuperadas, ou equivalentemente, o número de verdadeiros positivos dividido pela soma de verdadeiros positivos e falsos positivos. Recall é a fração de instâncias relevantes que foram recuperadas, ou o número de verdadeiros positivos dividido pela soma de verdadeiros positivos e falsos negativos. Em uma tarefa de classificação, um classificador perfeito teria precisão e recall iguais a 1,0, produzindo uma curva que passa pelo canto superior direito. No entanto, na prática, há frequentemente uma relação inversa: aumentar o recall tende a diminuir a precisão, e vice-versa. Uma curva de precisão-recall tipicamente inclina-se para baixo, de uma alta precisão em baixo recall para uma menor precisão em alto recall, embora a forma exata dependa do modelo e dos dados.
Relação com Erros Tipo I e Tipo II
Precisão e recall estão intimamente ligados aos conceitos de teste de hipóteses. Recall é o complemento da taxa de erro tipo II (taxa de falso negativo), o que significa que alto recall corresponde a poucas instâncias positivas perdidas. Precisão está relacionada à taxa de erro tipo I (taxa de falso positivo), mas também depende da distribuição prévia de instâncias positivas e negativas. Por exemplo, em um conjunto de dados com dez gatos e doze cães, um programa de reconhecimento de cães que identifica oito cães, dos quais cinco são cães reais, tem uma precisão de 5/8 e um recall de 5/12. A taxa de erro tipo I é 3/10 (três falsos positivos entre dez gatos), e a taxa de erro tipo II é 7/12 (sete falsos negativos entre doze cães). Precisão pode ser vista como uma medida de qualidade (quantos itens selecionados são relevantes), enquanto recall é uma medida de quantidade (quantos itens relevantes são selecionados).
Compensações e Exemplos Práticos
A compensação entre precisão e recall é frequentemente dependente do contexto. Por exemplo, um detector de fumaça é projetado para priorizar o recall, porque o custo de perder um incêndio (um falso negativo) é catastrófico, mesmo que isso signifique muitos alarmes falsos (baixa precisão). Por outro lado, o sistema de justiça criminal, guiado pela proporção de Blackstone - "É melhor que dez pessoas culpadas escapem do que um inocente sofra" - prioriza a precisão, aceitando menor recall para evitar condenar pessoas inocentes. Um neurocirurgião removendo um tumor enfrenta um dilema semelhante: remover uma área maior aumenta o recall (garantindo que todas as células cancerígenas sejam removidas), mas reduz a precisão (removendo tecido saudável), enquanto uma abordagem conservadora aumenta a precisão, mas arrisca deixar células cancerígenas para trás.
Construção e Interpretação
Para construir uma curva de precisão-recall, um modelo gera uma pontuação ou probabilidade para cada instância. Ao variar o limiar acima do qual uma instância é classificada como positiva, obtêm-se diferentes pares de valores de precisão e recall. Esses pares são plotados como uma curva. A área sob a curva de precisão-recall (PR-AUC) é um resumo de número único da curva, com valores mais altos indicando melhor desempenho geral. Um classificador aleatório tipicamente produz uma curva que é uma linha horizontal na proporção de instâncias positivas no conjunto de dados, então a PR-AUC para um modelo útil deve estar acima dessa linha de base. A curva é especialmente informativa quando a classe positiva é rara, pois a matriz de confusão sozinha pode ser enganosa.
Uso em Aprendizado de Máquina
Curvas de precisão-recall são amplamente usadas em aprendizado de máquina e inteligência artificial para avaliar classificadores binários, particularmente em domínios como recuperação de informação, diagnóstico médico e detecção de fraude. Elas são frequentemente comparadas a curvas ROC (característica de operação do receptor), que plotam a taxa de verdadeiros positivos contra a taxa de falsos positivos. Ao contrário das curvas ROC, as curvas de precisão-recall não incluem verdadeiros negativos, tornando-as mais sensíveis ao desempenho na classe positiva. Muitos frameworks de redes neurais e aprendizado profundo fornecem funções integradas para calcular e plotar curvas de precisão-recall, facilitando a seleção de modelos e o ajuste de limiares. Por exemplo, em tarefas de processamento de linguagem natural como classificação de documentos, uma curva de precisão-recall pode ajudar a equilibrar a recuperação de documentos relevantes contra a inclusão de documentos irrelevantes.
Limitações e Considerações
Curvas de precisão-recall têm limitações. Elas são sensíveis ao desbalanceamento de classes, e um modelo com alta precisão e recall em um conjunto de dados balanceado pode ter desempenho ruim em um desbalanceado. Além disso, a curva não transmite o número absoluto de instâncias, então comparar curvas entre diferentes conjuntos de dados pode ser enganoso. Também é possível alcançar recall perfeito recuperando todas as instâncias, mas tal modelo teria baixa precisão. Por outro lado, precisão perfeita pode ser alcançada selecionando apenas as instâncias mais confiantes, mas o recall seria baixo. Portanto, precisão e recall raramente são discutidos isoladamente; em vez disso, a curva fornece uma visão abrangente da compensação, permitindo que profissionais escolham um limiar que se alinhe com as prioridades da aplicação.