ROUGE, ou Recall-Oriented Understudy for Gisting Evaluation, é um conjunto de métricas e um pacote de software usado para avaliar software de sumarização automática e tradução automática em processamento de linguagem natural. As métricas comparam um resumo ou tradução produzido automaticamente contra uma referência ou um conjunto de referências (resumos ou traduções produzidos por humanos). As métricas ROUGE variam entre 0 e 1, com pontuações mais altas indicando maior similaridade entre o resumo produzido automaticamente e a referência.
ROUGE foi introduzido no início dos anos 2000 como uma resposta à crescente necessidade de avaliação automatizada em sumarização de texto, um campo que anteriormente dependia fortemente de julgamento humano. Tornou-se uma ferramenta padrão na comunidade de pesquisa, particularmente após sua adoção na Conferência de Compreensão de Documentos (DUC) e posteriormente na Conferência de Análise de Texto (TAC), que são organizadas pelo Instituto Nacional de Padrões e Tecnologia(NIST).. O nome em si é uma referência lúdica à métrica BLEU, que é usada para avaliação de tradução automática; BLEU significa Bilingual Evaluation Understudy,e ROUGE substitui o 'B' por 'R' para enfatizar a avaliação orientada à recall.
A ideia central por trás de ROUGE é medir a sobreposição de unidades lexicais entre um texto candidato e uma ou mais referências. Essa sobreposição é tipicamente calculada usando n-gramas, que são sequências contíguas de n palavras, ou outros padrões estruturais como subsequências comuns mais longas. Ao focar em recall, ROUGE avalia quanto do conteúdo da referência é capturado pela saída do sistema, o que é particularmente relevante para sumarização onde o objetivo é incluir informações-chave da fonte.
Rouge-N
ROUGE-N é a variante mais básica, medindo a sobreposição de n-gramas entre o sistema e os resumos de referência. A métrica é calculada como o número de n-gramas correspondentes dividido pelo número total de n-gramas na referência. Por exemplo, ROUGE-1 refere-se à sobreposição de unigramas(cada palavra) entre o sistema e os resumos de referência, enquanto ROUGE-2 refere-se à sobreposição de bigramas(pares de palavras consecutivas.
ROUGE-1 é frequentemente usado como um proxy para cobertura de conteúdo, pois captura a presença de palavras individuais. No entanto, pode ser manipulado ao incluir muitas palavras comuns, então ROUGE-2 é frequentemente preferido para tarefas onde a ordem das palavras importa. Na prática, ROUGE-1 e ROUGE-2 são as variantes mais comumente relatadas em artigos de pesquisa, frequentemente junto com ROUGE-L.
A fórmula para ROUGE-N é direta:para um dado n, a pontuação é a razão entre a contagem de n-gramas que aparecem tanto no resumo do sistema quanto no resumo de referência e a contagem de n-gramas no resumo de referência. Quando múltiplas referências são usadas, a pontuação é tipicamente calculada como o máximo sobre todas as referências, ou às vezes a média, dependendo da implementação específica.
##Rouge-L
ROUGE-L usa a Subsequência Comum Mais Longa(LCS) entre o sistema e os resumos de referência. A LCS é a sequência mais longa de palavras que aparece na mesma ordem em ambos os textos, embora não necessariamente contígua. Essa abordagem naturalmente leva em conta a similaridade estrutural no nível da frase, pois identifica automaticamente os n-gramas co-ocorrentes em sequência mais longos.
Diferente de ROUGE-N, que requer correspondências exatas de n-gramas, ROUGE-L é mais flexível porque permite lacunas entre palavras correspondentes. Isso o torna particularmente útil para avaliar resumos que parafraseiam conteúdo enquanto preservam a ordem geral das ideias. A pontuação baseada em LCS é calculada usando um algoritmo de programação dinâmica, e pode ser aplicada no nível da frase ou no nível do resumo.
Uma limitação de ROUGE-L é que ele trata todas as correspondências LCS igualmente, independentemente de serem contíguas. Isso pode levar a situações onde um resumo com correspondências dispersas pontua mais alto do que um com poucas correspondências contíguas, mesmo se o último for mais coerente. Para abordar isso, a variante ponderada ROUGE-W foi desenvolvida.
##Rouge-W
ROUGE-W é uma estatística baseada em LCS ponderada que favorece LCSes consecutivas. A ideia é atribuir pesos mais altos a correspondências que aparecem contiguamente no texto, pois estas são mais prováveis de refletir sobreposição significativa no nível da frase. A ponderação é controlada por um parâmetro que ajusta a penalidade para correspondências não contíguas.
Na prática, ROUGE-W é menos comumente usado do que ROUGE-L, mas pode ser útil em cenários onde o avaliador quer enfatizar fluência ou coerência local. A implementação requer ajuste cuidadoso do parâmetro de ponderação, que é frequentemente definido empiricamente com base na tarefa específica.
A abordagem ponderada ajuda a mitigar o problema onde um resumo do sistema que corresponde a palavras dispersas pela referência pode receber uma pontuação LCS alta apesar de ser mal estruturado. Ao recompensar contiguidade, ROUGE-W fornece uma medida mais nuançada de similaridade.
##Rouge-S e Rouge-SU
ROUGE-S mede estatísticas de co-ocorrência baseadas em skip-bigramas. Um skip-bigrama é qualquer par de palavras em sua ordem na frase, permitindo lacunas entre as duas palavras. Isso é semelhante a ROUGE-2, mas mais flexível, pois não requer que os bigramas sejam contíguos. Por exemplo, na frase 'o gato sentou no tapete', skip-bigramas incluem ' gato', 'o sentou', 'o no', 'gato sentou',e assim por diante.
ROUGE-SU estende ROUGE-S ao adicionar estatísticas de co-ocorrência baseadas em unigramas. Essa combinação permite que a métrica capture tanto cobertura de palavras individuais quanto relações entre pares. O 'U' significa unigrama,e a inclusão de unigramas ajuda a evitar problemas onde um resumo do sistema pode ter alta sobreposição de skip-bigramas, mas perder palavras individuais importantes.
Tanto ROUGE-S quanto ROUGE-SU são mais computacionalmente intensivos do que ROUGE-N, pois requerem enumerar todos os skip-bigramas possíveis. No entanto, eles fornecem uma representação mais rica da estrutura do texto, tornando-os adequados para avaliar resumos que usam fraseado variado.
##Implementação e Uso
O pacote de software ROUGE é implementado em Perl e foi originalmente desenvolvido por Chin-Yew Lin no Instituto de Ciências da Informação da Universidade do Sul da Califórnia. O pacote inclui scripts para calcular todas as cinco métricas, junto com opções para lidar com múltiplas referências, stemming,e remoção de stop-words. Uma implementação em Java também está disponível, que é frequentemente usada em sistemas de produção devido ao seu desempenho.
Para usar ROUGE, pesquisadores tipicamente preparam um conjunto de resumos de referência, frequentemente criados por múltiplos anotadores humanos para capturar diferentes resumos válidos. O resumo gerado pelo sistema é então comparado contra cada referência,e a pontuação final é usualmente o máximo ou a média entre as referências. A escolha entre máximo e média depende do protocolo de avaliação;por exemplo, tarefas DUC frequentemente usam o máximo para recompensar a captura de qualquer um dos conteúdos de referência possíveis.
ROUGE tornou-se um padrão de facto na pesquisa de sumarização, com a maioria dos artigos relatando pontuações ROUGE-1, ROUGE-2,e ROUGE-L. Também é usado na avaliação de tradução automática, embora menos proeminentemente do que BLEU, que foca em precisão em vez de recall. A métrica é amplamente implementada em bibliotecas como Hugging Face's evaluate e o pacote nlg-eval, tornando-a acessível a praticantes.
##Limitações e Críticas
Apesar de seu uso generalizado, ROUGE tem várias limitações conhecidas. Ele depende puramente de sobreposição lexical, então não pode capturar equivalência semântica. Por exemplo, um resumo que usa sinônimos ou paráfrases pode pontuar mais baixo do que um que copia frases exatas da referência, mesmo se o primeiro for mais natural. Isso levou a críticas de que ROUGE encoraja sumarização extrativa em detrimento de abordagens abstrativas.
Outro problema é que pontuações ROUGE podem ser infladas ao incluir palavras comuns ou ao copiar grandes porções da referência. Pesquisadores propuseram variantes e alternativas, como BERTScore,que usa embeddings contextuais de modelos transformer para medir similaridade semântica. No entanto, ROUGE permanece popular devido à sua simplicidade, interpretabilidade,e baixo custo computacional.
Na era dos grandes modelos de linguagem, ROUGE ainda é usado como uma métrica de linha de base, mas é frequentemente suplementado com avaliação humana ou outras métricas automatizadas. O foco da métrica em recall a torna particularmente adequada para tarefas onde completude é importante, como sumarização de notícias, mas menos adequada para geração criativa ou aberta.
##Veja Também
ROUGE faz parte de uma família mais ampla de métricas de avaliação em processamento de linguagem natural. Métricas relacionadas incluem BLEU,que mede precisão em tradução automática,e METEOR,que incorpora correspondência de sinônimos e stemming. A F-Measure,que combina precisão e recall, também é relevante, assim como a métrica NIST,uma variante de BLEU com correspondências de n-gramas ponderadas. Outros conceitos relacionados incluem chunking de sintagmas nominais e taxa de erro de palavras(WER),que é usada em reconhecimento de fala.
No contexto de Machine learning e Deep learning, ROUGE é frequentemente usado para avaliar sistemas de sumarização baseados em Neural network, incluindo aqueles baseados em arquiteturas Transformer (architecture) e Large language models. A métrica foi aplicada em pesquisas de instituições como MIT CSAIL e Stanford AI Lab,e permanece uma ferramenta-chave no espaço de Generative AI.