METEOR (Metric for Evaluation of Translation with Explicit ORdering) é uma métrica para avaliar a qualidade da saída de tradução automática. Ela calcula uma pontuação com base na média harmônica da precisão e revocação de unigramas, com a revocação ponderada mais fortemente do que a precisão, e incorpora correspondência por radicalização e sinonímia, além da correspondência exata de palavras. A métrica foi desenvolvida para abordar limitações na métrica BLEU e para produzir uma correlação mais forte com o julgamento humano no nível de frase ou segmento, enquanto a BLEU visa correlação no nível de corpus.
A métrica foi introduzida no Workshop on Intrinsic and Extrinsic Evaluation Measures for Machine Translation and Summarization, realizado na 43ª Reunião Anual da Association for Computational Linguistics em Ann Arbor, Michigan, em junho de 2005. Os resultados relatados mostraram correlação com o julgamento humano de até 0,964 no nível de corpus, em comparação com 0,817 da BLEU nos mesmos conjuntos de dados. No nível de frase, a correlação máxima relatada foi de 0,403. O nome da métrica é um acrônimo recursivo que significa Metric for Evaluation of Translation with Explicit ORdering.
Motivação e design
A METEOR foi desenvolvida em parte em resposta às limitações da métrica BLEU anterior, que se tornara um padrão para a avaliação de tradução automática. A BLEU opera principalmente no nível de corpus e depende de correspondência exata de palavras com precisão limitada de n-gramas. Ela mostrou correlação fraca com o julgamento humano quando aplicada a frases individuais. A METEOR abordou essas deficiências ponderando a revocação mais fortemente do que a precisão (uma proporção de 9 para 1 na média harmônica), incorporando recursos linguísticos para correspondência além das formas superficiais exatas e produzindo pontuações que poderiam ser comparadas de forma significativa no nível de segmento.
O procedimento de pontuação começa com uma etapa de alinhamento. O algoritmo constrói mapeamentos entre unigramas na tradução candidata e unigramas em uma tradução de referência. Cada unigrama no candidato pode mapear para no máximo um unigrama na referência. Quando múltiplos alinhamentos são possíveis com o mesmo número de mapeamentos, o algoritmo prefere o alinhamento com menos cruzamentos entre as linhas de mapeamento, o que favorece correspondências monotônicas e contíguas.
Etapas de correspondência
A METEOR aplica correspondência em várias etapas. A primeira etapa usa correspondência exata de palavras. Etapas subsequentes adicionam correspondências com base em radicalização e sinonímia, utilizando recursos como o WordNet para o inglês. Cada etapa adiciona apenas unigramas ainda não correspondidos em etapas anteriores. Essa abordagem em etapas permite que a métrica credite expressões semanticamente equivalentes, mas lexicalmente diferentes, uma capacidade que métricas anteriores não possuíam.
Após o alinhamento, a precisão e a revocação são calculadas a partir do número de unigramas correspondidos. A revocação é ponderada mais fortemente do que a precisão na pontuação final F-mean, usando a fórmula 10PR/(R+9P). Essa ponderação reflete descobertas de que a revocação correlaciona-se mais fortemente com o julgamento humano na qualidade da tradução. A pontuação final é ajustada por uma penalidade de fragmentação derivada do número de blocos de unigramas correspondidos; correspondências contíguas mais longas produzem menos blocos e uma penalidade menor.
Visão geral do algoritmo
O algoritmo opera em um par de frases: uma tradução candidata e uma tradução de referência. Ele constrói um alinhamento mapeando unigramas sob restrições, favorecendo alinhamentos com menos cruzamentos. A correspondência prossegue em etapas, onde cada etapa adiciona correspondências com base em formas exatas de palavras, depois radicais, depois sinônimos. Após o alinhamento, a precisão de unigramas é o número de unigramas correspondidos dividido pelo total de unigramas no candidato, enquanto a revocação divide pelo total de unigramas na referência. Esses valores são combinados como uma média harmônica com a revocação ponderada nove vezes mais do que a precisão. Uma penalidade é então aplicada com base em quão fragmentados os unigramas correspondidos estão em blocos contíguos; traduções com muitas correspondências não adjacentes recebem uma penalidade maior, reduzindo a pontuação final em até 50 por cento.
Para um corpus, valores agregados de precisão, revocação e penalidade são calculados em todos os segmentos. Quando múltiplas traduções de referência estão disponíveis, o candidato é pontuado contra cada uma e a pontuação mais alta é mantida.
Comparação com a BLEU
A BLEU, introduzida anteriormente, mede a sobreposição de n-gramas com uma penalidade de brevidade e é amplamente usada na pesquisa de tradução automática. No entanto, ela depende de correspondência exata de palavras e não leva em conta sinônimos ou variantes morfológicas. A METEOR foi projetada para superar esses problemas usando radicalização e mapeamento de sinônimos, e ponderando a revocação mais fortemente. Experimentos relatados indicaram que a METEOR alcançou uma correlação com o julgamento humano de até 0,964 no nível de corpus, enquanto a BLEU alcançou 0,817 nos mesmos dados. No nível de segmento, a METEOR mostrou uma correlação máxima de 0,403, que proponentes argumentaram ser mais adequada para avaliar frases individuais.
Detalhes do algoritmo
O processo de alinhamento na METEOR mapeia unigramas da tradução candidata para unigramas na referência, com cada unigrama candidato mapeando para no máximo um unigrama de referência. O algoritmo seleciona o alinhamento com o maior número de mapeamentos; quando dois alinhamentos têm o mesmo número de mapeamentos, ele escolhe aquele com menos linhas de cruzamento entre unigramas correspondidos. A correspondência prossegue em etapas: primeiro correspondências exatas de palavras, depois correspondências de radicais (usando uma ferramenta de radicalização), depois correspondências de sinônimos. Cada etapa adiciona apenas mapeamentos para unigramas ainda não correspondidos em etapas anteriores.
Após o alinhamento final ser calculado, a precisão P e a revocação R são calculadas. A média harmônica Fmean é definida como 10PR/(R+9P), dando à revocação nove vezes o peso da precisão. Para levar em conta a fluência e a ordem das palavras, o algoritmo agrupa unigramas correspondidos no menor número possível de blocos, onde um bloco é um conjunto de unigramas que são adjacentes tanto no candidato quanto na referência. A penalidade p é calculada como 0,5 × (c/um)^3, onde c é o número de blocos e um é o número de unigramas mapeados. A pontuação final do segmento é Fmean multiplicado por (1 - p).
Aplicações e extensões
A METEOR tem sido usada em campanhas de avaliação para tradução automática, particularmente em tarefas compartilhadas e comparações de sistemas onde a confiabilidade no nível de frase importa. Como pode ser aplicada no nível de segmento, é útil para ajustar e analisar saídas de tradução de maneiras que métricas no nível de corpus não suportam facilmente. Variantes e extensões surgiram ao longo do tempo, incluindo versões adaptadas para diferentes pares de idiomas e para avaliação de sumarização. A métrica também influenciou abordagens de avaliação subsequentes em campos relacionados, como legendagem de imagens, onde correspondência por sinônimos e sobreposição de n-gramas provaram ser úteis.
Limitações
A métrica ainda depende de traduções de referência e não captura aspectos da qualidade da tradução, como fluência, além do que é implícito pela sobreposição lexical. Sua dependência de recursos de sinônimos predefinidos pode limitar o desempenho para terminologia específica de domínio ou idiomas que carecem de tais recursos. Embora a correlação com o julgamento humano no nível de corpus tenha sido relatada como alta em experimentos iniciais, a correlação no nível de frase permaneceu moderada, refletindo a dificuldade inerente da avaliação automatizada no nível de segmento. Variantes posteriores e métricas alternativas continuaram a construir sobre essas ideias.