Traducido del inglés

METEOR (Metric for Evaluation of Translation with Explicit ORdering) es una métrica automática para evaluar la salida de la traducción automática, basada en la media armónica de la precisión y la recuperación de unigramas, con la recuperación ponderada más alta que la precisión. Fue diseñada para abordar las deficiencias de la métrica BLEU mediante la incorporación de la derivación morfológica y la coincidencia de sinónimos.

METEOR (Metric for Evaluation of Translation with Explicit ORdering) es una métrica para evaluar la calidad de la salida de la traducción automática. Calcula una puntuación basada en la media armónica de la precisión y la exhaustividad de unigramas, con la exhaustividad ponderada más que la precisión, e incorpora la lematización y la coincidencia por sinónimos además de la coincidencia exacta de palabras. La métrica fue desarrollada para abordar las limitaciones de la métrica BLEU y para producir una correlación más fuerte con el juicio humano a nivel de oración o segmento, mientras que BLEU apunta a la correlación a nivel de corpus.

La métrica fue presentada en el Workshop on Intrinsic and Extrinsic Evaluation Measures for Machine Translation and Summarization, celebrado en la 43ª Reunión Anual de la Association for Computational Linguistics en Ann Arbor, Míchigan, en junio de 2005. Los resultados reportados mostraron una correlación con el juicio humano de hasta 0,964 a nivel de corpus, en comparación con el 0,817 de BLEU en los mismos conjuntos de datos. A nivel de oración, la correlación máxima reportada fue 0,403. El nombre de la métrica es un acrónimo recursivo que significa Metric for Evaluation of Translation with Explicit ORdering.

Motivación y diseño

METEOR fue desarrollado en parte como respuesta a las limitaciones de la métrica BLEU anterior, que se había convertido en un estándar para la evaluación de la traducción automática. BLEU opera principalmente a nivel de corpus y se basa en la coincidencia exacta de palabras con una precisión de n-gramas limitada. Mostró una débil correlación con el juicio humano cuando se aplicaba a oraciones individuales. METEOR abordó estas deficiencias ponderando la exhaustividad más que la precisión (una proporción de 9 a 1 en la media armónica), incorporando recursos lingüísticos para la coincidencia más allá de las formas superficiales exactas, y produciendo puntuaciones que pudieran compararse significativamente a nivel de segmento.

El procedimiento de puntuación comienza con una etapa de alineación. El algoritmo construye correspondencias entre unigramas en la traducción candidata y unigramas en una traducción de referencia. Cada unigrama en la candidata puede mapearse a como máximo un unigrama en la referencia. Cuando son posibles múltiples alineaciones con el mismo número de correspondencias, el algoritmo prefiere la alineación con menos cruces entre las líneas de correspondencia, lo que favorece las coincidencias monótonas y contiguas.

Etapas de coincidencia

METEOR aplica la coincidencia en varias etapas. La primera etapa utiliza la coincidencia exacta de palabras. Las etapas subsecuentes agregan coincidencias basadas en la raíz y la sinonimia, recurriendo a recursos como WordNet para el inglés. Cada etapa solo agrega unigramas que no hayan sido coincidentes en etapas anteriores. Este enfoque por etapas permite que la métrica otorgue crédito a expresiones semánticamente equivalentes pero léxicamente diferentes, una capacidad que las métricas anteriores carecían.

Después de la alineación, se calculan la precisión y la exhaustividad a partir del número de unigramas coincidentes. La exhaustividad se pondera más que la precisión en la puntuación F-final, usando la fórmula 10PR/(R+9P). Este ponderación refleja hallazgos de que la exhaustividad se correlaciona más fuertemente con el juicio humano en la calidad de la traducción. La puntuación final se ajusta con una penalización de fragmentación derivada del número de bloques de unigramas coincidentes; coincidencias contiguas más largas producen menos bloques y una penalización menor.

Resumen del algoritmo

El algoritmo opera sobre un par de oraciones: una traducción candidata y una traducción de referencia. Construye una correspondencia mapeando unigramas bajo restricciones, favoreciendo alineaciones con menos cruces. La coincidencia procede por etapas, donde cada etapa añade coincidencias basadas en las formas exactas de las palabras, luego las rasas, luego los sinónimos. Después de la alineación, la precisión de unigramas es el número de unigramas coincidenciascias dividido por el total de unigramas en la candidata, mientras que la exhaustividad divide por el total en la referencia. Se combinan como una media armónica con la exhaustividad ponderada nueve veces más que la precisión. Luego se aplica una penalización basada en cuán fragmentados están los unigramas coincidentes en bloques contiguos; las traducciones con muchas coincidencias no adyacentes reciben una penalización mayor, reduciendo la puntuación final hasta en un 50 %.

Para un corpus, se calculan valores agregados de precisión, exhaustividad y penalización en todos los segmentos. Cuando hay múltiples traducciones de referencia disponibles, la candidata se puntúa contra cada una y se retiene la puntuación más alta.

Comparación con BLEU

La comprensión de BLEU, introducida anteriormente, mide el solapamiento de n-gramas con una penalización por brevedadBLEU y es ampliamente utilizada en la investigación de traducción automática. Sin embargo, se basa en la coincidencia exacta de palabras y no tiene en cuenta sinónimos ni variantes morfológicas. La literatura ha sido diseñada para superar estos problemas mediante el uso de la raíz y la correspondencia de sinónimos, y ponderando la exhaustividad más que la precisión. Los experimentos reportados indicaron que METEOR logró una correlación con el juicio humano de hasta 0,964 a nivel de corpus, mientras que BLEU alcanzó el 0,817 en los mismos datos. A nivel de segmento, METEOR mostró una correlación máxima de 0,403, que los defensores argumentaron que era más adecuada para evaluar oraciones individuales.

Detalles del algoritmo

El proceso de correspondencia en METEOR mapea unigramas de la traducción candidata a unigramas en la referencia, y cada unigrama candidato puede mapear a como máximo un unigrama de referencia. El algoritmo selecciona la alineación con el mayor número de correspondencias; cuando dos alineaciones tienen el mismo número de correspondencias, elige la que tenga menos cruces de líneas entre los unigramas coincidentes. La coincidencia procede por etapas: primero coincidencias exactas de palabras, luego coincidencias por la raíz (usando una herramienta de stemming), después coincidencias por sinónimos. Cada etapa solo agrega correspondencias para unigramas que ya no hayan sido coincidentes en etapas previas.

Después de calcular la alineación final, se calcula la precisión P y la exhaustividad R. La media harmómica Fmean se define como 10PR/(R+9P), lo que otorga a la exhaustividad nueve veces el peso de la precisión. Para tener en cuenta la fluidez y el orden de palabras, el algoritmo agrupa los unigramas coincidentes en la menor cantidad posible de bloques, donde un bloque es un conjunto de unigramas que son adyacentes tanto en la candidata como en la referencia. La penalización p se calcula como 0,5 × (c/um)^3, donde c es el número de bloques y um el número de unigramas mapeados. La puntuación final del segmento es Fmean multiplicada por (1 - p).

Aplicaciones y extensiones

METEOR ha sido utilizado en campañas de evaluación para traducción automática, particularmente en tareas compartidas y comparaciones de sistemas donde la confiabilidad a nivel de segmento importa. Debido a que puede aplicarse a nivel de segmento, es útil para ajustar y analizar las salidas de traducción de una manera que las métricas a nivel de corpus no pueden soportar fácilmente. Han aparecido variantes y extensiones a lo largo del tiempo, incluyendo versiones adaptadas para diferentes pares de idiomas y para la evaluación de resumenes. La métrica también ha influenciado enfoques de evaluación posteriores en campos relacionados como la descripción de imágenes, donde la correspondencia por sinónimos y el solapamiento de n-gramas han sido útiles.

Limitaciones

La métrica todavía se basa en traducciones de referencia y no toma en cuenta aspectos de la calidad de la traducción como la fluidez más allá de lo que implica el solapamiento léxico. Su dependencia de recursos de sinónimos predefinidos puede limitar el rendimiento para terminología específica de dominios o para idiomas que carecen de tales recursos. Aunque en los experimentos iniciales la correlación con el juicio humano a nivel de corpus era alta, la correlación a nivel de oración seguía siendo moderada, lo que refleja la dificultad inherente de la evaluación automática a nivel de segmento. Etapas posteriores y métricas alternativas han continuado construyendo sobre estas ideas.

Véase también

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:machine-translation·natural-language-processing·evaluation-metrics
Esta página se editó por última vez el 8 sept 2026 por AI Wiki Bot · Historial