Puntuación ROUGE

Traducido del inglés

ROUGE (Recall-Oriented Understudy for Gisting Evaluation) es un conjunto de métricas y software para evaluar la summarización automática y la traducción automática, comparando la salida del sistema con referencias humanas y puntuando la similitud de 0 a 1.

ROUGE, o Recuerdo-Orientado Substituto para la Evaluación de Resúmenes, es un conjunto de métricas y un paquete de software utilizado para evaluar software de resumen automático y traducción automática en el procesamiento del lenguaje natural. Las métricas comparan un resumen o traducción producido automáticamente contra una referencia o un conjunto de referencias (producidas por humanos) de resumen o traducción. Las métricas ROUGE varían entre 0 y 1, donde puntuaciones más altas indican una mayor similitud entre el resumen producido automáticamente y la referencia.

ROUGE fue introducido a principios de la década de 2000 como respuesta a la creciente necesidad de evaluación automatizada en el resumen de textos, un campo que anteriormente dependía en gran medida del juicio humano. Se convirtió en una herramienta estándar en la comunidad investigadora, particularmente tras su adopción en la Conferencia de Comprensión de Documentos (DUC) y posteriormente en la Conferencia de Análisis de Textos (TAC), organizadas por el Instituto Nacional de Estándares y Tecnología (NIST). El nombre en sí es una referencia lúdica a la métrica BLEU, utilizada para la evaluación de traducción automática; BLEU significa Substituto de Evaluación Bilingüe, y ROUGE reemplaza la 'B' con 'R' para enfatizar la evaluación orientada al recuerdo.

La idea central detrás de ROUGE es medir la superposición de unidades léxicas entre un texto candidato y uno o más textos de referencia. Esta superposición se calcula típicamente usando n-gramas, que son secuencias contiguas de n palabras, u otros patrones estructurales como subsecuencias comunes más largas. Al centrarse en el recuerdo, ROUGE evalúa cuánto del contenido de referencia es capturado por la salida del sistema, lo cual es particularmente relevante para el resumen, donde el objetivo es incluir información clave de la fuente.

ROUGE-N

ROUGE-N es la variante más básica, que mide la superposición de n-gramas entre los resúmenes del sistema y de referencia. La métrica se calcula como el número de n-gramas coincidentes dividido por el número total de n-gramas en la referencia. Por ejemplo, ROUGE-1 se refiere a la superposición de unigramas (cada palabra) entre los resúmenes del sistema y de referencia, mientras que ROUGE-2 se refiere a la superposición de bigramas (pares de palabras consecutivas).

ROUGE-1 se utiliza a menudo como un proxy para la cobertura de contenido, ya que captura la presencia de palabras individuales. Sin embargo, puede ser manipulado incluyendo muchas palabras comunes, por lo que ROUGE-2 se prefiere frecuentemente para tareas donde el orden de las palabras importa. En la práctica, ROUGE-1 y ROUGE-2 son las variantes más comúnmente reportadas en artículos de investigación, a menudo junto con ROUGE-L.

La fórmula para ROUGE-N es sencilla: para un n dado, la puntuación es la relación entre el recuento de n-gramas que aparecen tanto en el resumen del sistema como en el resumen de referencia y el recuento de n-gramas en el resumen de referencia. Cuando se utilizan múltiples referencias, la puntuación se calcula típicamente como el máximo sobre todas las referencias, o a veces el promedio, dependiendo de la implementación específica.

ROUGE-L

ROUGE-L utiliza la Subsecuencia Común Más Larga (LCS) entre los resúmenes del sistema y de referencia. La LCS es la secuencia más larga de palabras que aparece en el mismo orden en ambos textos, aunque no necesariamente de forma contigua. Este enfoque tiene en cuenta naturalmente la similitud estructural a nivel de oración, ya que identifica automáticamente los n-gramas co-ocurrentes en secuencia más largos.

A diferencia de ROUGE-N, que requiere coincidencias exactas de n-gramas, ROUGE-L es más flexible porque permite espacios entre palabras coincidentes. Esto lo hace particularmente útil para evaluar resúmenes que parafrasean contenido mientras preservan el orden general de las ideas. La puntuación basada en LCS se calcula usando un algoritmo de programación dinámica, y puede aplicarse a nivel de oración o de resumen.

Una limitación de ROUGE-L es que trata todas las coincidencias LCS por igual, independientemente de si son contiguas. Esto puede llevar a situaciones donde un resumen con coincidencias dispersas obtiene una puntuación más alta que uno con pocas coincidencias contiguas, incluso si este último es más coherente. Para abordar esto, se desarrolló la variante ponderada ROUGE-W.

ROUGE-W

ROUGE-W es una estadística basada en LCS ponderada que favorece las LCS consecutivas. La idea es asignar pesos más altos a las coincidencias que aparecen de forma contigua en el texto, ya que es más probable que reflejen una superposición significativa a nivel de frase. El peso está controlado por un parámetro que ajusta la penalización para coincidencias no contiguas.

En la práctica, ROUGE-W se utiliza con menos frecuencia que ROUGE-L, pero puede ser útil en escenarios donde el evaluador quiere enfatizar la fluidez o la coherencia local. La implementación requiere un ajuste cuidadoso del parámetro de ponderación, que a menudo se establece empíricamente según la tarea específica.

El enfoque ponderado ayuda a mitigar el problema donde un resumen del sistema que coincide con palabras dispersas a lo largo de la referencia podría recibir una puntuación LCS alta a pesar de estar mal estructurado. Al recompensar la contigüidad, ROUGE-W proporciona una medida más matizada de la similitud.

ROUGE-S y ROUGE-SU

ROUGE-S mide estadísticas de co-ocurrencia basadas en skip-bigramas. Un skip-bigrama es cualquier par de palabras en su orden de oración, permitiendo espacios entre las dos palabras. Esto es similar a ROUGE-2 pero más flexible, ya que no requiere que los bigramas sean contiguos. Por ejemplo, en la oración 'el gato se sentó en la alfombra', los skip-bigramas incluyen 'el gato', 'el se', 'el en', 'gato se', y así sucesivamente.

ROUGE-SU extiende ROUGE-S añadiendo estadísticas de co-ocurrencia basadas en unigramas. Esta combinación permite que la métrica capture tanto la cobertura de palabras individuales como las relaciones por pares. La 'U' significa unigrama, y la inclusión de unigramas ayuda a evitar problemas donde un resumen del sistema podría tener una alta superposición de skip-bigramas pero omitir palabras individuales importantes.

Tanto ROUGE-S como ROUGE-SU son más intensivos computacionalmente que ROUGE-N, ya que requieren enumerar todos los skip-bigramas posibles. Sin embargo, proporcionan una representación más rica de la estructura del texto, haciéndolos adecuados para evaluar resúmenes que utilizan frases variadas.

Implementación y Uso

El paquete de software ROUGE está implementado en Perl y fue desarrollado originalmente por Chin-Yew Lin en el Instituto de Ciencias de la Información de la Universidad del Sur de California. El paquete incluye scripts para calcular las cinco métricas, junto con opciones para manejar múltiples referencias, derivación (stemming) y eliminación de palabras vacías. También está disponible una implementación en Java, que a menudo se utiliza en sistemas de producción debido a su rendimiento.

Para usar ROUGE, los investigadores típicamente preparan un conjunto de resúmenes de referencia, a menudo creados por múltiples anotadores humanos para capturar diferentes resúmenes válidos. El resumen generado por el sistema se compara entonces contra cada referencia, y la puntuación final suele ser el máximo o el promedio entre las referencias. La elección entre máximo y promedio depende del protocolo de evaluación; por ejemplo, las tareas DUC a menudo utilizan el máximo para recompensar la captura de cualquiera de los contenidos de referencia posibles.

ROUGE se ha convertido en un estándar de facto en la investigación de resúmenes, con la mayoría de los artículos reportando puntuaciones ROUGE-1, ROUGE-2 y ROUGE-L. También se utiliza en la evaluación de traducción automática, aunque de forma menos prominente que BLEU, que se centra en la precisión en lugar del recuerdo. La métrica está ampliamente implementada en bibliotecas como evaluate de Hugging Face y el paquete nlg-eval, haciéndola accesible para los profesionales.

Limitaciones y Críticas

A pesar de su uso generalizado, ROUGE tiene varias limitaciones conocidas. Se basa puramente en la superposición léxica, por lo que no puede capturar la equivalencia semántica. Por ejemplo, un resumen que utiliza sinónimos o paráfrasis puede obtener una puntuación más baja que uno que copia frases exactas de la referencia, incluso si el primero es más natural. Esto ha llevado a críticas de que ROUGE fomenta el resumen extractivo sobre los enfoques abstractivos.

Otro problema es que las puntuaciones ROUGE pueden inflarse incluyendo palabras comunes o copiando grandes porciones de la referencia. Los investigadores han propuesto variantes y alternativas, como BERTScore, que utiliza incrustaciones contextuales de modelos transformadores para medir la similitud semántica. Sin embargo, ROUGE sigue siendo popular debido a su simplicidad, interpretabilidad y bajo costo computacional.

En la era de los grandes modelos de lenguaje, ROUGE todavía se utiliza como métrica de referencia, pero a menudo se complementa con evaluación humana u otras métricas automatizadas. El enfoque de la métrica en el recuerdo la hace particularmente adecuada para tareas donde la completitud es importante, como el resumen de noticias, pero menos para la generación creativa o abierta.

Véase También

ROUGE es parte de una familia más amplia de métricas de evaluación en el procesamiento del lenguaje natural. Las métricas relacionadas incluyen BLEU, que mide la precisión en la traducción automática, y METEOR, que incorpora coincidencia de sinónimos y derivación. La Medida-F, que combina precisión y recuerdo, también es relevante, al igual que la métrica NIST, una variante de BLEU con coincidencias de n-gramas ponderadas. Otros conceptos relacionados incluyen el fragmentado de frases nominales y la tasa de error de palabras (WER), utilizada en el reconocimiento de voz.

En el contexto de Machine learning y Deep learning, ROUGE se utiliza a menudo para evaluar sistemas de resumen basados en Neural network, incluidos aquellos basados en arquitecturas Transformer (architecture) y Large language models. La métrica ha sido aplicada en investigaciones de instituciones como MIT CSAIL y Stanford AI Lab, y sigue siendo una herramienta clave en el espacio de Generative AI.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:natural-language-processing·evaluation-metrics·text-summarization·machine-translation
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial