अंग्रेज़ी से अनुवादित

ROUGE (Recall-Oriented Understudy for Gisting Evaluation) मेट्रिक्स और सॉफ्टवेयर का एक सेट है, जो स्वचालित सारांशीकरण और मशीन अनुवाद का मूल्यांकन करने के लिए उपयोग किया जाता है, जिसमें सिस्टम आउटपुट की तुलना मानव संदर्भों से की जाती है, और समानता को 0 से 1 के पैमाने पर स्कोर किया जाता है।

ROUGE,即面向摘要评估的召回导向型替身(Recall-Oriented Understudy for Gisting Evaluation),是一组用于评估自然语言处理中自动摘要和机器翻译软件的指标及软件包。这些指标将自动生成的摘要或翻译与一个或多个参考(人工生成的)摘要或翻译进行比较。ROUGE指标的取值范围在0到1之间,分数越高表示自动生成的摘要与参考摘要之间的相似度越高。

ROUGE于2000年代初推出,以应对文本摘要领域对自动化评估日益增长的需求,此前该领域严重依赖人工判断。它成为研究社区的标准工具,尤其是在被美国国家标准与技术研究院(NIST)组织的文档理解会议(DUC)及后来的文本分析会议(TAC)采用之后。该名称本身是对用于机器翻译评估的BLEU指标的戏仿;BLEU代表双语评估替身(Bilingual Evaluation Understudy),而ROUGE将‘B’替换为‘R’,以强调面向召回率的评估。

ROUGE的核心思想是衡量候选文本与一个或多个参考文本之间词汇单元的重叠程度。这种重叠通常通过n-gram(即n个连续单词的序列)或其他结构模式(如最长公共子序列)来计算。通过关注召回率,ROUGE评估系统输出捕获了多少参考内容,这对于摘要任务尤为重要,因为其目标是包含源文本中的关键信息。

ROUGE-N

ROUGE-N是最基本的变体,衡量系统摘要与参考摘要之间n-gram的重叠。该指标的计算方式为匹配的n-gram数量除以参考摘要中n-gram的总数。例如,ROUGE-1指系统摘要与参考摘要之间一元组(每个单词)的重叠,而ROUGE-2指二元组(连续单词对)的重叠。

ROUGE-1通常用作内容覆盖率的代理指标,因为它能捕获单个单词的存在。然而,它可能因包含大量常见单词而被操纵,因此在词序重要的任务中,ROUGE-2更受青睐。在实践中,ROUGE-1和ROUGE-2是研究论文中最常报告的变体,通常与ROUGE-L一起使用。

ROUGE-N的公式很简单:对于给定的n,分数是系统摘要和参考摘要中共同出现的n-gram数量与参考摘要中n-gram数量的比值。当使用多个参考时,分数通常计算为所有参考中的最大值,有时也取平均值,具体取决于实现方式。

ROUGE-L

ROUGE-L使用系统摘要与参考摘要之间的最长公共子序列(LCS)。LCS是两个文本中以相同顺序出现的最长单词序列,但不一定连续。这种方法自然考虑了句子级结构相似性,因为它自动识别最长的共现序列n-gram。

与需要精确n-gram匹配的ROUGE-N不同,ROUGE-L更灵活,因为它允许匹配单词之间存在间隔。这使得它特别适用于评估在保持整体思路顺序的同时进行改写的摘要。基于LCS的分数通过动态规划算法计算,可在句子级别或摘要级别应用。

ROUGE-L的一个局限性是它对所有LCS匹配一视同仁,无论是否连续。这可能导致包含分散匹配的摘要得分高于包含少数连续匹配的摘要,即使后者更连贯。为解决此问题,开发了加权变体ROUGE-W。

ROUGE-W

ROUGE-W是一种加权LCS统计量,偏向于连续的LCS。其思想是为文本中连续出现的匹配赋予更高权重,因为这些更可能反映有意义的短语级重叠。加权由一个参数控制,该参数调整对非连续匹配的惩罚。

在实践中,ROUGE-W的使用频率低于ROUGE-L,但在评估者希望强调流畅性或局部连贯性的场景中可能有用。实现需要仔细调整加权参数,通常根据具体任务凭经验设置。

加权方法有助于缓解系统摘要中匹配单词分散在参考中但结构不佳却可能获得高LCS分数的问题。通过奖励连续性,ROUGE-W提供了更细致的相似度衡量。

ROUGE-S和ROUGE-SU

ROUGE-S衡量基于跳跃二元组的共现统计。跳跃二元组是按句子顺序排列的任意单词对,允许两个单词之间存在间隔。这类似于ROUGE-2,但更灵活,因为它不要求二元组连续。例如,在句子‘the cat sat on the mat’中,跳跃二元组包括‘the cat’、‘the sat’、‘the on’、‘cat sat’等。

ROUGE-SU通过添加基于一元组的共现统计扩展了ROUGE-S。这种组合使指标既能捕获单个单词的覆盖率,也能捕获成对关系。‘U’代表一元组,包含一元组有助于避免系统摘要可能具有高跳跃二元组重叠但遗漏重要单个单词的问题。

ROUGE-S和ROUGE-SU在计算上比ROUGE-N更密集,因为它们需要枚举所有可能的跳跃二元组。然而,它们提供了更丰富的文本结构表示,使其适用于评估使用多样化措辞的摘要。

实现与使用

ROUGE软件包用Perl实现,最初由南加州大学信息科学研究所的Chin-Yew Lin开发。该包包含计算所有五种指标的脚本,并提供处理多个参考、词干提取和停用词移除的选项。还有Java实现,因其性能而常用于生产系统。

使用ROUGE时,研究人员通常准备一组参考摘要,通常由多个人工标注者创建以捕获不同的有效摘要。然后将系统生成的摘要与每个参考进行比较,最终分数通常是跨参考的最大值或平均值。最大值与平均值的选择取决于评估协议;例如,DUC任务通常使用最大值以奖励捕获任何可能的参考内容。

ROUGE已成为摘要研究的事实标准,大多数论文报告ROUGE-1、ROUGE-2和ROUGE-L分数。它也用于机器翻译评估,但不如BLEU突出,后者侧重于精确率而非召回率。该指标在Hugging Face的evaluate和nlg-eval等库中广泛实现,使其易于从业者使用。

局限性与批评

尽管广泛使用,ROUGE存在若干已知局限性。它纯粹依赖词汇重叠,因此无法捕获语义等价性。例如,使用同义词或改写的摘要可能得分低于复制参考中确切短语的摘要,即使前者更自然。这导致批评认为ROUGE鼓励抽取式摘要而非抽象式方法。

另一个问题是,ROUGE分数可能因包含常见单词或复制参考的大部分内容而虚高。研究人员提出了变体和替代方案,如BERTScore,它使用Transformer模型的上下文嵌入来衡量语义相似度。然而,ROUGE因其简单性、可解释性和低计算成本而仍然流行。

在大语言模型时代,ROUGE仍用作基线指标,但通常辅以人工评估或其他自动化指标。该指标对召回率的关注使其特别适合完整性重要的任务,如新闻摘要,但不太适合创意或开放式生成。

另见

ROUGE是自然语言处理中更广泛评估指标家族的一部分。相关指标包括BLEU(衡量机器翻译中的精确率)和METEOR(结合同义词匹配和词干提取)。F-Measure(结合精确率和召回率)也相关,NIST指标(BLEU的变体,带有加权n-gram匹配)也是如此。其他相关概念包括名词短语分块和用于语音识别的词错误率(WER)。

在Machine learning和Deep learning的背景下,ROUGE常用于评估基于Neural network的摘要系统,包括基于Transformer (architecture)架构和Large language model的系统。该指标已应用于来自MIT CSAIL和Stanford AI Lab等机构的研究,并且仍然是Generative AI领域的关键工具。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:natural-language-processing·evaluation-metrics·text-summarization·machine-translation
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास