METEOR(具有显式排序的翻译评估指标)是一种用于评估机器翻译输出质量的指标。它基于一元组精确率和召回率的调和平均值计算得分,其中召回率的权重高于精确率,并且除了精确匹配外,还结合了词干提取和同义词匹配。该指标的开发旨在解决BLEU指标的局限性,并在句子或片段级别产生与人工判断更强的相关性,而BLEU旨在实现语料库级别的相关性。
该指标在2005年6月于密歇根州安娜堡举行的第43届计算语言学协会年会上举办的机器翻译与摘要内在及外在评估研讨会上被提出。报告的结果显示,在语料库级别,其与人工判断的相关性高达0.964,而BLEU在同一数据集上的相关性为0.817。在句子级别,报告的最大相关性为0.403。该指标的名称是一个递归缩写,代表“具有显式排序的翻译评估指标”。
动机与设计
METEOR的开发部分是为了回应早期BLEU指标的局限性,该指标已成为机器翻译评估的标准。BLEU主要在语料库级别运作,并依赖精确匹配,其n元组精确率有限。当应用于单个句子时,它与人工判断的相关性较弱。METEOR通过以下方式解决了这些缺陷:在调和平均值中赋予召回率比精确率更高的权重(比例为9比1),结合超越表面形式的语言资源进行匹配,并生成可在片段级别进行有意义比较的得分。
匹配阶段
评分过程从对齐步骤开始。该算法在候选翻译和参考翻译的一元组之间建立映射。候选中的每个一元组最多只能映射到参考中的一个一元组。当存在多个具有相同映射数量的可能对齐时,该算法倾向于选择映射线交叉较少的对齐,这有利于单调、连续的匹配。
匹配阶段
METEOR分几个阶段进行匹配。第一阶段使用精确单词匹配。后续阶段基于词干提取和同义词添加匹配,利用诸如英语的WordNet等资源。每个阶段仅添加在早期阶段尚未匹配的一元组。这种分阶段的方法使该指标能够认可语义等价但词汇表达不同的内容,这是早期指标所缺乏的能力。
算法概述
对齐后,根据匹配的一元组数量计算精确率和召回率。在最终的F均值得分中,召回率的权重高于精确率,使用公式10PR/(R+9P)。该权重反映了召回率与翻译质量的人工判断相关性更强的发现。最终得分通过一个碎片化惩罚进行调整,该惩罚基于匹配一元组的块数;较长的连续匹配产生较少的块和较低的惩罚。
算法概述
该算法在句子对(候选翻译和参考翻译)上运作。它通过在一元组之间建立映射来构建对齐,倾向于交叉较少的对齐。匹配分阶段进行,每个阶段先基于精确词形,然后基于词干,最后基于同义词添加匹配。对齐后,一元组精确率是候选翻译中匹配的一元组数除以候选中的总一元组数,而召回率则是除以参考中的总一元组数。两者通过调和平均值结合,召回率的权重是精确率的九倍。然后根据匹配一元组碎片化为连续块的程度应用惩罚;具有许多非相邻匹配的翻译会获得更高的惩罚,最终得分最多可降低50%。
对于语料库,跨所有片段计算聚合的精确率、召回率和惩罚值。当有多个参考翻译可用时,候选翻译会与每个参考进行评分,并保留最高得分。
与BLEU的比较
BLEU较早提出,衡量n元组重叠并带有简洁性惩罚,在机器翻译研究中被广泛使用。然而,它依赖精确匹配,不考虑同义词或词形变化。METEOR旨在通过使用词干提取和同义词映射,并更重视召回率来克服这些问题。报告实验表明,在语料库级别,METEOR与人工判断的相关性高达0.964,而BLEU在同一数据上的相关性为0.817。在片段级别,METEOR显示的最大相关性为0.403,其支持者认为这更适合评估单个句子。
算法细节
METEOR中的对齐过程将候选翻译中的一元组映射到参考翻译中的一元组,每个候选一元组最多映射到一个参考一元组。该算法选择具有最多映射数量的对齐;当两个对齐具有相同数量的映射时,它选择匹配一元组之间交叉线较少的那个。匹配分阶段进行:首先是精确单词匹配,然后是词干匹配(使用词干提取工具),最后是同义词匹配。每个阶段仅添加在早期阶段尚未匹配的一元组的映射。
计算最终对齐后,计算精确率P和召回率R。F均值Fmean定义为10PR/(R+9P),赋予召回率九倍于精确率的权重。为了考虑流畅性和词序,算法将匹配的一元组分组为尽可能少的块,其中块是在候选和参考中均相邻的一组一元组。惩罚p计算为0.5 × (c/um)^3,其中c是块数,um是匹配的一元组数。最终片段得分是Fmean乘以(1 - p)。
应用与扩展
METEOR已被用于机器翻译的评估活动,特别是在共享任务和系统比较中,句子级别的可靠性很重要。因为它可以在片段级别应用,所以对于调整和分析翻译输出很有用,而语料库级别的指标难以做到这一点。随着时间的推移,出现了各种变体和扩展,包括针对不同语言对和摘要评估量身定制的版本。该指标也影响了相关领域的后续评估方法,例如图像描述,其中同义词匹配和n元组重叠已被证明是有用的。
局限性
该指标仍然依赖参考翻译,并且除了词汇重叠所暗示的内容外,无法捕捉翻译质量的某些方面,例如流畅性。它对预定义同义词资源的依赖可能会限制其在特定领域术语或缺乏此类资源的语言上的性能。虽然在语料库级别与人工判断的相关性在初步实验中被报告为较高,但句子级别的相关性仍为中等,这反映了片段级别自动评估的固有困难。后来的变体和替代指标继续在这些想法的基础上发展。