METEOR(带显式排序的翻译评估指标)是一种用于评估机器翻译输出质量的指标。它基于一元语法精确率和召回率的调和平均值计算得分,其中召回率的权重高于精确率,并且在精确词语匹配之外还结合了词干提取和同义词匹配。该指标旨在解决BLEU指标的局限性,并在句子或片段层面上与人工判断产生更强的相关性,而BLEU则旨在语料库层面上实现相关性。
该指标于2005年6月在密歇根州安娜堡举行的第43届计算语言学协会年会上举办的机器翻译与摘要的内在和外在评估方法研讨会上提出。报告结果显示,在语料库层面上,其与人工判断的相关性高达0.964,而在相同数据集上BLEU的相关性为0.817。在句子层面上,报告的最大相关性为0.403。该指标的名称是一个递归缩写,代表带显式排序的翻译评估指标。
动机与设计
METEOR的开发部分是为了回应早期BLEU指标的局限性,后者已成为机器翻译评估的标准。BLEU主要作用于语料库层面,依赖精确词语匹配和有限的n元语法精确率。当应用于单个句子时,它与人工判断的相关性较弱。METEOR通过以下方式解决了这些不足:在调和平均值中以9比1的比例加重召回率而非精确率的权重,整合语言学资源以支持超越表面形式的匹配,并生成能够在片段层面进行有意义比较的分数。
评分过程从对齐步骤开始。算法在候选翻译中的一元语法和参考翻译中的一元语法之间构建映射。候选中的每个一元语法最多只能映射到参考中的一个一元语法。当存在多个映射数量相同的对齐时,算法倾向于选择映射线交叉更少的对齐,这有利于单调、连续匹配。
匹配阶段
METEOR分多个阶段应用匹配。第一阶段使用精确词语匹配。后续阶段基于词干提取和同义词添加匹配,利用WordNet等英语资源。每个阶段仅添加尚未在早期阶段匹配的一元语法。这种分阶段方法使指标能够识别语义等价但词汇不同的表达,这是早期指标所缺乏的能力。
对齐后,根据匹配的一元语法数量计算精确率和召回率。在最终的F均值分数中,召回率的权重高于精确率,使用公式10PR/(R+9P)。这一权重反映了研究发现,即召回率与翻译质量中的人工判断相关性更强。最终分数通过由匹配一元语法块数量导出的碎片化惩罚进行调整;较长的连续匹配产生更少的块和更低的惩罚。
算法概述
该算法作用于一对句子:候选翻译和参考翻译。它通过在约束下映射一元语法来构建对齐,并倾向于交叉更少的对齐。匹配分阶段进行,每个阶段基于精确词形、词干、然后是同义词添加匹配。对齐后,一元语法精确率是匹配的一元语法数除以候选中的总一元语法数,而召回率则除以参考中的总一元语法数。这些以调和平均值组合,其中召回率的权重是精确率的九倍。然后根据匹配一元语法被分割成连续块的程度应用惩罚;非相邻匹配较多的翻译会获得更高惩罚,最终分数最多降低50%。
对于语料库,跨所有片段计算聚合精确率、召回率和惩罚值。当有多个参考翻译可用时,候选翻译会与每个参考翻译进行评分,并保留最高分数。
与BLEU的比较
BLEU较早引入,通过简短惩罚测量n元语法重叠,在机器翻译研究中被广泛使用。然而,它依赖精确词语匹配,不考虑同义词或形态变体。METEOR旨在通过使用词干提取和同义词映射以及加重召回率权重来克服这些问题。报告的实验表明,METEOR在语料库层面上与人工判断的相关性高达0.964,而BLEU在相同数据上为0.817。在片段层面上,METEOR的最大相关性为0.403,支持者认为这更适合评估单个句子。
算法细节
METEOR中的对齐过程将候选翻译中的一元语法映射到参考中的一元语法,每个候选一元语法最多映射到一个参考一元语法。算法选择映射数量最多的对齐;当两个对齐具有相同的映射数量时,它选择匹配一元语法之间交叉线更少的那个。匹配分阶段进行:首先是精确词语匹配,然后是词干匹配(使用词干提取工具),最后是同义词匹配。每个阶段仅添加未在先前阶段匹配的一元语法的映射。
计算最终对齐后,计算精确率P和召回率R。调和平均值Fmean定义为10PR/(R+9P),赋予召回率九倍于精确率的权重。为了考虑流畅性和词序,算法将匹配的一元语法分组为尽可能少的块,其中块是在候选和参考中均相邻的一组一元语法。惩罚p计算为0.5 × (c/um)^3,其中c是块数,um是映射的一元语法数。最终片段分数是Fmean乘以(1 - p)。对于语料库,跨所有片段计算聚合值;对于多个参考翻译,保留最高分数。
应用与扩展
METEOR已用于机器翻译的评估活动,特别是在句子层面可靠性重要的共享任务中。由于它可以在片段层面应用,因此适用于调整和分析翻译输出,这是语料库级别指标难以支持的方式。随着时间的推移,出现了各种变体和扩展,包括针对不同语言对和摘要评估定制的版本。该指标也影响了后续评估方法,如图像描述生成等领域,其中同义词匹配和n元语法重叠已被证明有效。
局限性
该指标仍然依赖参考翻译,并且无法捕捉超出词汇重叠所隐含的翻译质量方面。它对预定义同义词资源的依赖可能限制其在专业术语或缺乏此类资源的语言中的表现。虽然初始实验中语料库级别与人工判断的相关性被认为较高,但句子级别的相关性仍然适中,反映了片段级别自动评估的固有难度。后来的变体和替代指标继续在此基础上进行改进。