继 BLEU 和 ROUGE 之后,再来看 METEOR,会发现它试图把两者的优点结合起来,并解决一个核心痛点:完全基于字面 n-gram 匹配,对同义词、词形变化毫无感知。


一、METEOR 是什么?

METEOR 全称 Metric for Evaluation of Translation with Explicit ORdering,即“显式考虑词序的翻译评估指标”。它最初为改善机器翻译评估而生,但现在也常用于文本摘要、图片描述等任务。

它的核心创新在于:

  • 显式对齐:不再是盲目地数 n-gram,而是先在候选和参考之间建立词与词的明确对应关系。

  • 多粒度匹配:除了完全相同的词,还能匹配词干相同的词(如 “kill” 与 “killed”)和同义词(借助 WordNet 等知识库)。

  • 精确率与召回率的加权调和平均:不像 BLEU 侧重精确、ROUGE 侧重召回,METEOR 直接用带权重的 F 值来平衡两者,且通常更偏重召回率。

  • 碎片惩罚:对词序混乱进行直接惩罚,奖励匹配片段更“连贯”的译文。


二、匹配的三个阶段

METEOR 在候选译文和参考译文之间寻找对齐时,会分阶段进行,每个阶段找到的匹配不会在后续阶段被重复使用:

  1. 精确匹配:完全相同的词(可以要求大小写、标点匹配,也可以不要求)。

  2. 词干匹配:词干化后相同(如 “running” 和 “run”)。

  3. 同义词匹配:利用 WordNet 等知识库,识别同义关系(如 “automobile” 和 “car”)。

这种设计使它能够给语义相同但表达不同的译文打出更合理的分数。


三、计算步骤

1. 计算精确率 (P) 与召回率 (R)

假设最终建立的匹配对数量为 mm:

  • 候选译文总词数(去除标点后的词数)为 tt,则 P=m/t。

  • 参考译文总词数为 r,则 R=m/r。

2. 加权调和平均 F 值

METEOR 用带参数 αα 的加权调和平均,公式为:

image

这和标准的 FβFβ​ 度量是相通的。通常 αα 取一个较小值(如 0.9),使得 β=1−αα≈3β=α1−α​​≈3,即召回率的权重是精确率的 9 倍。这体现了翻译评估中“尽量覆盖参考译文含义”的需求。

3. 碎片惩罚 (Fragmentation Penalty)

匹配到的词如果在候选和参考中都是连续的一段,称为一个“块 (chunk)”。块数越少,词序越一致;块数越多,说明词序越破碎。

惩罚项定义为:

image

 

通常 γ=0.5γ=0.5,θ=3θ=3。当所有匹配词都连成一块时,惩罚为 0;完全杂乱时,惩罚接近 γγ。

4. 最终 METEOR 分数

image

分数仍然在 0 到 1 之间,越高越好。


四、一个计算实例

参考译文 (Reference):the cat sat on the mat
候选译文 (Candidate):on the mat sat the cat

  • 去除标点后,参考词数 r=6,候选词数 t=6。

  • 假设全部精确匹配,匹配词集合:the, cat, sat, on, the, mat。注意 “the” 重复了,处理时需要考虑对齐的唯一性。简单起见,假设我们能建立所有 6 个词的一一匹配(即候选是参考的完全重排),则 m=6。

  • 精确率 P=6/6=1.0,召回率 R=6/6=1.0。

  • 取 α=0.9, 

    image

  • 计算块数:候选“on the mat sat the cat”与参考“the cat sat on the mat”的对齐是碎片化的。一种可能的对齐:参考序列位置 1(the) 对应候选位置 5,2(cat)对应6,3(sat)对应4,4(on)对应1,5(the)对应2,6(mat)对应3。这样会形成多个块,例如 “on the mat” 在候选的前三个词可以对应参考的后三个词,这是一块;然后 “sat the cat” 对应参考的前三个词,是另一块。总共 2 块。总匹配数 6。

  • 惩罚 = 0.5 × (2/6)^3 ≈ 0.0185。

  • METEOR = 1.0 × (1 - 0.0185) = 0.9815。

可见,即使词完全一样,词序混乱也会因为碎片惩罚而略微扣分。

如果候选是 “a cat sat on the mat”(增加了一个不匹配的词 “a”,且与参考不同),则需要先做对齐,计算匹配数,得到更低的 P 和 R,最终分数会下降。


五、与 BLEU、ROUGE 的对比

 
指标核心机制主要偏向词序处理同义/词形
BLEU 修正的 n-gram 精确率的几何平均 + 简短惩罚 精确率 n-gram 局部词序 不支持
ROUGE n-gram / LCS 的召回率 (常报告 F1) 召回率 LCS 允许非连续匹配 不支持
METEOR 显式对齐 + 加权调和平均 F 值 + 碎片惩罚 偏重召回率 通过块数直接惩罚碎片化 支持 词干与同义词

METEOR 的最大优势是与人类判断的相关性通常更高,尤其在做单句评估时比 BLEU 稳定。但它依赖于外部知识库(如 WordNet),对没有同义词资源的语言就不够友好。


六、思维衔接

回顾一下,之前你熟悉的 调和平均数 在 METEOR 里直接构成了 F 值的计算基础,而碎片惩罚体现了几何/算术思维对“连贯性”的奖励。
如果把 BLEU 看作“精确度检查器”,ROUGE 看作“覆盖率检查器”,那 METEOR 就是一个“语义对齐检查器”,它更像人类在评估翻译时会做的事:先看词义有没有翻出来,再看语序顺不顺。